> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/kimi-k3.md).

# Kimi K3 (2.8T — Lo que hace falta)

Qué es Kimi K3, lo que realmente hace falta para autoalojar 2.8 billones de parámetros y qué ejecutar en su lugar en Clore.ai

{% hint style="danger" %}
**Respuesta directa primero: Kimi K3 no cabe en ningún servidor listado en el marketplace de Clore.ai, en ninguna cuantización.** La compilación comunitaria más pequeña es un GGUF de 1 bit en **466GB**; el equipo más grande del marketplace es de 380GB. Esta página explica qué es K3, lo que realmente requiere alojarlo y qué modelos te brindan la mayor capacidad en hardware que puedes alquilar hoy.
{% endhint %}

Moonshot AI publicó **Kimi K3** pesos el **27 de julio de 2026** — el primer modelo abierto en la clase de 3 billones de parámetros. Es un hito real y también un punto de calibración útil para ver hasta qué punto se han distanciado "pesos abiertos" y "autoalojable".

### Especificaciones clave

| Propiedad    | Valor                                                                                                                                            |
| ------------ | ------------------------------------------------------------------------------------------------------------------------------------------------ |
| Parámetros   | 2.8T totales, 16 de 896 expertos activos por token                                                                                               |
| Arquitectura | Kimi Delta Attention (KDA) + residuales de atención, Stable LatentMoE, 69 capas KDA + 24 capas MLA con compuerta                                 |
| Modalidad    | Texto, imagen, video de entrada → texto de salida                                                                                                |
| Contexto     | 1.000.000 tokens                                                                                                                                 |
| Licencia     | licencia de Kimi K3 (personalizada — la inferencia comercial por encima de aproximadamente $20M en ingresos anuales requiere términos separados) |
| Lanzamiento  | Alojado el 16 de julio de 2026, pesos el 27 de julio de 2026                                                                                     |
| Pesos        | Q8 1,561GB · Q4\_K\_XL 1,509GB · Q2\_K\_XL 861GB · IQ1\_S 594GB · Q1\_0 466GB                                                                    |

Moonshot afirma aproximadamente **2,5× mejor eficiencia de escalado que Kimi K2** debido al MoE más escaso y al conjunto de atención KDA, con entrenamiento multimodal nativo en lugar de una torre de visión añadida posteriormente.

## Lo que realmente se necesita para alojarlo

| Versión                  | Tamaño  | Hardware necesario         |
| ------------------------ | ------- | -------------------------- |
| `UD-Q8_K_XL`             | 1,561GB | \~20× H100 80GB            |
| `UD-Q4_K_XL`             | 1,509GB | \~20× H100 80GB            |
| `UD-Q2_K_XL`             | 861GB   | \~11× H100 80GB, o 8× H200 |
| `UD-IQ1_S`               | 594GB   | \~8× H100 80GB             |
| `UD-Q1_0`                | 466GB   | \~6× H100 80GB             |
| `mgoin/Kimi-K3-pruned75` | 475GB   | \~6× H100 80GB             |

Como referencia, los equipos más grandes del marketplace de Clore.ai son 4× RTX PRO 6000 Blackwell (380GB) y 11× RTX 5090 (341GB). Incluso la compilación de 1 bit los supera, y de todos modos una cuantización de 1 bit de un modelo de frontera no es un objetivo serio de producción.

{% hint style="info" %}
**Si realmente necesitas servir K3**, eso es una [bare metal](https://clore.ai/bare-metal) conversación — nodos H200 o B200 dedicados, aprovisionados bajo demanda en lugar de alquilados por minuto. Revisa primero la licencia: los términos limitan la inferencia comercial por encima de aproximadamente $20M en ingresos anuales.
{% endhint %}

## Qué ejecutar en Clore.ai en su lugar

| Si querías K3 para…                  | Ejecuta esto                                                                                                                            | Cabe en                           |
| ------------------------------------ | --------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------- |
| Codificación y agentes de vanguardia | [GLM-5.2](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md) — MIT, 1M de contexto, las mejores puntuaciones abiertas en codificación | equipo de 10× RTX 5090, \~$5.00/h |
| Multimodal de largo contexto         | [MiniMax M3](/guides/guides_v2-es/modelos-de-lenguaje/minimax-m3.md) — 1M de contexto, video nativo                                     | 8× RTX 5090, \~$2.00–3.50/h       |
| Razonamiento abierto a escala        | [Nemotron 3 Ultra](/guides/guides_v2-es/modelos-de-lenguaje/nemotron-3-ultra.md) — 550B, licencia OpenMDW                               | 4× RTX PRO 6000, \~$5.00/h        |
| Un modelo en una sola tarjeta        | [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md) — Apache 2.0, visión, 262K de contexto                            | 1× RTX 4090, $0.14–0.42/h         |
| Mejor calidad por GB alquilado       | [Mistral Small 4](/guides/guides_v2-es/modelos-de-lenguaje/mistral-small4.md) — 119B / 6.5B activos                                     | 2× RTX 4090, $0.28–0.84/h         |

El resumen honesto: desde junio de 2026 el frente abierto se ha dividido. Modelos como GLM-5.2 y Nemotron 3 Ultra están al borde de lo que puede alojar un gran equipo de consumo; K3 está más allá. La mayor parte de la brecha práctica entre ellos se cierra con un buen andamiaje y un contexto largo, ambos de los cuales te los dan los modelos de arriba.

## Usar K3 sin alojarlo

Moonshot ofrece K3 a través de la app Kimi, Kimi Code y su API. Si estás construyendo en Clore.ai, un patrón común es mantener las llamadas costosas de vanguardia en una API y ejecutar la ruta de alto volumen localmente en una GPU alquilada — consulta la comparación de costos en [Gemini 3.1 Flash Lite](/guides/guides_v2-es/modelos-de-lenguaje/gemini-3-1-flash-lite.md), que explica cuándo realmente gana el autoalojamiento.

## Siguientes pasos

* [GLM-5.2](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md) — el modelo más grande que puedes alquilar aquí de forma realista
* [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) — cuál es el techo ahora mismo
* [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md) — el caballo de batalla de una sola tarjeta
* [Kimi K2.5](/guides/guides_v2-es/modelos-de-lenguaje/kimi-k2.md) — la generación anterior, mucho más manejable

### Enlaces

* [Kimi K3 en Hugging Face](https://huggingface.co/moonshotai/Kimi-K3) · [compilaciones GGUF](https://huggingface.co/unsloth/Kimi-K3-GGUF)
* [licencia de Kimi K3](https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE)
* **Alquila una GPU:** [Marketplace](https://clore.ai/marketplace) · [Hardware dedicado](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/kimi-k3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
