> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/kimi-k3.md).

# Kimi K3 (2,8T — ce qu'il faut)

Ce qu'est Kimi K3, ce qu'il faut réellement pour auto-héberger 2,8 billions de paramètres, et quoi exécuter à la place sur Clore.ai

{% hint style="danger" %}
**Réponse directe d’abord : Kimi K3 ne tient sur aucun serveur répertorié sur la place de marché Clore.ai, quelle que soit la quantification.** La plus petite version communautaire est un GGUF 1 bit de **466 Go**; le plus gros rig sur la place de marché fait 380 Go. Cette page explique ce qu’est K3, ce que son hébergement exige réellement, et quels modèles vous offrent le plus de capacités sur le matériel que vous pouvez louer aujourd’hui.
{% endhint %}

Moonshot AI a publié **Kimi K3** les poids sur **27 juillet 2026** — le premier modèle ouvert de la classe des 3 000 milliards de paramètres. C’est un véritable jalon, et c’est aussi un point de calibration utile pour voir à quel point les « poids ouverts » et l’« auto-hébergement » se sont éloignés l’un de l’autre.

### Spécifications clés

| Propriété    | Valeur                                                                                                                                           |
| ------------ | ------------------------------------------------------------------------------------------------------------------------------------------------ |
| Paramètres   | 2,8 T au total, 16 des 896 experts actifs par jeton                                                                                              |
| Architecture | Kimi Delta Attention (KDA) + résidus d’attention, Stable LatentMoE, 69 couches KDA + 24 couches MLA à porte                                      |
| Modalité     | Texte, image, vidéo en entrée → texte en sortie                                                                                                  |
| Contexte     | 1 000 000 de tokens                                                                                                                              |
| Licence      | Licence Kimi K3 (personnalisée — l’inférence commerciale au-delà d’environ 20 M$ de chiffre d’affaires annuel nécessite des conditions séparées) |
| Version      | Hébergé le 16 juillet 2026, poids le 27 juillet 2026                                                                                             |
| Poids        | Q8 1 561 Go · Q4\_K\_XL 1 509 Go · Q2\_K\_XL 861 Go · IQ1\_S 594 Go · Q1\_0 466 Go                                                               |

Moonshot affirme environ **une efficacité de mise à l’échelle 2,5× meilleure que celle de Kimi K2** grâce au MoE plus épars et à la pile d’attention KDA, avec un entraînement multimodal natif plutôt qu’une tour de vision ajoutée après coup.

## Ce qu’il faut réellement pour l’héberger

| Version                  | Taille   | Matériel nécessaire          |
| ------------------------ | -------- | ---------------------------- |
| `UD-Q8_K_XL`             | 1 561 Go | \~20× H100 80 Go             |
| `UD-Q4_K_XL`             | 1 509 Go | \~20× H100 80 Go             |
| `UD-Q2_K_XL`             | 861 Go   | \~11× H100 80 Go, ou 8× H200 |
| `UD-IQ1_S`               | 594 Go   | \~8× H100 80 Go              |
| `UD-Q1_0`                | 466 Go   | \~6× H100 80 Go              |
| `mgoin/Kimi-K3-pruned75` | 475 Go   | \~6× H100 80 Go              |

À titre de référence, les plus gros rigs de la place de marché Clore.ai sont des configurations 4× RTX PRO 6000 Blackwell (380 Go) et 11× RTX 5090 (341 Go). Même la version 1 bit les dépasse, et de toute façon une quantification 1 bit d’un modèle de pointe n’est pas une cible sérieuse pour la production.

{% hint style="info" %}
**Si vous devez réellement servir K3**, c’est une [bare metal](https://clore.ai/bare-metal) conversation — des nœuds H200 ou B200 dédiés, provisionnés sur demande plutôt que loués à la minute. Vérifiez d’abord la licence : les conditions restreignent l’inférence commerciale au-delà d’environ 20 M$ de chiffre d’affaires annuel.
{% endhint %}

## Qu’exécuter à la place sur Clore.ai

| Si vous vouliez K3 pour…             | Exécutez ceci                                                                                                           | Tient sur                       |
| ------------------------------------ | ----------------------------------------------------------------------------------------------------------------------- | ------------------------------- |
| Codage de pointe et agents           | [GLM-5.2](/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md) — MIT, contexte de 1 M, meilleurs scores de codage ouvert | rig 10× RTX 5090, env. 5,00 $/h |
| Multimodal à long contexte           | [MiniMax M3](/guides/guides_v2-fr/modeles-de-langage/minimax-m3.md) — contexte de 1 M, vidéo native                     | 8× RTX 5090, env. 2,00–3,50 $/h |
| Raisonnement ouvert à grande échelle | [Nemotron 3 Ultra](/guides/guides_v2-fr/modeles-de-langage/nemotron-3-ultra.md) — 550B, licence OpenMDW                 | 4× RTX PRO 6000, env. 5,00 $/h  |
| Un modèle sur une carte              | [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md) — Apache 2.0, vision, contexte de 262 K            | 1× RTX 4090, 0,14–0,42 $/h      |
| Meilleure qualité par Go loué        | [Mistral Small 4](/guides/guides_v2-fr/modeles-de-langage/mistral-small4.md) — 119B / 6,5B actifs                       | 2× RTX 4090, 0,28–0,84 $/h      |

Le résumé honnête : depuis juin 2026, la frontière ouverte s’est scindée. Des modèles comme GLM-5.2 et Nemotron 3 Ultra se situent à la limite de ce qu’un gros rig grand public peut contenir ; K3 va au-delà. La plupart de l’écart pratique entre eux se comble avec un bon harness et un long contexte, que les modèles ci-dessus vous offrent tous deux.

## Utiliser K3 sans l’héberger

Moonshot fournit K3 via l’application Kimi, Kimi Code et son API. Si vous construisez sur Clore.ai, une approche courante consiste à garder les appels coûteux aux modèles de pointe sur une API et à exécuter localement sur un GPU loué le chemin à fort volume — voir la comparaison des coûts dans [Gemini 3.1 Flash Lite](/guides/guides_v2-fr/modeles-de-langage/gemini-3-1-flash-lite.md), qui explique à quel moment l’auto-hébergement l’emporte réellement.

## Étapes suivantes

* [GLM-5.2](/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md) — le plus gros modèle que vous pouvez raisonnablement louer ici
* [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) — quelle est la limite actuelle
* [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md) — le cheval de trait sur carte unique
* [Kimi K2.5](/guides/guides_v2-fr/modeles-de-langage/kimi-k2.md) — la génération précédente, bien plus maniable

### Liens

* [Kimi K3 sur Hugging Face](https://huggingface.co/moonshotai/Kimi-K3) · [Versions GGUF](https://huggingface.co/unsloth/Kimi-K3-GGUF)
* [Licence Kimi K3](https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE)
* **Louez un GPU :** [Place de marché](https://clore.ai/marketplace) · [Bare metal](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/kimi-k3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
