> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/kimi-k3.md).

# Kimi K3 (2.8T — इसके लिए क्या चाहिए)

Kimi K3 क्या है, 2.8 ट्रिलियन पैरामीटर को स्वयं होस्ट करने के लिए वास्तव में क्या चाहिए, और इसके बजाय Clore.ai पर क्या चलाना चाहिए

{% hint style="danger" %}
**सीधा जवाब पहले: Kimi K3 Clore.ai मार्केटप्लेस पर सूचीबद्ध किसी भी सर्वर में, किसी भी क्वांटाइज़ेशन पर, फिट नहीं बैठता।** सबसे छोटा समुदाय-निर्मित बिल्ड 1-बिट GGUF है, **466GB**; मार्केटप्लेस पर सबसे बड़ा रिग 380GB का है। यह पेज बताता है कि K3 क्या है, इसे होस्ट करने के लिए वास्तव में क्या चाहिए, और आज आप जो हार्डवेयर किराए पर ले सकते हैं, उस पर कौन से मॉडल आपको सबसे ज़्यादा क्षमता देते हैं।
{% endhint %}

Moonshot AI ने प्रकाशित किया **Kimi K3** वेट्स **27 जुलाई 2026** — 3-ट्रिलियन-पैरामीटर वर्ग का पहला ओपन मॉडल। यह एक वास्तविक मील का पत्थर है, और यह इस बात के लिए भी एक उपयोगी कैलिब्रेशन बिंदु है कि "ओपन वेट्स" और "सेल्फ-होस्टेबल" एक-दूसरे से कितनी दूर जा चुके हैं।

### मुख्य विनिर्देश

| गुण         | मान                                                                                                       |
| ----------- | --------------------------------------------------------------------------------------------------------- |
| पैरामीटर    | कुल 2.8T, प्रति टोकन 896 में से 16 विशेषज्ञ सक्रिय                                                        |
| आर्किटेक्चर | Kimi Delta Attention (KDA) + Attention Residuals, Stable LatentMoE, 69 KDA + 24 Gated MLA लेयर्स          |
| मॉडैलिटी    | पाठ, छवि, वीडियो इन → पाठ आउट                                                                             |
| संदर्भ      | 1,000,000 टोकन                                                                                            |
| लाइसेंस     | Kimi K3 लाइसेंस (कस्टम — लगभग $20M वार्षिक राजस्व से ऊपर कमर्शियल इन्फ़रेंस के लिए अलग शर्तें आवश्यक हैं) |
| रिलीज़      | 16 जुलाई 2026 को होस्ट किया गया, वेट्स 27 जुलाई 2026                                                      |
| वज़न        | Q8 1,561GB · Q4\_K\_XL 1,509GB · Q2\_K\_XL 861GB · IQ1\_S 594GB · Q1\_0 466GB                             |

Moonshot का दावा है कि लगभग **Kimi K2 की तुलना में 2.5× बेहतर स्केलिंग दक्षता** यह अधिक विरल MoE और KDA अटेंशन स्टैक से आता है, जिसमें बाद में जोड़े गए विज़न टावर के बजाय मूल बहु-माध्यमिक प्रशिक्षण है।

## इसे वास्तव में होस्ट करने के लिए क्या चाहिए

| बिल्ड                    | आकार    | आवश्यक हार्डवेयर               |
| ------------------------ | ------- | ------------------------------ |
| `UD-Q8_K_XL`             | 1,561GB | लगभग 20× H100 80GB             |
| `UD-Q4_K_XL`             | 1,509GB | लगभग 20× H100 80GB             |
| `UD-Q2_K_XL`             | 861GB   | लगभग 11× H100 80GB, या 8× H200 |
| `UD-IQ1_S`               | 594GB   | लगभग 8× H100 80GB              |
| `UD-Q1_0`                | 466GB   | लगभग 6× H100 80GB              |
| `mgoin/Kimi-K3-pruned75` | 475GB   | लगभग 6× H100 80GB              |

संदर्भ के लिए, Clore.ai मार्केटप्लेस के सबसे बड़े रिग 4× RTX PRO 6000 Blackwell (380GB) और 11× RTX 5090 (341GB) हैं। 1-बिट बिल्ड भी उनसे बड़ा है, और वैसे भी किसी फ्रंटियर मॉडल का 1-बिट क्वांटाइज़ेशन गंभीर प्रोडक्शन लक्ष्य नहीं है।

{% hint style="info" %}
**अगर आपको सचमुच K3 सर्व करना है**तो यह एक [bare metal](https://clore.ai/bare-metal) बातचीत है — समर्पित H200 या B200 नोड, जो प्रति मिनट किराए पर लेने के बजाय अनुरोध पर प्रोविजन किए जाते हैं। पहले लाइसेंस जाँचें: शर्तें लगभग $20M वार्षिक राजस्व से ऊपर कमर्शियल इन्फ़रेंस को सीमित करती हैं।
{% endhint %}

## इसके बजाय Clore.ai पर क्या चलाएँ

| अगर आप K3 को … के लिए चाहते थे          | इसे चलाएँ                                                                                            | इस पर फिट बैठता है                |
| --------------------------------------- | ---------------------------------------------------------------------------------------------------- | --------------------------------- |
| फ्रंटियर कोडिंग और एजेंट्स              | [GLM-5.2](/guides/guides_v2-hi/language-models/glm-5-2.md) — MIT, 1M ctx, शीर्ष ओपन कोडिंग स्कोर     | 10× RTX 5090 रिग, लगभग $5.00/घंटा |
| लंबे-संदर्भ वाला बहु-माध्यमिक           | [MiniMax M3](/guides/guides_v2-hi/language-models/minimax-m3.md) — 1M ctx, मूल वीडियो                | 8× RTX 5090, लगभग $2.00–3.50/घंटा |
| बड़े पैमाने पर ओपन रीजनिंग              | [Nemotron 3 Ultra](/guides/guides_v2-hi/language-models/nemotron-3-ultra.md) — 550B, OpenMDW लाइसेंस | 4× RTX PRO 6000, लगभग $5.00/घंटा  |
| एक कार्ड पर एक मॉडल                     | [Qwen3.8-27B](/guides/guides_v2-hi/language-models/qwen38-27b.md) — Apache 2.0, विज़न, 262K ctx      | 1× RTX 4090, $0.14–0.42/घंटा      |
| किराए के प्रति GB पर सर्वोत्तम गुणवत्ता | [Mistral Small 4](/guides/guides_v2-hi/language-models/mistral-small4.md) — 119B / 6.5B सक्रिय       | 2× RTX 4090, $0.28–0.84/घंटा      |

ईमानदार सारांश: जून 2026 से ओपन फ्रंटियर दो हिस्सों में बँट गया है। GLM-5.2 और Nemotron 3 Ultra जैसे मॉडल उस सीमा पर हैं जो एक बड़ा कंज़्यूमर रिग संभाल सकता है; K3 उससे आगे है। उनके बीच का अधिकांश व्यावहारिक अंतर एक अच्छे हार्नेस और लंबे कॉन्टेक्स्ट से कम हो जाता है, और ऊपर दिए गए मॉडल आपको ये दोनों देते हैं।

## इसे होस्ट किए बिना K3 का उपयोग

Moonshot K3 को Kimi ऐप, Kimi Code और उसके API के ज़रिए उपलब्ध कराता है। अगर आप Clore.ai पर बना रहे हैं, तो एक आम तरीका है महँगे फ्रंटियर कॉल्स को API पर रखना और उच्च-मात्रा वाले पथ को किराए की GPU पर लोकल चलाना — देखें लागत तुलना [जेमिनी 3.1 फ्लैश लाइट](/guides/guides_v2-hi/language-models/gemini-3-1-flash-lite.md)जो बताता है कि सेल्फ-होस्टिंग वास्तव में कब फायदेमंद होती है।

## अगले चरण

* [GLM-5.2](/guides/guides_v2-hi/language-models/glm-5-2.md) — सबसे बड़ा मॉडल जिसे आप यहाँ यथार्थतः किराए पर ले सकते हैं
* [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) — अभी सीमा क्या है
* [Qwen3.8-27B](/guides/guides_v2-hi/language-models/qwen38-27b.md) — एकल-कार्ड वर्कहॉर्स
* [Kimi K2.5](/guides/guides_v2-hi/language-models/kimi-k2.md) — पिछली पीढ़ी, कहीं अधिक संभालने योग्य

### लिंक्स

* [हगिंग फेस पर Kimi K3](https://huggingface.co/moonshotai/Kimi-K3) · [GGUF बिल्ड](https://huggingface.co/unsloth/Kimi-K3-GGUF)
* [Kimi K3 लाइसेंस](https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE)
* **GPU किराये पर लें:** [मार्केटप्लेस](https://clore.ai/marketplace) · [बेयर मेटल](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/kimi-k3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
