For the complete documentation index, see llms.txt. This page is also available as Markdown.

Kimi K2.5

Clore.ai GPUs पर Moonshot AI द्वारा Kimi K2.5 (1T MoE मल्टिमोडल) डिप्लॉय करें

Moonshot AI द्वारा 27 जनवरी 2026 को जारी Kimi K2.5 एक 1-ट्रिलियन पैरामीटर वाला Mixture-of-Experts बहु-मोडीय मॉडल प्रति टोकन 32B सक्रिय पैरामीटरों के साथ। Kimi-K2-Base के ऊपर ~15 ट्रिलियन मिश्रित विज़ुअल और टेक्स्ट टोकनों पर सतत प्री-ट्रेनिंग के माध्यम से निर्मित, यह मूल रूप से टेक्स्ट, छवियों और वीडियो को समझता है। K2.5 प्रस्तुत करता है एजेंट स्वॉर्म तकनीक — एक साथ 100 तक विशेषीकृत AI एजेंटों का समन्वय करती है — और कोडिंग (76.8% SWE-bench Verified), विज़न और एजेंटिक कार्यों में अग्रणी-स्तर का प्रदर्शन हासिल करती है। एक के अंतर्गत उपलब्ध ओपन-वेट लाइसेंस HuggingFace पर।

मुख्य विशेषताएँ

  • कुल 1T / 32B सक्रिय — MLA अटेंशन और SwiGLU के साथ 384-विशेषज्ञ MoE आर्किटेक्चर

  • नेटिव मल्टीमोडल — विज़न–भाषा टोकनों पर प्री-ट्रेंड; छवियाँ, वीडियो और टेक्स्ट समझता है

  • एजेंट स्वॉर्म — गतिशील रूप से उत्पन्न एजेंटों के माध्यम से जटिल कार्यों को समानांतर उप-कार्यों में विभाजित करता है

  • 256K संदर्भ विंडो — पूरे कोडबेस, लंबे दस्तावेज़ और वीडियो ट्रांसक्रिप्ट संसाधित करें

  • हाइब्रिड रीजनिंग — इंस्टेंट मोड (तेज़) और थिंकिंग मोड (गहन तर्क) दोनों का समर्थन करता है

  • मज़बूत कोडिंग — 76.8% SWE-bench Verified, 73.0% SWE-bench Multilingual

आवश्यकताएँ

Kimi K2.5 एक विशाल मॉडल है — FP8 चेकपॉइंट ~630GB का है। सेल्फ-होस्टिंग के लिए गंभीर हार्डवेयर की आवश्यकता होती है।

घटक
क्वांटाइज़्ड (GGUF Q2)
FP8 पूर्ण

GPU

1× RTX 4090 + 256GB RAM

8× H200 141GB

VRAM

24GB + CPU ऑफलोड

1,128GB

RAM

256GB+

256GB

डिस्क

400GB SSD

700GB NVMe

CUDA

12.8+

12.8+

Clore.ai अनुशंसा: पूर्ण-सटीक सर्विंग के लिए, 8× H200 किराए पर लें (bare metal). क्वांटाइज़्ड स्थानीय इन्फेरेंस के लिए, एकल H100 80GB या यहाँ तक कि RTX 4090 + भारी CPU ऑफलोडिंग कम गति पर काम करता है.

llama.cpp के साथ क्विक स्टार्ट (क्वांटाइज़्ड)

K2.5 को स्थानीय रूप से चलाने का सबसे सुलभ तरीका — Unsloth की GGUF क्वांटाइज़ेशन का उपयोग करके:

नोट: K2.5 के लिए GGUF/llama.cpp में विज़न अभी समर्थित नहीं है। बहु-मोडीय सुविधाओं के लिए vLLM का उपयोग करें.

vLLM सेटअप (प्रोडक्शन — पूर्ण मॉडल)

पूर्ण बहु-मोडीय समर्थन के साथ प्रोडक्शन सर्विंग के लिए:

8× H200 GPU पर सर्व करें

टेक्स्ट के साथ क्वेरी करें

छवि के साथ क्वेरी करें (बहु-मोडीय)

API एक्सेस (GPU की आवश्यकता नहीं)

यदि सेल्फ-होस्टिंग ज़रूरत से ज़्यादा हो, तो Moonshot का आधिकारिक API उपयोग करें:

टूल कॉलिंग

K2.5 एजेंटिक टूल उपयोग में उत्कृष्ट है:

Docker त्वरित शुरुआत

Clore.ai उपयोगकर्ताओं के लिए सुझाव

  • API बनाम सेल्फ-होस्टिंग का ट्रेड-ऑफ़: पूर्ण K2.5 के लिए 8× H200 पर bare metal. Moonshot का API फ़्री-टियर या पे-पर-टोकन है — अन्वेषण के लिए API का उपयोग करें, और निरंतर प्रोडक्शन लोड के लिए सेल्फ-होस्ट करें.

  • एकल GPU पर क्वांटाइज़्ड: Unsloth GGUF Q2_K_XL (~375GB) CPU ऑफलोडिंग के माध्यम से 256GB RAM के साथ RTX 4090 ($0.14–0.42/घंटा) पर चल सकता है — ~5–10 tok/s की अपेक्षा करें। व्यक्तिगत उपयोग और विकास के लिए पर्याप्त है.

  • बजट सेटअप के लिए केवल-टेक्स्ट K2: यदि आपको विज़न की आवश्यकता नहीं है, moonshotai/Kimi-K2-Instruct यह केवल-टेक्स्ट पूर्ववर्ती है — वही 1T MoE, लेकिन डिप्लॉय करने में हल्का (विज़न एन्कोडर का ओवरहेड नहीं).

  • तापमान सही सेट करें: उपयोग करें temperature=0.6 इंस्टेंट मोड के लिए, temperature=1.0 थिंकिंग मोड के लिए। गलत तापमान से पुनरावृत्ति या असंगति होती है.

  • थ्रूपुट के लिए एक्सपर्ट पैरेललिज़्म: मल्टी-नोड सेटअप पर, उपयोग करें --enable-expert-parallel उच्च थ्रूपुट के लिए vLLM में। EP कॉन्फ़िगरेशन के लिए vLLM दस्तावेज़ देखें.

समस्या निवारण

समस्या
समाधान

OutOfMemoryError पूर्ण मॉडल के साथ

8× H200 (कुल 1128GB) की आवश्यकता है। FP8 वज़न का उपयोग करें, सेट करें --gpu-memory-utilization 0.90.

GGUF इन्फेरेंस बहुत धीमा

क्वांट आकार के लिए पर्याप्त RAM सुनिश्चित करें। Q2_K_XL को लगभग 375GB RAM+VRAM संयुक्त रूप से चाहिए.

llama.cpp में विज़न काम नहीं कर रहा

K2.5 GGUF के लिए विज़न समर्थन अभी उपलब्ध नहीं है — बहु-मोडीय के लिए vLLM का उपयोग करें.

दोहराव वाला आउटपुट

सेट करें temperature=0.6 (तुरंत) या 1.0 (थिंकिंग). जोड़ें min_p=0.01.

मॉडल डाउनलोड होने में बहुत समय लगता है

~630GB FP8 चेकपॉइंट। उपयोग करें huggingface-cli download के साथ --resume-download.

टूल कॉल्स पार्स नहीं हुए

जोड़ें --tool-call-parser kimi_k2 --enable-auto-tool-choice को vLLM सर्व कमांड में जोड़ें.

अधिक पढ़ें

अंतिम अपडेट

क्या यह उपयोगी था?