MLC-LLM
एमएल संकलन के माध्यम से सार्वभौमिक LLM परिनियोजन — मशीन लर्निंग संकलन का उपयोग करके किसी भी हार्डवेयर पर अधिकतम प्रदर्शन के साथ किसी भी बड़े भाषा मॉडल को चलाएँ।
🌟 20,000+ GitHub स्टार्स | MLC AI टीम द्वारा अनुरक्षित | Apache-2.0 लाइसेंस
MLC-LLM क्या है?
MLC-LLM (बड़े भाषा मॉडलों के लिए मशीन लर्निंग संकलन) एक सार्वभौमिक फ्रेमवर्क है जो विविध हार्डवेयर बैकएंड्स पर बड़े भाषा मॉडलों के कुशल परिनियोजन को सक्षम बनाता है। इसका उपयोग करके TVM (टेंसर वर्चुअल मशीन) को अपने संकलन बैकएंड के रूप में, MLC-LLM LLM मॉडलों को सीधे मूल हार्डवेयर कोड में संकलित करता है — हार्डवेयर-विशिष्ट इंजीनियरिंग के बिना लगभग-इष्टतम प्रदर्शन प्राप्त करते हुए।
मुख्य क्षमताएँ
सार्वभौमिक हार्डवेयर समर्थन — NVIDIA CUDA, AMD ROCm, Apple Metal, Vulkan, WebGPU
OpenAI-संगत REST API — मौजूदा वर्कफ़्लो के लिए बिना बदलाव वाला प्रतिस्थापन
कई मॉडल प्रारूप — Llama, Mistral, Gemma, Phi, Qwen, Falcon, और भी बहुत कुछ
4-बिट / 8-बिट क्वांटीकरण — उपभोक्ता GPU पर बड़े मॉडल चलाएँ
चैट इंटरफ़ेस — तुरंत परीक्षण के लिए अंतर्निर्मित वेब UI
Python और CLI उपकरण — लचीले एकीकरण विकल्प
Clore.ai पर MLC-LLM का उपयोग क्यों करें?
Clore.ai GPU मार्केटप्लेस आपको प्रतिस्पर्धी किराया दरों पर उच्च-प्रदर्शन NVIDIA GPUs तक पहुँच देता है। MLC-LLM का संकलन दृष्टिकोण हर GPU से अधिकतम थ्रूपुट निकालता है — जिससे यह इनके लिए आदर्श बनता है:
पैमाने पर प्रोडक्शन API इन्फ़रेंस
मॉडल आकारों में अनुसंधान और बेंचमार्किंग
क्वांटाइज़्ड मॉडलों के साथ लागत-प्रभावी सर्विंग
एक ही GPU इंस्टेंस पर बहु-मॉडल परिनियोजन
Clore.ai पर त्वरित शुरुआत
चरण 1: एक GPU सर्वर खोजें
पर जाएँ clore.ai मार्केटप्लेस
सर्वर फ़िल्टर करें: NVIDIA GPU, न्यूनतम 8GB VRAM (7B+ मॉडल के लिए 16GB+ अनुशंसित)
सर्वोत्तम प्रदर्शन के लिए: RTX 3090, RTX 4090, A100, या H100
चरण 2: MLC-LLM परिनियोजित करें
अपनी Clore.ai ऑर्डर कॉन्फ़िगरेशन में NVIDIA CUDA बेस इमेज का उपयोग करें:
पोर्ट मैपिंग:
22
SSH पहुँच
8000
REST API सर्वर
अनुशंसित पर्यावरण चर:
स्टार्टअप स्क्रिप्ट (SSH के बाद चलाएँ):
चरण 3: SSH के माध्यम से कनेक्ट करें
इंस्टॉलेशन और सेटअप
विकल्प A: पहले से संकलित मॉडल उपयोग करें (सबसे तेज़)
MLC-AI Hugging Face पर पहले से संकलित मॉडलों की एक लाइब्रेरी रखता है। संकलन की आवश्यकता नहीं:
विकल्प B: अपना मॉडल संकलित करें
कस्टम मॉडलों या विशिष्ट क्वांटाइज़ेशन आवश्यकताओं के लिए:
API सर्वर चलाना
OpenAI-संगत सर्वर शुरू करें
सर्वर स्टार्टअप आउटपुट
उपलब्ध API एंडपॉइंट
/v1/chat/completions
POST
चैट पूर्णताएँ (OpenAI प्रारूप)
/v1/completions
POST
पाठ पूर्णताएँ
/v1/models
GET
उपलब्ध मॉडल सूचीबद्ध करें
/v1/debug/dump_event_trace
GET
प्रदर्शन डिबगिंग
API उपयोग उदाहरण
चैट पूर्णताएँ (Python)
स्ट्रीमिंग प्रतिक्रिया
cURL उदाहरण
उपलब्ध पहले से संकलित मॉडल
MLC-AI Hugging Face पर उपयोग के लिए तैयार संकलित मॉडल प्रदान करता है:
Llama 3 श्रृंखला
Mistral / Mixtral
Gemma
Phi
पूर्ण मॉडल सूची: सभी पहले से संकलित मॉडल यहाँ देखें huggingface.co/mlc-ai
क्वांटाइज़ेशन विकल्प
MLC-LLM कई क्वांटाइज़ेशन योजनाओं का समर्थन करता है। अपने VRAM बजट के आधार पर चुनें:
q4f16_1
4-बिट
★★★★☆
~4GB
~7GB
q4f32_1
4-बिट (f32 संचय)
★★★★☆
~4GB
~7GB
q8f16_1
8-बिट
★★★★★
~8GB
~14GB
q0f16
16-बिट (कोई क्वांट नहीं)
★★★★★
~14GB
~26GB
q0f32
32-बिट (कोई क्वांट नहीं)
★★★★★
~28GB
~52GB
VRAM अनुशंसा: CUDA ओवरहेड और KV कैश के लिए हमेशा 2–3GB का हेडरूम छोड़ें। q4f16_1 7B मॉडल को सामान्य वर्कलोड पर कुल मिलाकर लगभग 6–7GB की आवश्यकता होती है।
मल्टी-GPU परिनियोजन
कई GPUs की आवश्यकता वाले बड़े मॉडलों (70B+) के लिए:
परिनियोजन से पहले GPU टोपोलॉजी जाँचें:
वेब चैट इंटरफ़ेस
MLC-LLM में एक अंतर्निर्मित वेब UI शामिल है, जो सर्वर चालू होते ही उपलब्ध हो जाता है:
UI यहाँ खोलें: http://<clore-node-ip>:<api-port>
प्रदर्शन ट्यूनिंग
बैच आकार अनुकूलित करें
GPU उपयोगिता की निगरानी करें
थ्रूपुट बेंचमार्क करें
Docker Compose सेटअप
Clore.ai पर उत्पादन-तैयार परिनियोजन के लिए, pip के माध्यम से MLC-LLM इंस्टॉल की गई NVIDIA CUDA बेस इमेज का उपयोग करें:
समस्या निवारण
मॉडल डाउनलोड विफल
मेमोरी समाप्त (OOM)
CUDA संस्करण मेल नहीं खा रहा
आम गलती: MLC-LLM pip wheels CUDA संस्करण-विशिष्ट होते हैं। सुनिश्चित करें कि अपने सर्वर के CUDA संस्करण से मेल खाने वाला सही वैरिएंट इंस्टॉल करें। उपलब्ध wheels यहाँ देखें mlc.ai/wheels.
सर्वर तक पहुँचा नहीं जा सका
Clore.ai GPU अनुशंसाएँ
MLC-LLM का संकलन दृष्टिकोण हर GPU स्तर पर लगभग-इष्टतम थ्रूपुट प्रदान करता है। मॉडल आकार और बजट के आधार पर चुनें:
RTX 3090
24 GB
$0.07–0.21/hr
7B–13B मॉडल, बजट सर्विंग
~85 tok/s
RTX 4090
24 GB
$0.14–0.42/hr
7B–34B मॉडल, तेज़ सर्विंग
~140 tok/s
H100 SXM
80 GB
~$1.04/घंटा
अधिकतम थ्रूपुट, FP8
~280 tok/s
अनुशंसित प्रारंभिक बिंदु: $0.07–0.21/घंटा पर RTX 3090, MLC-LLM के माध्यम से Llama 3 8B और Mistral 7B सर्विंग के लिए मूल्य-प्रदर्शन अनुपात के लिहाज़ से सबसे अच्छा है। संकलित कर्नेल्स उपभोक्ता GPUs से लगभग-अधिकतम उपयोगिता निकालते हैं।
70B मॉडलों के लिए (उदा., Llama 3 70B Q4): A100 40GB (bare metal) या tensor parallelism के माध्यम से दो RTX 3090s का उपयोग करें।
संसाधन
📦 Pip व्हील्स: mlc.ai/wheels (pip के माध्यम से इंस्टॉल करें, Docker Hub इमेज उपलब्ध नहीं है)
🐙 GitHub: github.com/mlc-ai/mlc-llm
📚 दस्तावेज़ीकरण: llm.mlc.ai/docs
🤗 पहले से संकलित मॉडल: huggingface.co/mlc-ai
💬 Discord: discord.gg/9Xpy2HGBuD
अंतिम अपडेट
क्या यह उपयोगी था?