For the complete documentation index, see llms.txt. This page is also available as Markdown.

MLC-LLM

एमएल संकलन के माध्यम से सार्वभौमिक LLM परिनियोजन — मशीन लर्निंग संकलन का उपयोग करके किसी भी हार्डवेयर पर अधिकतम प्रदर्शन के साथ किसी भी बड़े भाषा मॉडल को चलाएँ।

🌟 20,000+ GitHub स्टार्स | MLC AI टीम द्वारा अनुरक्षित | Apache-2.0 लाइसेंस


MLC-LLM क्या है?

MLC-LLM (बड़े भाषा मॉडलों के लिए मशीन लर्निंग संकलन) एक सार्वभौमिक फ्रेमवर्क है जो विविध हार्डवेयर बैकएंड्स पर बड़े भाषा मॉडलों के कुशल परिनियोजन को सक्षम बनाता है। इसका उपयोग करके TVM (टेंसर वर्चुअल मशीन) को अपने संकलन बैकएंड के रूप में, MLC-LLM LLM मॉडलों को सीधे मूल हार्डवेयर कोड में संकलित करता है — हार्डवेयर-विशिष्ट इंजीनियरिंग के बिना लगभग-इष्टतम प्रदर्शन प्राप्त करते हुए।

मुख्य क्षमताएँ

  • सार्वभौमिक हार्डवेयर समर्थन — NVIDIA CUDA, AMD ROCm, Apple Metal, Vulkan, WebGPU

  • OpenAI-संगत REST API — मौजूदा वर्कफ़्लो के लिए बिना बदलाव वाला प्रतिस्थापन

  • कई मॉडल प्रारूप — Llama, Mistral, Gemma, Phi, Qwen, Falcon, और भी बहुत कुछ

  • 4-बिट / 8-बिट क्वांटीकरण — उपभोक्ता GPU पर बड़े मॉडल चलाएँ

  • चैट इंटरफ़ेस — तुरंत परीक्षण के लिए अंतर्निर्मित वेब UI

  • Python और CLI उपकरण — लचीले एकीकरण विकल्प

Clore.ai पर MLC-LLM का उपयोग क्यों करें?

Clore.ai GPU मार्केटप्लेस आपको प्रतिस्पर्धी किराया दरों पर उच्च-प्रदर्शन NVIDIA GPUs तक पहुँच देता है। MLC-LLM का संकलन दृष्टिकोण हर GPU से अधिकतम थ्रूपुट निकालता है — जिससे यह इनके लिए आदर्श बनता है:

  • पैमाने पर प्रोडक्शन API इन्फ़रेंस

  • मॉडल आकारों में अनुसंधान और बेंचमार्किंग

  • क्वांटाइज़्ड मॉडलों के साथ लागत-प्रभावी सर्विंग

  • एक ही GPU इंस्टेंस पर बहु-मॉडल परिनियोजन


Clore.ai पर त्वरित शुरुआत

चरण 1: एक GPU सर्वर खोजें

  1. पर जाएँ clore.ai मार्केटप्लेस

  2. सर्वर फ़िल्टर करें: NVIDIA GPU, न्यूनतम 8GB VRAM (7B+ मॉडल के लिए 16GB+ अनुशंसित)

  3. सर्वोत्तम प्रदर्शन के लिए: RTX 3090, RTX 4090, A100, या H100

चरण 2: MLC-LLM परिनियोजित करें

ध्यान दें: MLC-LLM Docker Hub पर कोई आधिकारिक प्री-बिल्ट Docker इमेज प्रकाशित नहीं करता है। अनुशंसित परिनियोजन तरीका एक NVIDIA CUDA बेस इमेज का उपयोग करना और pip के माध्यम से MLC-LLM इंस्टॉल करना है। उपयोग करें nvidia/cuda:12.8.1-devel-ubuntu22.04 Clore.ai पर अपने बेस इमेज के रूप में।

अपनी Clore.ai ऑर्डर कॉन्फ़िगरेशन में NVIDIA CUDA बेस इमेज का उपयोग करें:

पोर्ट मैपिंग:

कंटेनर पोर्ट
उद्देश्य

22

SSH पहुँच

8000

REST API सर्वर

अनुशंसित पर्यावरण चर:

स्टार्टअप स्क्रिप्ट (SSH के बाद चलाएँ):

चरण 3: SSH के माध्यम से कनेक्ट करें


इंस्टॉलेशन और सेटअप

विकल्प A: पहले से संकलित मॉडल उपयोग करें (सबसे तेज़)

MLC-AI Hugging Face पर पहले से संकलित मॉडलों की एक लाइब्रेरी रखता है। संकलन की आवश्यकता नहीं:

विकल्प B: अपना मॉडल संकलित करें

कस्टम मॉडलों या विशिष्ट क्वांटाइज़ेशन आवश्यकताओं के लिए:

संकलन समय: एक 7B मॉडल को संकलित करने में आमतौर पर पहली बार 10–30 मिनट लगते हैं। संकलित आर्टिफ़ैक्ट कैश किए जाते हैं और बाद के लॉन्च पर पुनः उपयोग होते हैं।


API सर्वर चलाना

OpenAI-संगत सर्वर शुरू करें

सर्वर स्टार्टअप आउटपुट

उपलब्ध API एंडपॉइंट

एंडपॉइंट
विधि
विवरण

/v1/chat/completions

POST

चैट पूर्णताएँ (OpenAI प्रारूप)

/v1/completions

POST

पाठ पूर्णताएँ

/v1/models

GET

उपलब्ध मॉडल सूचीबद्ध करें

/v1/debug/dump_event_trace

GET

प्रदर्शन डिबगिंग


API उपयोग उदाहरण

चैट पूर्णताएँ (Python)

स्ट्रीमिंग प्रतिक्रिया

cURL उदाहरण


उपलब्ध पहले से संकलित मॉडल

MLC-AI Hugging Face पर उपयोग के लिए तैयार संकलित मॉडल प्रदान करता है:

Llama 3 श्रृंखला

Mistral / Mixtral

Gemma

Phi


क्वांटाइज़ेशन विकल्प

MLC-LLM कई क्वांटाइज़ेशन योजनाओं का समर्थन करता है। अपने VRAM बजट के आधार पर चुनें:

क्वांटाइज़ेशन
बिट्स
गुणवत्ता
VRAM (7B)
VRAM (13B)

q4f16_1

4-बिट

★★★★☆

~4GB

~7GB

q4f32_1

4-बिट (f32 संचय)

★★★★☆

~4GB

~7GB

q8f16_1

8-बिट

★★★★★

~8GB

~14GB

q0f16

16-बिट (कोई क्वांट नहीं)

★★★★★

~14GB

~26GB

q0f32

32-बिट (कोई क्वांट नहीं)

★★★★★

~28GB

~52GB


मल्टी-GPU परिनियोजन

कई GPUs की आवश्यकता वाले बड़े मॉडलों (70B+) के लिए:

परिनियोजन से पहले GPU टोपोलॉजी जाँचें:

सर्वोत्तम प्रदर्शन: मल्टी-GPU NVLink-कनेक्टेड कार्ड्स के साथ सबसे अच्छा काम करता है (जैसे, A100 80GB SXM पेयर्स)। PCIe-कनेक्टेड GPUs बड़े मॉडलों पर बाधाएँ दिखाएँगे।


वेब चैट इंटरफ़ेस

MLC-LLM में एक अंतर्निर्मित वेब UI शामिल है, जो सर्वर चालू होते ही उपलब्ध हो जाता है:

UI यहाँ खोलें: http://<clore-node-ip>:<api-port>


प्रदर्शन ट्यूनिंग

बैच आकार अनुकूलित करें

GPU उपयोगिता की निगरानी करें

थ्रूपुट बेंचमार्क करें


Docker Compose सेटअप

Clore.ai पर उत्पादन-तैयार परिनियोजन के लिए, pip के माध्यम से MLC-LLM इंस्टॉल की गई NVIDIA CUDA बेस इमेज का उपयोग करें:


समस्या निवारण

मॉडल डाउनलोड विफल

मेमोरी समाप्त (OOM)

CUDA संस्करण मेल नहीं खा रहा

सर्वर तक पहुँचा नहीं जा सका


Clore.ai GPU अनुशंसाएँ

MLC-LLM का संकलन दृष्टिकोण हर GPU स्तर पर लगभग-इष्टतम थ्रूपुट प्रदान करता है। मॉडल आकार और बजट के आधार पर चुनें:

GPU
VRAM
Clore.ai मूल्य
किसके लिए सर्वोत्तम
थ्रूपुट (Llama 3 8B Q4)

RTX 3090

24 GB

$0.07–0.21/hr

7B–13B मॉडल, बजट सर्विंग

~85 tok/s

RTX 4090

24 GB

$0.14–0.42/hr

7B–34B मॉडल, तेज़ सर्विंग

~140 tok/s

A100 40GB

40 GB

34B–70B, प्रोडक्शन API

~110 tok/s

A100 80GB

80 GB

70B+, बहु-मॉडल सर्विंग

~130 tok/s

H100 SXM

80 GB

~$1.04/घंटा

अधिकतम थ्रूपुट, FP8

~280 tok/s

अनुशंसित प्रारंभिक बिंदु: $0.07–0.21/घंटा पर RTX 3090, MLC-LLM के माध्यम से Llama 3 8B और Mistral 7B सर्विंग के लिए मूल्य-प्रदर्शन अनुपात के लिहाज़ से सबसे अच्छा है। संकलित कर्नेल्स उपभोक्ता GPUs से लगभग-अधिकतम उपयोगिता निकालते हैं।

70B मॉडलों के लिए (उदा., Llama 3 70B Q4): A100 40GB (bare metal) या tensor parallelism के माध्यम से दो RTX 3090s का उपयोग करें।


संसाधन

अंतिम अपडेट

क्या यह उपयोगी था?