vLLM
Clore.ai GPUs पर vLLM के साथ उच्च-थ्रूपुट LLM इन्फ़रेंस
उत्पादन वर्कलोड के लिए CLORE.AI GPUs पर उच्च-थ्रूपुट LLM इनफ़ेरेंस सर्वर।
सभी उदाहरण यहाँ के माध्यम से किराए पर लिए गए GPU सर्वरों पर चलाए जा सकते हैं CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
RAM
16GB
32GB+
VRAM
16GB (7B)
24GB+
नेटवर्क
500Mbps
1Gbps+
शुरू होने का समय
5-15 मिनट
-
महत्वपूर्ण: vLLM को पर्याप्त RAM और VRAM की आवश्यकता होती है। 16GB से कम RAM वाले सर्वर 7B मॉडल भी नहीं चला पाएंगे।
शुरू होने का समय: पहला लॉन्च मॉडल को HuggingFace से डाउनलोड करता है (मॉडल के आकार और नेटवर्क स्पीड के अनुसार 5-15 मिनट)। इस दौरान HTTP 502 सामान्य है।
vLLM क्यों?
सबसे तेज़ थ्रूपुट - 24x अधिक थ्रूपुट के लिए PagedAttention
उत्पादन-तैयार - OpenAI-संगत API तुरंत उपलब्ध
निरंतर बैचिंग - कुशल बहु-उपयोगकर्ता सर्विंग
स्ट्रीमिंग - रीयल-टाइम टोकन जनरेशन
मल्टी-GPU - बड़े मॉडलों के लिए टेन्सर पैरेललिज़्म
मल्टी-LoRA - एक साथ कई फ़ाइन-ट्यून किए गए एडाप्टर सर्व करें (v0.7+)
संरचित आउटपुट - JSON schema enforcement और tool calling (v0.7+)
CLORE.AI पर त्वरित परिनियोजन
Docker इमेज:
पोर्ट्स:
कमांड:
जाँचें कि यह काम कर रहा है
परिनियोजन के बाद, अपना खोजें http_pub URL में My Orders:
यदि आपको 15 मिनट से अधिक समय तक HTTP 502 मिलता है, तो जाँचें:
सर्वर में 16GB+ RAM है
सर्वर में मॉडल के लिए पर्याप्त VRAM है
गेटेड मॉडलों के लिए HuggingFace टोकन सेट है
अपनी सेवा तक पहुँच
CLORE.AI पर परिनियोजित होने पर, vLLM को इस के माध्यम से एक्सेस करें http_pub URL:
स्थापना
Docker का उपयोग करके (अनुशंसित)
pip का उपयोग करके
समर्थित मॉडल
Mistral 7B
7B
14GB
16GB+
Llama 3.1 8B
8B
16GB
16GB+
Llama 3.1 70B
70B
140GB (या 2x80GB)
64GB+
Mixtral 8x7B
47B
90GB
32GB+
Qwen2.5 7B
7B
14GB
16GB+
Qwen2.5 72B
72B
145GB
64GB+
DeepSeek-V3
236B MoE
मल्टी-GPU
128GB+
DeepSeek-R1-Distill-Qwen-7B
7B
14GB
16GB+
DeepSeek-R1-Distill-Qwen-32B
32B
64GB
32GB+
DeepSeek-R1-Distill-Llama-70B
70B
140GB
64GB+
Phi-4
14B
28GB
32GB+
Gemma 2 9B
9B
18GB
16GB+
CodeLlama 34B
34B
68GB
32GB+
सर्वर विकल्प
बेसिक सर्वर
प्रोडक्शन सर्वर
क्वांटाइज़ेशन के साथ (कम VRAM)
संरचित आउटपुट और टूल कॉलिंग (v0.7+)
स्वचालित टूल चयन और संरचित JSON आउटपुट सक्षम करें:
Python में उपयोग करें:
response format के माध्यम से संरचित JSON आउटपुट:
मल्टी-LoRA सर्विंग (v0.7+)
एक बेस मॉडल को एक साथ कई LoRA एडाप्टरों के साथ सर्व करें:
मॉडल नाम द्वारा किसी विशिष्ट LoRA एडाप्टर को क्वेरी करें:
DeepSeek-R1 सपोर्ट (v0.7+)
vLLM v0.7+ में DeepSeek-R1 distill मॉडलों के लिए मूल सपोर्ट है। ये reasoning मॉडल उत्पन्न करते हैं <think> टैग जो उनकी reasoning प्रक्रिया दिखाते हैं।
DeepSeek-R1-Distill-Qwen-7B (एकल GPU)
DeepSeek-R1-Distill-Qwen-32B (डुअल GPU)
DeepSeek-R1-Distill-Llama-70B (क्वाड GPU)
DeepSeek-R1 को क्वेरी करना
think टैग्स को पार्स करना:
API उपयोग
चैट पूर्णताएँ (OpenAI-संगत)
स्ट्रीमिंग
cURL
टेक्स्ट पूर्णताएँ
पूर्ण API संदर्भ
vLLM OpenAI-संगत endpoints के साथ अतिरिक्त utility endpoints भी प्रदान करता है।
मानक endpoints
/v1/models
GET
उपलब्ध मॉडल सूचीबद्ध करें
/v1/chat/completions
POST
चैट पूर्णता
/v1/completions
POST
टेक्स्ट पूर्णता
/health
GET
हेल्थ चेक (खाली लौट सकता है)
अतिरिक्त endpoints
/tokenize
POST
टेक्स्ट को टोकनाइज़ करें
/detokenize
POST
टोकन को टेक्स्ट में बदलें
/version
GET
vLLM संस्करण प्राप्त करें
/docs
GET
Swagger UI दस्तावेज़ीकरण
/metrics
GET
Prometheus metrics
टेक्स्ट को टोकनाइज़ करें
अनुरोध भेजने से पहले टोकन गिनने के लिए उपयोगी:
प्रतिक्रिया:
डी-टोकनाइज़
टोकन IDs को वापस टेक्स्ट में बदलें:
प्रतिक्रिया:
संस्करण प्राप्त करें
प्रतिक्रिया:
Swagger दस्तावेज़ीकरण
इंटरैक्टिव API दस्तावेज़ीकरण के लिए ब्राउज़र में खोलें:
Prometheus metrics
मॉनिटरिंग के लिए:
बेंचमार्क
थ्रूपुट (टोकन/सेकंड प्रति उपयोगकर्ता)
Mistral 7B
100
170
210
230
Llama 3.1 8B
95
150
200
220
Llama 3.1 8B (AWQ)
130
190
260
280
Mixtral 8x7B
-
45
70
85
Llama 3.1 70B
-
-
25 (2x)
45 (2x)
DeepSeek-R1 7B
90
145
190
210
DeepSeek-R1 32B
-
-
40
70 (2x)
बेंचमार्क जनवरी 2026 में अपडेट किए गए।
Context Length बनाम VRAM
8B FP16
18GB
22GB
30GB
46GB
8B AWQ
8GB
10GB
14GB
22GB
70B FP16
145GB
160GB
190GB
250GB
70B AWQ
42GB
50GB
66GB
98GB
Hugging Face प्रमाणीकरण
गेटेड मॉडलों (Llama, आदि) के लिए:
या इसे environment variable के रूप में सेट करें:
GPU आवश्यकताएँ
7-8B
16GB
16GB
24GB VRAM, 32GB RAM
13B
26GB
32GB
40GB VRAM
34B
70GB
32GB
80GB VRAM
70B
140GB
64GB
2x80GB
लागत अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें:
RTX 3090
24GB
$0.30–1.00
7-8B मॉडल
RTX 4090
24GB
$0.50–2.00
7-13B, तेज़
A100
40GB
$1.50–3.00
13-34B मॉडल
A100
80GB
$2.00–4.00
34-70B मॉडल
कीमतें USD/दिन में हैं। दरें प्रदाता के अनुसार बदलती हैं — वर्तमान दरों के लिए देखें CLORE.AI मार्केटप्लेस ।
समस्या-समाधान
लंबे समय तक HTTP 502
RAM जाँचें: सर्वर में 16GB+ RAM होना चाहिए
VRAM जाँचें: मॉडल समा जाना चाहिए
मॉडल डाउनलोड हो रहा है: पहली बार चलाने पर HuggingFace से डाउनलोड होता है (5-15 मिनट)
HF Token: गेटेड मॉडल के लिए प्रमाणीकरण आवश्यक है
मेमोरी समाप्त
मॉडल डाउनलोड विफल होता है
vLLM बनाम अन्य
थ्रूपुट
सर्वोत्तम
अच्छा
अच्छा
VRAM उपयोग
उच्च
निम्न
मध्यम
उपयोग में आसानी
मध्यम
मध्यम
आसान
शुरू होने का समय
5-15 मिनट
1-2 मिनट
30 सेकंड
मल्टी-GPU
मूल
सीमित
सीमित
टूल कॉलिंग
हाँ (v0.7+)
सीमित
सीमित
मल्टी-LoRA
हाँ (v0.7+)
नहीं
नहीं
vLLM का उपयोग करें जब:
उच्च थ्रूपुट प्राथमिकता हो
कई उपयोगकर्ताओं को सेवा देना
पर्याप्त VRAM और RAM हो
प्रोडक्शन परिनियोजन
टूल कॉलिंग / संरचित आउटपुट की आवश्यकता हो
Ollama का उपयोग करें जब:
त्वरित सेटअप की आवश्यकता हो
एकल उपयोगकर्ता
कम संसाधन उपलब्ध हों
अगले चरण
Ollama - तेज़ स्टार्टअप वाला सरल विकल्प
DeepSeek-R1 - तर्क मॉडल गाइड
DeepSeek-V3 - सर्वश्रेष्ठ सामान्य मॉडल
Qwen2.5 - बहुभाषी मॉडल
Llama.cpp - कम VRAM विकल्प
अंतिम अपडेट
क्या यह उपयोगी था?