LMDeploy
शंघाई AI लैब द्वारा एक कुशल LLM परिनियोजन टूलकिट — बड़े भाषा मॉडलों के लिए उत्पादन-स्तरीय इन्फ़रेंस, क्वांटाइज़ेशन, और सर्विंग, जिसमें सतत बैचिंग और PagedAttention शामिल हैं।
🏛️ द्वारा विकसित OpenMMLab / Shanghai AI Lab | Apache-2.0 लाइसेंस | 4,000+ GitHub स्टार्स
LMDeploy क्या है?
LMDeploy उत्पादन में बड़े भाषा मॉडलों को संपीड़ित करने, परिनियोजित करने और सर्व करने के लिए एक व्यापक टूलकिट है। OpenMMLab (MMDetection, MMSeg) के पीछे वाली उसी टीम द्वारा बनाया गया, यह शोध-स्तर के अनुकूलनों को व्यावहारिक परिनियोजन में लाता है:
TurboMind इंजन — CUDA अनुकूलनों के साथ उच्च-प्रदर्शन C++ इन्फ़रेंस बैकएंड
PyTorch इंजन — व्यापक मॉडल संगतता के लिए लचीला Python-आधारित इंजन
निरंतर बैचिंग — समवर्ती अनुरोधों के बीच GPU उपयोग को अधिकतम करता है
PagedAttention — कुशल KV कैश प्रबंधन (vLLM जैसा)
4-बिट / 8-बिट क्वांटाइज़ेशन — AWQ और SmoothQuant समर्थन
विज़न-भाषा मॉडल — InternVL, LLaVA, Qwen-VL समर्थन
vLLM की तुलना में, LMDeploy का TurboMind इंजन batch=32 पर Llama 3 8B में लगभग 1.36× अधिक थ्रूपुट देता है, और इसका AWQ क्वांटाइज़ेशन प्रथम श्रेणी का है — बाद में सोचा गया नहीं। VLMs (विशेषकर InternVL2) के लिए, LMDeploy संदर्भ परिनियोजन स्टैक है।
LMDeploy क्यों?
निरंतर बैचिंग
✅
✅
✅
AWQ क्वांटाइज़ेशन
✅
✅
❌
स्पेकुलेटिव डिकोडिंग
✅
✅
✅
विज़न-भाषा
✅
सीमित
सीमित
OpenAI API
✅
✅
✅
TurboMind (कस्टम इंजन)
✅
❌
❌
Clore.ai पर त्वरित शुरुआत
चरण 1: GPU सर्वर चुनें
पर clore.ai मार्केटप्लेस:
न्यूनतम: 8GB VRAM वाला NVIDIA GPU (7B मॉडलों के लिए)
अनुशंसित: RTX 3090/4090 (24GB) या A100 (40/80GB)
CUDA: 11.8 या 12.x आवश्यक
चरण 2: LMDeploy Docker परिनियोजित करें
पोर्ट मैपिंग:
22
SSH पहुँच
23333
LMDeploy API सर्वर
पर्यावरण चर:
चरण 3: SSH करें और सत्यापित करें
API सर्वर प्रारंभ करना
OpenAI-संगत सर्वर (अनुशंसित)
PyTorch इंजन (व्यापक संगतता)
सर्वर स्टार्टअप आउटपुट
शुरू होने के बाद, LMDeploy इंटरैक्टिव API डॉक्स यहाँ उपलब्ध कराता है http://<your-ip>:23333/docs — ब्राउज़र से सीधे एंडपॉइंट्स का परीक्षण करने के लिए उपयोगी।
समर्थित मॉडल
टेक्स्ट मॉडल
विज़न-भाषा मॉडल
क्वांटाइज़ेशन
AWQ 4-बिट क्वांटाइज़ेशन
LMDeploy का AWQ (Activation-aware Weight Quantization) 4-बिट पर उत्कृष्ट गुणवत्ता देता है:
SmoothQuant W8A8
8-बिट वज़न और एक्टिवेशन क्वांटाइज़ेशन (थ्रूपुट-निर्णायक परिनियोजन के लिए बेहतर):
क्वांटाइज़ेशन प्रभाव
कोई नहीं (bf16)
~14GB
कोई नहीं
आधाररेखा
SmoothQuant W8A8
~8GB
न्यूनतम
+20%
AWQ W4A16
~4GB
कम
+15%
GPTQ W4A16
~4GB
कम
+10%
API उपयोग उदाहरण
Python क्लाइंट
स्ट्रीमिंग
LMDeploy नेटिव Python क्लाइंट
विज़न-भाषा मॉडल
मल्टी-GPU परिनियोजन
टेंसर पैरललिज़्म
उन्नत कॉन्फ़िगरेशन
TurboMind इंजन कॉन्फ़िगरेशन
जनरेशन कॉन्फ़िगरेशन
निगरानी एवं मीट्रिक्स
सर्वर स्वास्थ्य जाँचें
GPU निगरानी
Docker Compose उदाहरण
बेंचमार्किंग
नमूना आउटपुट (RTX 4090, TurboMind, bf16):
A100 80GB पर, HBM2e मेमोरी बैंडविड्थ (2 TB/s बनाम 1 TB/s) के कारण उच्च concurrency पर RTX 4090 की तुलना में लगभग 2.2× अधिक थ्रूपुट की अपेक्षा करें।
Clore.ai GPU अनुशंसाएँ
अपने लक्षित मॉडल आकार और सर्विंग लोड के आधार पर चुनें:
7–13B मॉडल, डेवलपमेंट/स्टेजिंग
RTX 3090
24 GB
सबसे अच्छा $/VRAM अनुपात; 7B bf16 या 13B AWQ संभालता है
7–13B मॉडल, उत्पादन
RTX 4090
24 GB
समान VRAM पर 3090 से लगभग 40% तेज; Llama 3 8B पर 412 tok/s
70B मॉडल, टीम सर्विंग
A100 40GB
40 GB
70B AWQ फिट करता है; विश्वसनीयता के लिए ECC मेमोरी
70B मॉडल, उच्च थ्रूपुट
A100 80GB
80 GB
70B bf16 फिट करता है; batch=32 पर A100 40GB की तुलना में 2× थ्रूपुट
बजट विकल्प: RTX 3090 + AWQ 4-बिट — Llama 3 8B को लगभग 280 tok/s batch=8 पर सर्व करता है, अधिकांश API उपयोग मामलों को कवर करता है।
गति विकल्प: RTX 4090 — 7–13B मॉडलों के लिए प्रति डॉलर सबसे तेज; TurboMind अपने 1 TB/s बैंडविड्थ के हर GB/s का पूरा उपयोग करता है।
उत्पादन विकल्प: A100 80GB — क्वांटाइज़ेशन गुणवत्ता से समझौता किए बिना Qwen2-72B या Llama 3 70B को पूर्ण bf16 में चलाएँ; मल्टी-इंस्टेंस GPU सर्विंग में आसानी से फिट होता है।
समस्या निवारण
मॉडल लोड नहीं हो रहा
CUDA मेमोरी समाप्त
पोर्ट पहले से उपयोग में है
Docker नेटवर्क मोड: Docker में चलाते समय, सुनिश्चित करें कि कंटेनर उपयोग करता है --network host या उचित पोर्ट मैपिंग (-p 23333:23333) ताकि API बाहर से पहुँच योग्य हो।
Clore.ai GPU अनुशंसाएँ
LMDeploy का TurboMind इंजन और W4A16 क्वांटाइज़ेशन सर्वोत्तम-स्तरीय थ्रूपुट देते हैं — विशेषकर Ampere/Hopper GPUs पर।
RTX 3090
24 GB
$0.07–0.21/hr
~120 tok/s (fp16)
❌ बहुत बड़ा
RTX 4090
24 GB
$0.14–0.42/hr
~200 tok/s (fp16)
❌ बहुत बड़ा
2× RTX 4090
48 GB
$0.28–0.84/hr
~380 tok/s (टेंसर पैरेलल)
~60 tok/s
संसाधन
📦 Docker Hub: hub.docker.com/r/openmmlab/lmdeploy
🐙 GitHub: github.com/InternLM/lmdeploy
📚 दस्तावेज़ीकरण: lmdeploy.readthedocs.io
💬 Discord: discord.gg/xa29JuW84p
🤗 पूर्व-क्वांटाइज़्ड मॉडल: huggingface.co/lmdeploy
अंतिम अपडेट
क्या यह उपयोगी था?