For the complete documentation index, see llms.txt. This page is also available as Markdown.

LMDeploy

शंघाई AI लैब द्वारा एक कुशल LLM परिनियोजन टूलकिट — बड़े भाषा मॉडलों के लिए उत्पादन-स्तरीय इन्फ़रेंस, क्वांटाइज़ेशन, और सर्विंग, जिसमें सतत बैचिंग और PagedAttention शामिल हैं।

🏛️ द्वारा विकसित OpenMMLab / Shanghai AI Lab | Apache-2.0 लाइसेंस | 4,000+ GitHub स्टार्स


LMDeploy क्या है?

LMDeploy उत्पादन में बड़े भाषा मॉडलों को संपीड़ित करने, परिनियोजित करने और सर्व करने के लिए एक व्यापक टूलकिट है। OpenMMLab (MMDetection, MMSeg) के पीछे वाली उसी टीम द्वारा बनाया गया, यह शोध-स्तर के अनुकूलनों को व्यावहारिक परिनियोजन में लाता है:

  • TurboMind इंजन — CUDA अनुकूलनों के साथ उच्च-प्रदर्शन C++ इन्फ़रेंस बैकएंड

  • PyTorch इंजन — व्यापक मॉडल संगतता के लिए लचीला Python-आधारित इंजन

  • निरंतर बैचिंग — समवर्ती अनुरोधों के बीच GPU उपयोग को अधिकतम करता है

  • PagedAttention — कुशल KV कैश प्रबंधन (vLLM जैसा)

  • 4-बिट / 8-बिट क्वांटाइज़ेशन — AWQ और SmoothQuant समर्थन

  • विज़न-भाषा मॉडल — InternVL, LLaVA, Qwen-VL समर्थन

vLLM की तुलना में, LMDeploy का TurboMind इंजन batch=32 पर Llama 3 8B में लगभग 1.36× अधिक थ्रूपुट देता है, और इसका AWQ क्वांटाइज़ेशन प्रथम श्रेणी का है — बाद में सोचा गया नहीं। VLMs (विशेषकर InternVL2) के लिए, LMDeploy संदर्भ परिनियोजन स्टैक है।

LMDeploy क्यों?

विशेषता
LMDeploy
vLLM
TGI

निरंतर बैचिंग

AWQ क्वांटाइज़ेशन

स्पेकुलेटिव डिकोडिंग

विज़न-भाषा

सीमित

सीमित

OpenAI API

TurboMind (कस्टम इंजन)


Clore.ai पर त्वरित शुरुआत

चरण 1: GPU सर्वर चुनें

पर clore.ai मार्केटप्लेस:

  • न्यूनतम: 8GB VRAM वाला NVIDIA GPU (7B मॉडलों के लिए)

  • अनुशंसित: RTX 3090/4090 (24GB) या A100 (40/80GB)

  • CUDA: 11.8 या 12.x आवश्यक

चरण 2: LMDeploy Docker परिनियोजित करें

पोर्ट मैपिंग:

कंटेनर पोर्ट
उद्देश्य

22

SSH पहुँच

23333

LMDeploy API सर्वर

पर्यावरण चर:

चरण 3: SSH करें और सत्यापित करें


API सर्वर प्रारंभ करना

OpenAI-संगत सर्वर (अनुशंसित)

PyTorch इंजन (व्यापक संगतता)

सर्वर स्टार्टअप आउटपुट


समर्थित मॉडल

टेक्स्ट मॉडल

विज़न-भाषा मॉडल


क्वांटाइज़ेशन

AWQ 4-बिट क्वांटाइज़ेशन

LMDeploy का AWQ (Activation-aware Weight Quantization) 4-बिट पर उत्कृष्ट गुणवत्ता देता है:

SmoothQuant W8A8

8-बिट वज़न और एक्टिवेशन क्वांटाइज़ेशन (थ्रूपुट-निर्णायक परिनियोजन के लिए बेहतर):

क्वांटाइज़ेशन प्रभाव

क्वांटाइज़ेशन
VRAM (7B)
गुणवत्ता हानि
थ्रूपुट लाभ

कोई नहीं (bf16)

~14GB

कोई नहीं

आधाररेखा

SmoothQuant W8A8

~8GB

न्यूनतम

+20%

AWQ W4A16

~4GB

कम

+15%

GPTQ W4A16

~4GB

कम

+10%

AWQ अनुशंसा: अधिकांश उपयोग मामलों के लिए, AWQ 4-बिट गुणवत्ता और VRAM बचत का सर्वोत्तम संतुलन है। बेहतर गुणवत्ता के लिए --w-group-size 128 का उपयोग करें, जिसमें थोड़ी अधिक मेमोरी लगेगी।


API उपयोग उदाहरण

Python क्लाइंट

स्ट्रीमिंग

LMDeploy नेटिव Python क्लाइंट

विज़न-भाषा मॉडल


मल्टी-GPU परिनियोजन

टेंसर पैरललिज़्म


उन्नत कॉन्फ़िगरेशन

TurboMind इंजन कॉन्फ़िगरेशन

जनरेशन कॉन्फ़िगरेशन


निगरानी एवं मीट्रिक्स

सर्वर स्वास्थ्य जाँचें

GPU निगरानी


Docker Compose उदाहरण


बेंचमार्किंग

नमूना आउटपुट (RTX 4090, TurboMind, bf16):

A100 80GB पर, HBM2e मेमोरी बैंडविड्थ (2 TB/s बनाम 1 TB/s) के कारण उच्च concurrency पर RTX 4090 की तुलना में लगभग 2.2× अधिक थ्रूपुट की अपेक्षा करें।


Clore.ai GPU अनुशंसाएँ

अपने लक्षित मॉडल आकार और सर्विंग लोड के आधार पर चुनें:

उपयोग-प्रकरण
GPU
VRAM
क्यों

7–13B मॉडल, डेवलपमेंट/स्टेजिंग

RTX 3090

24 GB

सबसे अच्छा $/VRAM अनुपात; 7B bf16 या 13B AWQ संभालता है

7–13B मॉडल, उत्पादन

RTX 4090

24 GB

समान VRAM पर 3090 से लगभग 40% तेज; Llama 3 8B पर 412 tok/s

70B मॉडल, टीम सर्विंग

A100 40GB

40 GB

70B AWQ फिट करता है; विश्वसनीयता के लिए ECC मेमोरी

70B मॉडल, उच्च थ्रूपुट

A100 80GB

80 GB

70B bf16 फिट करता है; batch=32 पर A100 40GB की तुलना में 2× थ्रूपुट

बजट विकल्प: RTX 3090 + AWQ 4-बिट — Llama 3 8B को लगभग 280 tok/s batch=8 पर सर्व करता है, अधिकांश API उपयोग मामलों को कवर करता है।

गति विकल्प: RTX 4090 — 7–13B मॉडलों के लिए प्रति डॉलर सबसे तेज; TurboMind अपने 1 TB/s बैंडविड्थ के हर GB/s का पूरा उपयोग करता है।

उत्पादन विकल्प: A100 80GB — क्वांटाइज़ेशन गुणवत्ता से समझौता किए बिना Qwen2-72B या Llama 3 70B को पूर्ण bf16 में चलाएँ; मल्टी-इंस्टेंस GPU सर्विंग में आसानी से फिट होता है।


समस्या निवारण

मॉडल लोड नहीं हो रहा

CUDA मेमोरी समाप्त

पोर्ट पहले से उपयोग में है


Clore.ai GPU अनुशंसाएँ

LMDeploy का TurboMind इंजन और W4A16 क्वांटाइज़ेशन सर्वोत्तम-स्तरीय थ्रूपुट देते हैं — विशेषकर Ampere/Hopper GPUs पर।

GPU
VRAM
Clore.ai मूल्य
Llama 3 8B थ्रूपुट
Llama 3 70B Q4

RTX 3090

24 GB

$0.07–0.21/hr

~120 tok/s (fp16)

❌ बहुत बड़ा

RTX 4090

24 GB

$0.14–0.42/hr

~200 tok/s (fp16)

❌ बहुत बड़ा

A100 40GB

40 GB

~160 tok/s (fp16)

~55 tok/s (W4A16)

A100 80GB

80 GB

~175 tok/s (fp16)

~80 tok/s (fp16)

2× RTX 4090

48 GB

$0.28–0.84/hr

~380 tok/s (टेंसर पैरेलल)

~60 tok/s

$0.07–0.21/घंटा पर RTX 3090 7B–13B मॉडलों के लिए शीर्ष विकल्प है। LMDeploy का TurboMind इंजन उपभोक्ता GPUs से लगभग अधिकतम थ्रूपुट निकालता है। Llama 3 8B सर्व करने वाला एकल RTX 3090 120 tok/s संभालता है — 10–20 समवर्ती उपयोगकर्ताओं वाली उत्पादन APIs के लिए पर्याप्त।

70B मॉडलों के लिए: A100 40GB (bare metal) W4A16 क्वांटाइज़ेशन के साथ लगभग 55 tok/s देता है — दो RTX 4090s से अधिक किफायती।


संसाधन

अंतिम अपडेट

क्या यह उपयोगी था?