SGLang
Clore.ai GPUs पर RadixAttention के साथ उच्च-प्रदर्शन LLM सर्विंग के लिए SGLang डिप्लॉय करें
SGLang (Structured Generation Language) एक उच्च-प्रदर्शन LLM सर्विंग फ्रेमवर्क है, जिसे LMSYS टीम ने विकसित किया है, जो Vicuna और Chatbot Arena पर अपने काम के लिए जानी जाती है। इसमें KV cache sharing के लिए RadixAttention, कुशल MoE (Mixture of Experts) समर्थन, और OpenAI-संगत API शामिल है — जिससे यह CLORE.AI GPU सर्वरों पर उपलब्ध सबसे तेज़ ओपन-सोर्स inference engines में से एक बन जाता है।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया हो CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
RAM
16 GB
32 GB+
VRAM
8 GB
24 GB+
डिस्क
50 GB
200 GB+
GPU
NVIDIA Turing+ (RTX 2000+)
A100, H100, RTX 4090
CLORE.AI पर त्वरित परिनियोजन
Docker इमेज: lmsysorg/sglang:latest
पोर्ट्स: 22/tcp, 30000/http
Environment Variables:
HF_TOKEN
hf_xxx...
gated models के लिए HuggingFace token
CUDA_VISIBLE_DEVICES
0,1
उपयोग की जाने वाली GPUs
चरण-दर-चरण सेटअप
1. CLORE.AI पर GPU Server किराए पर लें
देखें CLORE.AI मार्केटप्लेस और एक server चुनें:
7B मॉडल: न्यूनतम 16 GB VRAM (RTX 4080, A10)
13B मॉडल: 24 GB VRAM (RTX 3090, RTX 4090, A5000)
70B मॉडल: 80 GB+ VRAM (A100 80GB) या multi-GPU
MoE मॉडल (Mixtral 8x7B): 48 GB VRAM या 2× 24 GB
2. अपने Server में SSH करें
3. SGLang Docker Image Pull करें
4. SGLang Server लॉन्च करें
बेसिक लॉन्च (Llama 3.1 8B):
HuggingFace token के साथ:
multi-GPU पर Qwen2.5 72B:
DeepSeek-V2 (MoE model):
5. Server Health जांचें
6. CLORE.AI Proxy के माध्यम से बाहर से पहुँचें
आपका CLORE.AI dashboard एक http_pub port 30000 के लिए URL प्रदान करता है:
किसी भी OpenAI-संगत client में इस URL को अपना base URL के रूप में उपयोग करें।
उपयोग के उदाहरण
उदाहरण 1: OpenAI-संगत Chat Completions
उदाहरण 2: Streaming Response
उदाहरण 3: Python OpenAI Client
उदाहरण 4: SGLang Native API के साथ Batch Inference
SGLang का native API अतिरिक्त नियंत्रण प्रदान करता है:
उदाहरण 5: सीमित JSON आउटपुट
SGLang संरचित आउटपुट generation का समर्थन करता है:
कॉन्फ़िगरेशन
मुख्य लॉन्च पैरामीटर
--model-path
आवश्यक
HuggingFace model ID या local path
--host
127.0.0.1
Bind host (उपयोग करें 0.0.0.0 बाहरी के लिए)
--port
30000
Server port
--tp
1
Tensor parallelism degree (num GPUs)
--dp
1
Data parallelism degree
--dtype
auto
float16, bfloat16, float32
--mem-fraction-static
0.88
KV cache के लिए VRAM का अंश
--max-prefill-tokens
auto
एक prefill चरण में अधिकतम tokens
--context-length
मॉडल max
अधिकतम context length को override करें
--trust-remote-code
false
custom model code की अनुमति दें
--quantization
none
awq, gptq, fp8
--load-format
auto
auto, pt, safetensors
--tokenizer-path
model के समान
Custom tokenizer path
Quantization विकल्प
AWQ (गति के लिए अनुशंसित):
FP8 (H100/A100 के लिए):
प्रदर्शन सुझाव
1. RadixAttention — मुख्य लाभ
SGLang का RadixAttention साझा prompt prefixes के लिए KV cache को स्वचालित रूप से पुन: उपयोग करता है। यह विशेष रूप से इनके लिए शक्तिशाली है:
लंबे system prompts वाले chatbots
बार-बार दोहराए जाने वाले context वाले RAG applications
एक ही prefix साझा करने वाले Batch API calls
कोई अतिरिक्त configuration आवश्यक नहीं — यह हमेशा सक्षम रहता है।
2. KV Cache Size बढ़ाएँ
बहुत अधिक न जाएँ — model weights के लिए जगह छोड़ें।
3. लंबे contexts के लिए Chunked Prefill
4. FlashInfer Backend सक्षम करें
SGLang उपलब्ध होने पर FlashInfer का स्वचालित रूप से उपयोग करता है (Ampere+ GPUs):
5. Multi-GPU Tensor Parallelism
उन मॉडलों के लिए जो एक single GPU पर fit नहीं होते:
प्रत्येक GPU के पास model के एक shard के लिए पर्याप्त VRAM होना चाहिए।
6. Throughput बनाम Latency के लिए Tune करें
कम latency (single user):
उच्च throughput (कई users):
समस्या निवारण
समस्या: "torch.cuda.OutOfMemoryError"
समाधान: मेमोरी fraction कम करें या quantization का उपयोग करें:
समस्या: Server शुरू नहीं होता (लोडिंग पर अटक जाता है)
समस्या: "trust_remote_code required"
जोड़ें --trust-remote-code custom architectures (DeepSeek, Falcon, आदि) वाले मॉडलों के लिए launch command में।
समस्या: MoE models पर धीमी generation
MoE models (Mixtral, DeepSeek) memory-bandwidth bound होते हैं। सुनिश्चित करें कि आप उपयोग कर रहे हैं:
समस्या: Context length errors
समस्या: Port 30000 accessible नहीं है
सत्यापित करें कि port आपकी CLORE.AI order configuration में exposed है। अपने order dashboard में http_pub URL जांचें, localhost नहीं।
लिंक्स
Clore.ai GPU अनुशंसाएँ
विकास/परीक्षण
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
उत्पादन (7B–13B)
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
बड़े मॉडल (70B+)
A100 80GB / H100
~$1.04/gpu/hr
💡 इस गाइड के सभी उदाहरण Clore.ai GPU servers पर तैनात किए जा सकते हैं। उपलब्ध GPUs ब्राउज़ करें और घंटे के हिसाब से किराए पर लें — कोई प्रतिबद्धता नहीं, पूर्ण root access.
अंतिम अपडेट
क्या यह उपयोगी था?