For the complete documentation index, see llms.txt. This page is also available as Markdown.

SGLang

Clore.ai GPUs पर RadixAttention के साथ उच्च-प्रदर्शन LLM सर्विंग के लिए SGLang डिप्लॉय करें

SGLang (Structured Generation Language) एक उच्च-प्रदर्शन LLM सर्विंग फ्रेमवर्क है, जिसे LMSYS टीम ने विकसित किया है, जो Vicuna और Chatbot Arena पर अपने काम के लिए जानी जाती है। इसमें KV cache sharing के लिए RadixAttention, कुशल MoE (Mixture of Experts) समर्थन, और OpenAI-संगत API शामिल है — जिससे यह CLORE.AI GPU सर्वरों पर उपलब्ध सबसे तेज़ ओपन-सोर्स inference engines में से एक बन जाता है।

सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

RAM

16 GB

32 GB+

VRAM

8 GB

24 GB+

डिस्क

50 GB

200 GB+

GPU

NVIDIA Turing+ (RTX 2000+)

A100, H100, RTX 4090

SGLang Ampere+ GPUs पर FlashInfer सक्षम होने पर सबसे अच्छा प्रदर्शन देता है। Mixtral या DeepSeek जैसे MoE मॉडलों के लिए multi-GPU सेटअप की अनुशंसा की जाती है।

CLORE.AI पर त्वरित परिनियोजन

Docker इमेज: lmsysorg/sglang:latest

पोर्ट्स: 22/tcp, 30000/http

Environment Variables:

वेरिएबल
उदाहरण
विवरण

HF_TOKEN

hf_xxx...

gated models के लिए HuggingFace token

CUDA_VISIBLE_DEVICES

0,1

उपयोग की जाने वाली GPUs

चरण-दर-चरण सेटअप

1. CLORE.AI पर GPU Server किराए पर लें

देखें CLORE.AI मार्केटप्लेस और एक server चुनें:

  • 7B मॉडल: न्यूनतम 16 GB VRAM (RTX 4080, A10)

  • 13B मॉडल: 24 GB VRAM (RTX 3090, RTX 4090, A5000)

  • 70B मॉडल: 80 GB+ VRAM (A100 80GB) या multi-GPU

  • MoE मॉडल (Mixtral 8x7B): 48 GB VRAM या 2× 24 GB

2. अपने Server में SSH करें

3. SGLang Docker Image Pull करें

4. SGLang Server लॉन्च करें

बेसिक लॉन्च (Llama 3.1 8B):

HuggingFace token के साथ:

multi-GPU पर Qwen2.5 72B:

DeepSeek-V2 (MoE model):

5. Server Health जांचें

6. CLORE.AI Proxy के माध्यम से बाहर से पहुँचें

आपका CLORE.AI dashboard एक http_pub port 30000 के लिए URL प्रदान करता है:

किसी भी OpenAI-संगत client में इस URL को अपना base URL के रूप में उपयोग करें।


उपयोग के उदाहरण

उदाहरण 1: OpenAI-संगत Chat Completions

उदाहरण 2: Streaming Response

उदाहरण 3: Python OpenAI Client

उदाहरण 4: SGLang Native API के साथ Batch Inference

SGLang का native API अतिरिक्त नियंत्रण प्रदान करता है:

उदाहरण 5: सीमित JSON आउटपुट

SGLang संरचित आउटपुट generation का समर्थन करता है:


कॉन्फ़िगरेशन

मुख्य लॉन्च पैरामीटर

पैरामीटर
डिफ़ॉल्ट
विवरण

--model-path

आवश्यक

HuggingFace model ID या local path

--host

127.0.0.1

Bind host (उपयोग करें 0.0.0.0 बाहरी के लिए)

--port

30000

Server port

--tp

1

Tensor parallelism degree (num GPUs)

--dp

1

Data parallelism degree

--dtype

auto

float16, bfloat16, float32

--mem-fraction-static

0.88

KV cache के लिए VRAM का अंश

--max-prefill-tokens

auto

एक prefill चरण में अधिकतम tokens

--context-length

मॉडल max

अधिकतम context length को override करें

--trust-remote-code

false

custom model code की अनुमति दें

--quantization

none

awq, gptq, fp8

--load-format

auto

auto, pt, safetensors

--tokenizer-path

model के समान

Custom tokenizer path

Quantization विकल्प

AWQ (गति के लिए अनुशंसित):

FP8 (H100/A100 के लिए):


प्रदर्शन सुझाव

1. RadixAttention — मुख्य लाभ

SGLang का RadixAttention साझा prompt prefixes के लिए KV cache को स्वचालित रूप से पुन: उपयोग करता है। यह विशेष रूप से इनके लिए शक्तिशाली है:

  • लंबे system prompts वाले chatbots

  • बार-बार दोहराए जाने वाले context वाले RAG applications

  • एक ही prefix साझा करने वाले Batch API calls

कोई अतिरिक्त configuration आवश्यक नहीं — यह हमेशा सक्षम रहता है।

2. KV Cache Size बढ़ाएँ

बहुत अधिक न जाएँ — model weights के लिए जगह छोड़ें।

3. लंबे contexts के लिए Chunked Prefill

4. FlashInfer Backend सक्षम करें

SGLang उपलब्ध होने पर FlashInfer का स्वचालित रूप से उपयोग करता है (Ampere+ GPUs):

5. Multi-GPU Tensor Parallelism

उन मॉडलों के लिए जो एक single GPU पर fit नहीं होते:

प्रत्येक GPU के पास model के एक shard के लिए पर्याप्त VRAM होना चाहिए।

6. Throughput बनाम Latency के लिए Tune करें

कम latency (single user):

उच्च throughput (कई users):


समस्या निवारण

समस्या: "torch.cuda.OutOfMemoryError"

समाधान: मेमोरी fraction कम करें या quantization का उपयोग करें:

समस्या: Server शुरू नहीं होता (लोडिंग पर अटक जाता है)

समस्या: "trust_remote_code required"

जोड़ें --trust-remote-code custom architectures (DeepSeek, Falcon, आदि) वाले मॉडलों के लिए launch command में।

समस्या: MoE models पर धीमी generation

MoE models (Mixtral, DeepSeek) memory-bandwidth bound होते हैं। सुनिश्चित करें कि आप उपयोग कर रहे हैं:

समस्या: Context length errors

समस्या: Port 30000 accessible नहीं है

सत्यापित करें कि port आपकी CLORE.AI order configuration में exposed है। अपने order dashboard में http_pub URL जांचें, localhost नहीं।


लिंक्स


Clore.ai GPU अनुशंसाएँ

उपयोग-प्रकरण
अनुशंसित GPU
Clore.ai पर अनुमानित लागत

विकास/परीक्षण

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

उत्पादन (7B–13B)

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

बड़े मॉडल (70B+)

A100 80GB / H100

~$1.04/gpu/hr

💡 इस गाइड के सभी उदाहरण Clore.ai GPU servers पर तैनात किए जा सकते हैं। उपलब्ध GPUs ब्राउज़ करें और घंटे के हिसाब से किराए पर लें — कोई प्रतिबद्धता नहीं, पूर्ण root access.

अंतिम अपडेट

क्या यह उपयोगी था?