TGI (Text Generation Inference)
Clore.ai GPUs पर प्रोडक्शन LLM सर्विंग के लिए HuggingFace Text Generation Inference (TGI) चलाएँ
Text Generation Inference (TGI) HuggingFace का production-grade LLM serving framework है, जिसे high-throughput और low-latency inference के लिए डिज़ाइन किया गया है। यह Flash Attention 2, continuous batching, PagedAttention, और tensor parallelism को out of the box सपोर्ट करता है — जिससे यह CLORE.AI GPU servers पर बड़े language models को scale पर deploy करने के लिए go-to solution बन जाता है।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
RAM
16 GB
32 GB+
VRAM
8 GB
24 GB+
डिस्क
50 GB
200 GB+
GPU
कोई भी NVIDIA (Flash Attention के लिए Ampere+)
A100, H100, RTX 4090
CLORE.AI पर त्वरित परिनियोजन
Docker इमेज: ghcr.io/huggingface/text-generation-inference:latest
पोर्ट: 22/tcp, 8080/http
Environment Variables:
MODEL_ID
mistralai/Mistral-7B-Instruct-v0.3
HuggingFace model ID
HF_TOKEN
hf_xxx...
HuggingFace token (gated models के लिए)
NUM_SHARD
2
tensor parallelism के लिए GPUs की संख्या
MAX_INPUT_LENGTH
4096
अधिकतम input tokens
MAX_TOTAL_TOKENS
8192
अधिकतम input + output tokens
QUANTIZE
bitsandbytes-nf4
Quantization method
चरण-दर-चरण सेटअप
1. CLORE.AI पर GPU Server किराए पर लें
पर जाएँ CLORE.AI मार्केटप्लेस और servers को इनके आधार पर फ़िल्टर करें:
7B models (full precision) के लिए VRAM ≥ 24 GB
7B models (4-bit quantization) के लिए VRAM ≥ 12 GB
70B models (full precision, single GPU) के लिए VRAM ≥ 80 GB
2. SSH के माध्यम से कनेक्ट करें
आपका order confirm होने के बाद, अपने CLORE.AI dashboard से SSH details का उपयोग करके अपने server से कनेक्ट करें:
या अपने CLORE.AI order panel से Web Terminal का उपयोग करें।
3. TGI Docker Image खींचें
4. Model के साथ TGI लॉन्च करें
Basic launch (Mistral 7B):
HuggingFace token के साथ (Llama 3 जैसे gated models के लिए):
4-bit quantization के साथ (कम VRAM के लिए):
Multi-GPU tensor parallelism (70B models के लिए):
5. जाँच करें कि सर्वर चल रहा है
अपेक्षित प्रतिक्रिया: {"status":"ok"}
6. CLORE.AI HTTP प्रॉक्सी के माध्यम से पहुँचें
अपने CLORE.AI order panel में, आप अपना देखेंगे http_pub port 8080 के लिए URL। इससे SSH tunneling के बिना browser/API access मिलता है:
उपयोग के उदाहरण
उदाहरण 1: Basic Text Generation
उदाहरण 2: Chat Completions (OpenAI-compatible)
TGI OpenAI chat completions API format को सपोर्ट करता है:
उदाहरण 3: Streaming Response
उदाहरण 4: Python Client
उदाहरण 5: Batch Requests
कॉन्फ़िगरेशन
मुख्य CLI Parameters
--model-id
आवश्यक
HuggingFace model ID या local path
--num-shard
1
GPU shards की संख्या (tensor parallelism)
--max-concurrent-requests
128
अधिकतम एक साथ अनुरोध
--max-input-length
1024
अधिकतम input token लंबाई
--max-total-tokens
2048
अधिकतम input + output tokens
--max-batch-total-tokens
auto
प्रति batch अधिकतम tokens
--quantize
none
Quantization: bitsandbytes-nf4, gptq, awq
--dtype
auto
float16, bfloat16
--trust-remote-code
false
कस्टम model code की अनुमति दें
--port
80
Server port
Local Model का उपयोग
यदि आपके पास local रूप से डाउनलोड किया हुआ model है:
AWQ Quantization (NF4 से तेज़)
प्रदर्शन सुझाव
1. Flash Attention 2 सक्षम करें
Flash Attention 2 Ampere+ GPUs (RTX 3000+, A100, H100) पर अपने आप सक्षम हो जाता है। किसी अतिरिक्त configuration की आवश्यकता नहीं है।
2. Max Batch Size समायोजित करें
High-throughput scenarios के लिए, batch size बढ़ाएँ:
3. Ampere+ GPUs पर bfloat16 का उपयोग करें
यह float16 की तुलना में अधिक numerically stable है और modern GPUs पर समान रूप से perform करता है।
4. Models को Persistent Storage में पहले डाउनलोड करें
फिर restart पर दोबारा डाउनलोड से बचने के लिए local path mount करें।
5. GPU Memory Management
RTX 3090/4090 (24GB VRAM) के लिए:
6. Speculative Decoding
छोटे models को draft के रूप में उपयोग करके तेज़ generation के लिए:
समस्या निवारण
समस्या: "CUDA out of memory"
समाधान: कम करें --max-total-tokens या quantization सक्षम करें:
समस्या: Model डाउनलोड धीमा है
समाधान: HuggingFace mirror का उपयोग करें या pre-download करें:
समस्या: http_pub के माध्यम से server accessible नहीं है
समाधान: सुनिश्चित करें कि port 8080 सही ढंग से mapped है। TGI अंदरूनी रूप से port 80 पर सुनता है, लेकिन आप इसे बाहरी रूप से 8080 पर map करते हैं:
समस्या: "trust_remote_code is required"
कुछ models (जैसे Falcon, Phi) को custom code की आवश्यकता होती है:
समस्या: पहली प्रतिक्रिया धीमी है
पहला request model को VRAM में लोड करता है। यह सामान्य है। बाद के requests तेज़ होंगे।
समस्या: Container तुरंत exit हो जाता है
लिंक्स
Clore.ai GPU अनुशंसाएँ
विकास/परीक्षण
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Production (7B–13B)
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
बड़े मॉडल (70B+)
A100 80GB / H100
~$1.04/gpu/hr
💡 इस गाइड के सभी उदाहरण Clore.ai GPU servers पर तैनात किए जा सकते हैं। उपलब्ध GPUs ब्राउज़ करें और घंटे के हिसाब से किराए पर लें — कोई प्रतिबद्धता नहीं, पूर्ण root access.
अंतिम अपडेट
क्या यह उपयोगी था?