For the complete documentation index, see llms.txt. This page is also available as Markdown.

TGI (Text Generation Inference)

Clore.ai GPUs पर प्रोडक्शन LLM सर्विंग के लिए HuggingFace Text Generation Inference (TGI) चलाएँ

Text Generation Inference (TGI) HuggingFace का production-grade LLM serving framework है, जिसे high-throughput और low-latency inference के लिए डिज़ाइन किया गया है। यह Flash Attention 2, continuous batching, PagedAttention, और tensor parallelism को out of the box सपोर्ट करता है — जिससे यह CLORE.AI GPU servers पर बड़े language models को scale पर deploy करने के लिए go-to solution बन जाता है।

सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

RAM

16 GB

32 GB+

VRAM

8 GB

24 GB+

डिस्क

50 GB

200 GB+

GPU

कोई भी NVIDIA (Flash Attention के लिए Ampere+)

A100, H100, RTX 4090

Flash Attention 2 के लिए Ampere architecture या उससे नया (RTX 3000+, A100, H100) चाहिए। पुराने GPUs के लिए, TGI अपने आप standard attention पर वापस चला जाएगा।

CLORE.AI पर त्वरित परिनियोजन

Docker इमेज: ghcr.io/huggingface/text-generation-inference:latest

पोर्ट: 22/tcp, 8080/http

Environment Variables:

वेरिएबल
उदाहरण
विवरण

MODEL_ID

mistralai/Mistral-7B-Instruct-v0.3

HuggingFace model ID

HF_TOKEN

hf_xxx...

HuggingFace token (gated models के लिए)

NUM_SHARD

2

tensor parallelism के लिए GPUs की संख्या

MAX_INPUT_LENGTH

4096

अधिकतम input tokens

MAX_TOTAL_TOKENS

8192

अधिकतम input + output tokens

QUANTIZE

bitsandbytes-nf4

Quantization method

चरण-दर-चरण सेटअप

1. CLORE.AI पर GPU Server किराए पर लें

पर जाएँ CLORE.AI मार्केटप्लेस और servers को इनके आधार पर फ़िल्टर करें:

  • 7B models (full precision) के लिए VRAM ≥ 24 GB

  • 7B models (4-bit quantization) के लिए VRAM ≥ 12 GB

  • 70B models (full precision, single GPU) के लिए VRAM ≥ 80 GB

2. SSH के माध्यम से कनेक्ट करें

आपका order confirm होने के बाद, अपने CLORE.AI dashboard से SSH details का उपयोग करके अपने server से कनेक्ट करें:

या अपने CLORE.AI order panel से Web Terminal का उपयोग करें।

3. TGI Docker Image खींचें

4. Model के साथ TGI लॉन्च करें

Basic launch (Mistral 7B):

HuggingFace token के साथ (Llama 3 जैसे gated models के लिए):

4-bit quantization के साथ (कम VRAM के लिए):

Multi-GPU tensor parallelism (70B models के लिए):

5. जाँच करें कि सर्वर चल रहा है

अपेक्षित प्रतिक्रिया: {"status":"ok"}

6. CLORE.AI HTTP प्रॉक्सी के माध्यम से पहुँचें

अपने CLORE.AI order panel में, आप अपना देखेंगे http_pub port 8080 के लिए URL। इससे SSH tunneling के बिना browser/API access मिलता है:


उपयोग के उदाहरण

उदाहरण 1: Basic Text Generation

उदाहरण 2: Chat Completions (OpenAI-compatible)

TGI OpenAI chat completions API format को सपोर्ट करता है:

उदाहरण 3: Streaming Response

उदाहरण 4: Python Client

उदाहरण 5: Batch Requests


कॉन्फ़िगरेशन

मुख्य CLI Parameters

पैरामीटर
डिफ़ॉल्ट
विवरण

--model-id

आवश्यक

HuggingFace model ID या local path

--num-shard

1

GPU shards की संख्या (tensor parallelism)

--max-concurrent-requests

128

अधिकतम एक साथ अनुरोध

--max-input-length

1024

अधिकतम input token लंबाई

--max-total-tokens

2048

अधिकतम input + output tokens

--max-batch-total-tokens

auto

प्रति batch अधिकतम tokens

--quantize

none

Quantization: bitsandbytes-nf4, gptq, awq

--dtype

auto

float16, bfloat16

--trust-remote-code

false

कस्टम model code की अनुमति दें

--port

80

Server port

Local Model का उपयोग

यदि आपके पास local रूप से डाउनलोड किया हुआ model है:

AWQ Quantization (NF4 से तेज़)


प्रदर्शन सुझाव

1. Flash Attention 2 सक्षम करें

Flash Attention 2 Ampere+ GPUs (RTX 3000+, A100, H100) पर अपने आप सक्षम हो जाता है। किसी अतिरिक्त configuration की आवश्यकता नहीं है।

2. Max Batch Size समायोजित करें

High-throughput scenarios के लिए, batch size बढ़ाएँ:

3. Ampere+ GPUs पर bfloat16 का उपयोग करें

यह float16 की तुलना में अधिक numerically stable है और modern GPUs पर समान रूप से perform करता है।

4. Models को Persistent Storage में पहले डाउनलोड करें

फिर restart पर दोबारा डाउनलोड से बचने के लिए local path mount करें।

5. GPU Memory Management

RTX 3090/4090 (24GB VRAM) के लिए:

6. Speculative Decoding

छोटे models को draft के रूप में उपयोग करके तेज़ generation के लिए:


समस्या निवारण

समस्या: "CUDA out of memory"

समाधान: कम करें --max-total-tokens या quantization सक्षम करें:

समस्या: Model डाउनलोड धीमा है

समाधान: HuggingFace mirror का उपयोग करें या pre-download करें:

समस्या: http_pub के माध्यम से server accessible नहीं है

समाधान: सुनिश्चित करें कि port 8080 सही ढंग से mapped है। TGI अंदरूनी रूप से port 80 पर सुनता है, लेकिन आप इसे बाहरी रूप से 8080 पर map करते हैं:

समस्या: "trust_remote_code is required"

कुछ models (जैसे Falcon, Phi) को custom code की आवश्यकता होती है:

समस्या: पहली प्रतिक्रिया धीमी है

पहला request model को VRAM में लोड करता है। यह सामान्य है। बाद के requests तेज़ होंगे।

समस्या: Container तुरंत exit हो जाता है


लिंक्स


Clore.ai GPU अनुशंसाएँ

उपयोग-प्रकरण
अनुशंसित GPU
Clore.ai पर अनुमानित लागत

विकास/परीक्षण

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Production (7B–13B)

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

बड़े मॉडल (70B+)

A100 80GB / H100

~$1.04/gpu/hr

💡 इस गाइड के सभी उदाहरण Clore.ai GPU servers पर तैनात किए जा सकते हैं। उपलब्ध GPUs ब्राउज़ करें और घंटे के हिसाब से किराए पर लें — कोई प्रतिबद्धता नहीं, पूर्ण root access.

अंतिम अपडेट

क्या यह उपयोगी था?