> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/comparisons/llm-serving-comparison.md).

# LLM सर्विंग: Ollama vs vLLM vs TGI

LLM सर्विंग के लिए vLLM बनाम SGLang बनाम Ollama बनाम TGI बनाम LocalAI की तुलना करें

CLORE.AI पर अपनी ज़रूरतों के लिए सही LLM सर्विंग समाधान चुनें।

{% hint style="success" %}
सभी विकल्प उपलब्ध हैं [CLORE.AI मार्केटप्लेस](https://clore.ai/marketplace).
{% endhint %}

{% hint style="info" %}
**2025 अपडेट:** SGLang एक शीर्ष-स्तरीय फ्रेमवर्क के रूप में उभरा है, जो अक्सर **vLLM से बेहतर प्रदर्शन करता है** थ्रूपुट और TTFT बेंचमार्क में। प्रोडक्शन वर्कलोड के लिए vLLM v0.7 और SGLang v0.4 दोनों की सिफारिश की जाती है।
{% endhint %}

## त्वरित निर्णय मार्गदर्शिका

{% hint style="warning" %}
**Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं।** आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता [bare metal](https://clore.ai/bare-metal) के रूप में अनुरोध पर बेची जाती है। देखें [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) किसी deployment का आकार तय करने से पहले।
{% endhint %}

| उपयोग-प्रकरण                     | सर्वोत्तम विकल्प       | क्यों                                 |
| -------------------------------- | ---------------------- | ------------------------------------- |
| त्वरित परीक्षण और चैट            | **Ollama**             | सबसे आसान सेटअप, सबसे तेज़ स्टार्टअप  |
| प्रोडक्शन API (अधिकतम थ्रूपुट)   | **SGLang** या **vLLM** | 2025 में सबसे उच्च थ्रूपुट            |
| तर्क मॉडल (DeepSeek-R1)          | **SGLang**             | तर्क शृंखलाओं के लिए सर्वोत्तम समर्थन |
| HuggingFace एकीकरण               | **TGI**                | मूल HF समर्थन                         |
| स्थानीय विकास                    | **Ollama**             | हर जगह काम करता है                    |
| उच्च समवर्तीता                   | **SGLang** या **vLLM** | निरंतर बैचिंग                         |
| बहु-मोडल (TTS, STT, एम्बेडिंग्स) | **LocalAI**            | सर्व-समावेशी समाधान                   |
| स्ट्रीमिंग ऐप्स                  | **vLLM** या **SGLang** | दोनों उत्कृष्ट                        |

## स्टार्टअप समय तुलना

| समाधान  | सामान्य स्टार्टअप | नोट्स                            |
| ------- | ----------------- | -------------------------------- |
| Ollama  | 30-60 सेकंड       | सबसे तेज़, हल्का                 |
| SGLang  | 3-8 मिनट          | मॉडल को HF से डाउनलोड करता है    |
| vLLM    | 5-15 मिनट         | मॉडल को HF से डाउनलोड करता है    |
| TGI     | 3-10 मिनट         | मॉडल को HF से डाउनलोड करता है    |
| LocalAI | 5-10 मिनट         | कई मॉडलों को पहले से लोड करता है |

{% hint style="info" %}
स्टार्टअप के दौरान HTTP 502 त्रुटियाँ सामान्य हैं - सेवा अभी भी आरंभ हो रही है।
{% endhint %}

***

## सामान्य तुलना

| विशेषता                 | Ollama         | vLLM       | SGLang           | TGI            | LocalAI          |
| ----------------------- | -------------- | ---------- | ---------------- | -------------- | ---------------- |
| **सेटअप की सरलता**      | ⭐⭐⭐⭐⭐          | ⭐⭐⭐        | ⭐⭐⭐              | ⭐⭐⭐            | ⭐⭐⭐⭐             |
| **प्रदर्शन**            | ⭐⭐⭐            | ⭐⭐⭐⭐⭐      | ⭐⭐⭐⭐⭐            | ⭐⭐⭐⭐           | ⭐⭐⭐              |
| **मॉडल समर्थन**         | ⭐⭐⭐⭐           | ⭐⭐⭐⭐⭐      | ⭐⭐⭐⭐⭐            | ⭐⭐⭐⭐           | ⭐⭐⭐⭐             |
| **API अनुकूलता**        | कस्टम + OpenAI | OpenAI     | OpenAI           | कस्टम + OpenAI | OpenAI           |
| **मल्टी-GPU**           | सीमित          | उत्कृष्ट   | उत्कृष्ट         | अच्छा          | सीमित            |
| **मेमोरी दक्षता**       | अच्छा          | उत्कृष्ट   | उत्कृष्ट         | बहुत अच्छा     | अच्छा            |
| **बहु-मोडल**            | केवल विज़न     | केवल विज़न | केवल विज़न       | नहीं           | TTS, STT, एम्बेड |
| **प्रारंभ समय**         | 30 सेकंड       | 5-15 मिनट  | 3-8 मिनट         | 3-10 मिनट      | 5-10 मिनट        |
| **तर्क मॉडल**           | सीमित          | अच्छा      | उत्कृष्ट         | अच्छा          | सीमित            |
| **किसके लिए सर्वोत्तम** | विकास          | प्रोडक्शन  | प्रोडक्शन + तर्क | HF इकोसिस्टम   | बहु-मोडल         |

***

## 2025 बेंचमार्क: DeepSeek-R1-32B

### TTFT, TPOT और थ्रूपुट (A100 80GB, बैच=32, इनपुट=512, आउटपुट=512)

| फ्रेमवर्क       | TTFT (मि.से.) | TPOT (मि.से./टोक) | थ्रूपुट (टोक/से) | नोट्स                           |
| --------------- | ------------- | ----------------- | ---------------- | ------------------------------- |
| **SGLang v0.4** | **180**       | **14**            | **2,850**        | 2025 में समग्र रूप से सर्वोत्तम |
| **vLLM v0.7**   | 240           | 17                | 2,400            | उत्कृष्ट, SGLang के करीब        |
| llama.cpp       | 420           | 28                | 1,100            | CPU+GPU, क्वांटाइज़्ड           |
| Ollama          | 510           | 35                | 820              | उपयोग में आसानी प्राथमिकता      |

> **TTFT** = पहला टोकन आने का समय (लेटेंसी)। **TPOT** = प्रति आउटपुट टोकन समय। दोनों के लिए कम बेहतर है।

### थ्रूपुट तुलना (RTX 4090, Llama 3.1 8B, 10 समवर्ती उपयोगकर्ता)

| फ्रेमवर्क   | टोकन/सेकंड | समवर्ती उपयोगकर्ता | नोट्स                  |
| ----------- | ---------- | ------------------ | ---------------------- |
| SGLang v0.4 | 920        | 20-30              | Radix attention कैशिंग |
| vLLM v0.7   | 870        | 20-30              | PagedAttention         |
| TGI         | 550        | 10-20              |                        |
| Ollama      | 160\*      | —                  | डिफ़ॉल्ट रूप से क्रमिक |

\*Ollama डिफ़ॉल्ट रूप से अनुरोधों को क्रमिक रूप से सर्व करता है

***

## SGLang

### अवलोकन

SGLang (Structured Generation Language) UC Berkeley और LMSYS के शोधकर्ताओं द्वारा विकसित एक उच्च-थ्रूपुट LLM सर्विंग फ्रेमवर्क है। 2025 बेंचमार्क में यह अक्सर vLLM के बराबर या उससे बेहतर प्रदर्शन करता है — खासकर DeepSeek-R1 जैसे तर्क मॉडलों के लिए।

### फायदे

* ✅ 2025 बेंचमार्क में अक्सर सबसे तेज़ TTFT और थ्रूपुट
* ✅ KV-कैश के कुशल पुन: उपयोग के लिए Radix attention
* ✅ तर्क मॉडल (DeepSeek-R1, QwQ) के लिए उत्कृष्ट समर्थन
* ✅ OpenAI-संगत API
* ✅ निरंतर बैचिंग और प्रीफ़िक्स कैशिंग
* ✅ स्पेक्युलेटिव डिकोडिंग समर्थन
* ✅ बहु-GPU टेंसर समानांतरता

### कमियाँ

* ❌ नया इकोसिस्टम, vLLM की तुलना में कम सामुदायिक संसाधन
* ❌ Ollama की तुलना में अधिक जटिल सेटअप
* ❌ केवल Linux

### त्वरित शुरुआत

```bash
pip install sglang[all]

# एक मॉडल सर्व करें
python -m sglang.launch_server \
    --model-path meta-llama/Llama-3.1-8B-Instruct \
    --host 0.0.0.0 \\
    --port 8000
```

### SGLang के साथ DeepSeek-R1

```bash
python -m sglang.launch_server \
    --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \
    --host 0.0.0.0 \\
    --port 8000 \
    --tp 2 \\
    --reasoning-parser deepseek-r1
```

### API उपयोग

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:8000/v1', api_key='dummy')

response = client.chat.completions.create(
    model='meta-llama/Llama-3.1-8B-Instruct',
    messages=[
        {'role': 'user', 'content': 'क्वांटम उलझाव समझाइए'}
    ],
    temperature=0.7,
    max_tokens=512
)
print(response.choices[0].message.content)
```

### मल्टी-GPU

```bash
# 2 GPUs (टेंसर समानांतर)
python -m sglang.launch_server \
    --model-path meta-llama/Llama-3.1-70B-Instruct \
    --host 0.0.0.0 \\
    --port 8000 \
    --tp 2
```

### किसके लिए सर्वोत्तम

* 🎯 अधिकतम थ्रूपुट वाले प्रोडक्शन API
* 🎯 तर्क मॉडल (DeepSeek-R1, QwQ, o1-शैली)
* 🎯 कम-लेटेंसी (TTFT) एप्लिकेशन
* 🎯 प्रीफ़िक्स-प्रधान वर्कलोड (उच्च KV-कैश पुन: उपयोग)

***

## Ollama

### अवलोकन

Ollama स्थानीय रूप से LLM चलाने का सबसे आसान तरीका है। विकास, परीक्षण और व्यक्तिगत उपयोग के लिए उपयुक्त।

### फायदे

* ✅ एक-कमांड इंस्टॉल और रन
* ✅ अंतर्निर्मित मॉडल लाइब्रेरी
* ✅ बेहतरीन CLI अनुभव
* ✅ Mac, Linux, Windows पर काम करता है
* ✅ स्वचालित क्वांटाइज़ेशन
* ✅ कम संसाधन ओवरहेड

### कमियाँ

* ❌ विकल्पों की तुलना में कम थ्रूपुट
* ❌ सीमित बहु-GPU समर्थन
* ❌ प्रोडक्शन-तैयारी कम
* ❌ कम अनुकूलन विकल्प

### त्वरित शुरुआत

```bash
# इंस्टॉल करें
curl -fsSL https://ollama.com/install.sh | sh

# कोई भी मॉडल चलाएँ
ollama run llama3.2
ollama run mistral
ollama run codellama

# API सर्व करें
ollama serve
```

### API उपयोग

```python
import requests

# जनरेट करें
response = requests.post('http://localhost:11434/api/generate', json={
    'model': 'llama3.2',
    'prompt': 'क्वांटम कंप्यूटिंग समझाइए',
    'stream': False
})
print(response.json()['response'])

# चैट
response = requests.post('http://localhost:11434/api/chat', json={
    'model': 'llama3.2',
    'messages': [
        {'role': 'user', 'content': 'नमस्ते!'}
    ]
})
```

### OpenAI अनुकूलता

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')

response = client.chat.completions.create(
    model='llama3.2',
    messages=[{'role': 'user', 'content': 'नमस्ते!'}]
)
```

### प्रदर्शन

| मॉडल          | GPU       | टोकन/सेकंड |
| ------------- | --------- | ---------- |
| Llama 3.2 3B  | RTX 3060  | 45-55      |
| Llama 3.1 8B  | RTX 3090  | 35-45      |
| Llama 3.1 70B | A100 40GB | 15-20      |

### किसके लिए सर्वोत्तम

* 🎯 त्वरित प्रोटोटाइपिंग
* 🎯 व्यक्तिगत AI सहायक
* 🎯 सीखना और प्रयोग
* 🎯 सरल परिनियोजन

***

## vLLM

### अवलोकन

vLLM प्रोडक्शन के लिए एक कठोर-परखी हुई उच्च-थ्रूपुट LLM inference engine है। v0.7 (2025) बेहतर प्रदर्शन, बेहतर क्वांटाइज़ेशन समर्थन और नए स्पेक्युलेटिव डिकोडिंग विकल्प लाता है।

### फायदे

* ✅ सबसे अधिक थ्रूपुट (निरंतर बैचिंग + PagedAttention)
* ✅ कुशल मेमोरी के लिए PagedAttention
* ✅ उत्कृष्ट बहु-GPU समर्थन
* ✅ OpenAI-संगत API
* ✅ प्रोडक्शन-तैयार, बड़ा समुदाय
* ✅ कई क्वांटाइज़ेशन फ़ॉर्मेट्स (AWQ, GPTQ, FP8) का समर्थन
* ✅ v0.7 में स्पेक्युलेटिव डिकोडिंग

### कमियाँ

* ❌ अधिक जटिल सेटअप
* ❌ शुरुआत में अधिक मेमोरी ओवरहेड
* ❌ केवल Linux (मूल Windows/Mac समर्थन नहीं)
* ❌ अधिक कॉन्फ़िगरेशन की आवश्यकता

### त्वरित शुरुआत

```bash
pip install vllm

# मॉडल सर्व करें (vLLM v0.7)
python -m vllm.entrypoints.openai.api_server \
    --model meta-llama/Llama-3.1-8B-Instruct \
    --host 0.0.0.0 \\
    --port 8000
```

### Docker परिनियोजन

```bash
docker run --gpus all -p 8000:8000 \\
    vllm/vllm-openai:v0.7.0 \
    --model meta-llama/Llama-3.1-8B-Instruct
```

### API उपयोग

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:8000/v1', api_key='dummy')

# चैट पूर्णता
response = client.chat.completions.create(
    model='meta-llama/Llama-3.1-8B-Instruct',
    messages=[
        {'role': 'system', 'content': 'आप सहायक हैं।'},
        {'role': 'user', 'content': 'कोडिंग पर एक हाइकु लिखें'}
    ],
    temperature=0.7,
    max_tokens=100
)

# स्ट्रीमिंग
stream = client.chat.completions.create(
    model='meta-llama/Llama-3.1-8B-Instruct',
    messages=[{'role': 'user', 'content': 'मुझे एक कहानी सुनाइए'}],
    stream=True
)
for chunk in stream:
    print(chunk.choices[0].delta.content, end='')
```

### मल्टी-GPU

```bash
# 2 GPUs
python -m vllm.entrypoints.openai.api_server \
    --model meta-llama/Llama-3.1-70B-Instruct \
    --tensor-parallel-size 2

# 4 GPUs
python -m vllm.entrypoints.openai.api_server \
    --model meta-llama/Llama-3.1-70B-Instruct \
    --tensor-parallel-size 4
```

### प्रदर्शन

| मॉडल          | GPU       | टोकन/सेकंड | समवर्ती उपयोगकर्ता |
| ------------- | --------- | ---------- | ------------------ |
| Llama 3.1 8B  | RTX 3090  | 80-100     | 10-20              |
| Llama 3.1 8B  | RTX 4090  | 120-150    | 20-30              |
| Llama 3.1 70B | A100 40GB | 25-35      | 5-10               |
| Llama 3.1 70B | 2x A100   | 50-70      | 15-25              |

### किसके लिए सर्वोत्तम

* 🎯 बड़े समुदाय वाले प्रोडक्शन API
* 🎯 उच्च-ट्रैफ़िक एप्लिकेशन
* 🎯 बहु-उपयोगकर्ता चैट सेवाएँ
* 🎯 अधिकतम थ्रूपुट की ज़रूरतें

***

## Text Generation Inference (TGI)

### अवलोकन

HuggingFace का प्रोडक्शन सर्वर, HF इकोसिस्टम के साथ गहराई से एकीकृत।

### फायदे

* ✅ मूल HuggingFace एकीकरण
* ✅ HF मॉडलों के लिए बेहतरीन
* ✅ अच्छा बहु-GPU समर्थन
* ✅ अंतर्निर्मित सुरक्षा सुविधाएँ
* ✅ Prometheus मेट्रिक्स
* ✅ अच्छी तरह प्रलेखित

### कमियाँ

* ❌ vLLM/SGLang की तुलना में थोड़ा कम थ्रूपुट
* ❌ अधिक संसाधन-गहन
* ❌ जटिल कॉन्फ़िगरेशन
* ❌ अधिक लंबा स्टार्टअप समय

### त्वरित शुरुआत

```bash
# Docker (अनुशंसित)
docker run --gpus all -p 8080:80 \
    ghcr.io/huggingface/text-generation-inference:latest \
    --model-id meta-llama/Llama-3.1-8B-Instruct

# gated मॉडलों के लिए HF टोकन के साथ
docker run --gpus all -p 8080:80 \
    -e HUGGING_FACE_HUB_TOKEN=$HF_TOKEN \
    ghcr.io/huggingface/text-generation-inference:latest \
    --model-id meta-llama/Llama-3.1-8B-Instruct
```

### प्रदर्शन

| मॉडल          | GPU       | टोकन/सेकंड | समवर्ती उपयोगकर्ता |
| ------------- | --------- | ---------- | ------------------ |
| Llama 3.1 8B  | RTX 3090  | 60-80      | 8-15               |
| Llama 3.1 8B  | RTX 4090  | 90-120     | 15-25              |
| Llama 3.1 70B | A100 40GB | 20-30      | 3-8                |

### किसके लिए सर्वोत्तम

* 🎯 HuggingFace मॉडल उपयोगकर्ता
* 🎯 अनुसंधान परिवेश
* 🎯 अंतर्निर्मित सुरक्षा सुविधाओं की आवश्यकता
* 🎯 Prometheus मॉनिटरिंग की ज़रूरतें

***

## LocalAI

### अवलोकन

LocalAI एक OpenAI-संगत API है जो कई मोडैलिटीज़ का समर्थन करता है: LLMs, TTS, STT, एम्बेडिंग्स और इमेज जनरेशन।

### फायदे

* ✅ बहु-मोडल समर्थन (LLM, TTS, STT, एम्बेडिंग्स)
* ✅ सीधे बदला जा सकने वाला OpenAI विकल्प
* ✅ पहले से बने मॉडल उपलब्ध
* ✅ GGUF मॉडलों का समर्थन
* ✅ रीरैंकिंग समर्थन
* ✅ Swagger UI दस्तावेज़ीकरण

### कमियाँ

* ❌ अधिक लंबा स्टार्टअप समय (5-10 मिनट)
* ❌ vLLM/SGLang की तुलना में कम LLM थ्रूपुट
* ❌ इमेज जनरेशन में CUDA समस्याएँ हो सकती हैं
* ❌ केवल LLM उपयोग के लिए अधिक जटिल

### त्वरित शुरुआत

```bash
docker run --gpus all -p 8080:8080 localai/localai:master-aio-gpu-nvidia-cuda-12
```

### API उपयोग

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:8080/v1', api_key='dummy')

# चैट
response = client.chat.completions.create(
    model='gpt-4',
    messages=[{'role': 'user', 'content': 'नमस्ते!'}]
)

# TTS
audio = client.audio.speech.create(model='tts-1', input='Hello world', voice='alloy')

# STT
transcript = client.audio.transcriptions.create(model='whisper-1', file=open('audio.mp3', 'rb'))

# एम्बेडिंग्स
embeddings = client.embeddings.create(model='text-embedding-ada-002', input='Hello world')
```

### किसके लिए सर्वोत्तम

* 🎯 कई मोडैलिटीज़ (TTS, STT, LLM) की आवश्यकता
* 🎯 OpenAI API अनुकूलता चाहते हैं
* 🎯 GGUF मॉडल चला रहे हैं
* 🎯 दस्तावेज़ रीरैंकिंग वर्कफ़्लो

***

## प्रदर्शन तुलना (2025)

### थ्रूपुट (टोकन/सेकंड) — एकल उपयोगकर्ता

| मॉडल                      | Ollama | vLLM v0.7 | SGLang v0.4 | TGI |
| ------------------------- | ------ | --------- | ----------- | --- |
| Llama 3.1 8B (RTX 3090)   | 40     | 90        | 100         | 70  |
| Llama 3.1 8B (RTX 4090)   | 65     | 140       | 160         | 110 |
| Llama 3.1 70B (A100 40GB) | 18     | 30        | 35          | 25  |

### थ्रूपुट — कई उपयोगकर्ता (10 समवर्ती)

| मॉडल                      | Ollama | vLLM v0.7 | SGLang v0.4 | TGI |
| ------------------------- | ------ | --------- | ----------- | --- |
| Llama 3.1 8B (RTX 4090)   | 150\*  | 800       | 920         | 500 |
| Llama 3.1 70B (A100 40GB) | 50\*   | 200       | 240         | 150 |

\*Ollama डिफ़ॉल्ट रूप से क्रमिक रूप से सर्व करता है

### मेमोरी उपयोग

| मॉडल               | Ollama | vLLM v0.7 | SGLang v0.4 | TGI  |
| ------------------ | ------ | --------- | ----------- | ---- |
| Llama 3.1 8B       | 5GB    | 6GB       | 6GB         | 7GB  |
| Llama 3.1 70B (Q4) | 38GB   | 40GB      | 39GB        | 42GB |

### पहले टोकन तक का समय (TTFT) — DeepSeek-R1-32B

| फ्रेमवर्क   | TTFT (A100 80GB) | TPOT (मि.से./टोक) |
| ----------- | ---------------- | ----------------- |
| SGLang v0.4 | **180ms**        | **14ms**          |
| vLLM v0.7   | 240ms            | 17ms              |
| llama.cpp   | 420ms            | 28ms              |
| Ollama      | 510ms            | 35ms              |

***

## फ़ीचर तुलना

| विशेषता              | Ollama | vLLM v0.7      | SGLang v0.4    | TGI               | LocalAI    |
| -------------------- | ------ | -------------- | -------------- | ----------------- | ---------- |
| OpenAI API           | ✅      | ✅              | ✅              | ✅                 | ✅          |
| स्ट्रीमिंग           | ✅      | ✅              | ✅              | ✅                 | ✅          |
| बैचिंग               | बेसिक  | निरंतर         | निरंतर         | गतिशील            | बेसिक      |
| मल्टी-GPU            | सीमित  | उत्कृष्ट       | उत्कृष्ट       | अच्छा             | सीमित      |
| क्वांटाइज़ेशन        | GGUF   | AWQ, GPTQ, FP8 | AWQ, GPTQ, FP8 | bitsandbytes, AWQ | GGUF       |
| LoRA                 | ✅      | ✅              | ✅              | ✅                 | ✅          |
| Speculative Decoding | ❌      | ✅              | ✅              | ✅                 | ❌          |
| प्रीफ़िक्स कैशिंग    | ❌      | ✅              | ✅ (Radix)      | ✅                 | ❌          |
| तर्क मॉडल            | सीमित  | अच्छा          | उत्कृष्ट       | अच्छा             | सीमित      |
| मेट्रिक्स            | बेसिक  | Prometheus     | Prometheus     | Prometheus        | Prometheus |
| फ़ंक्शन कॉलिंग       | ✅      | ✅              | ✅              | ✅                 | ✅          |
| विज़न मॉडल           | ✅      | ✅              | ✅              | ✅                 | सीमित      |
| TTS                  | ❌      | ❌              | ❌              | ❌                 | ✅          |
| STT                  | ❌      | ❌              | ❌              | ❌                 | ✅          |
| एम्बेडिंग्स          | ✅      | सीमित          | सीमित          | सीमित             | ✅          |

***

## कब क्या उपयोग करें

### Ollama का उपयोग कब करें:

* आप 5 मिनट में शुरुआत करना चाहते हैं
* आप प्रोटोटाइप बना रहे हैं या सीख रहे हैं
* आपको व्यक्तिगत AI सहायक चाहिए
* आप Mac या Windows पर हैं
* सरलता, गति से अधिक महत्वपूर्ण है

### SGLang का उपयोग कब करें:

* आपको चाहिए **सबसे कम संभव लेटेंसी** (TTFT)
* आप सर्व कर रहे हैं **तर्क मॉडल** (DeepSeek-R1, QwQ, o1-शैली)
* आपके वर्कलोड में भारी **प्रीफ़िक्स साझा करना** (RAG, सिस्टम प्रॉम्प्ट)
* आपको 2025 बेंचमार्क में शीर्ष-स्तरीय थ्रूपुट चाहिए
* आप अत्याधुनिक अनुकूलन (Radix attention) चाहते हैं

### vLLM का उपयोग कब करें:

* आपको एक साथ अधिकतम थ्रूपुट चाहिए **परिपक्व, अच्छी तरह समर्थित** फ्रेमवर्क
* आप बड़े पैमाने पर कई उपयोगकर्ताओं को सर्व कर रहे हैं
* आपको बड़े समुदाय के साथ प्रोडक्शन-स्तरीय विश्वसनीयता चाहिए
* आप OpenAI का सीधे बदला जा सकने वाला विकल्प चाहते हैं
* आपके पास बहु-GPU सेटअप हैं
* आपको विस्तृत मॉडल फ़ॉर्मेट समर्थन (AWQ, GPTQ, FP8) चाहिए

### TGI का उपयोग कब करें:

* आप HuggingFace इकोसिस्टम में हैं
* आपको अंतर्निर्मित सुरक्षा सुविधाएँ चाहिए
* आपको विस्तृत Prometheus मेट्रिक्स चाहिए
* आपको HF मॉडल सीधे सर्व करने हैं
* आप शोध परिवेश में हैं

### LocalAI का उपयोग कब करें:

* आपको LLM के साथ TTS और STT चाहिए
* आप RAG के लिए एम्बेडिंग्स चाहते हैं
* आपको दस्तावेज़ रीरैंकिंग चाहिए
* आप एक ही सर्व-समावेशी समाधान चाहते हैं
* आप वॉइस-सक्षम ऐप्स बना रहे हैं

***

## माइग्रेशन मार्गदर्शिका

### Ollama से SGLang तक

```python
# Ollama
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
response = client.chat.completions.create(model='llama3.2', ...)

# SGLang - बस URL और मॉडल नाम बदलें
client = OpenAI(base_url='http://localhost:8000/v1', api_key='dummy')
response = client.chat.completions.create(model='meta-llama/Llama-3.2-3B-Instruct', ...)
```

### vLLM से SGLang तक

दोनों OpenAI API का समर्थन करते हैं - बस endpoint URL बदलें। APIs पूरी तरह संगत हैं।

```bash
# vLLM
python -m vllm.entrypoints.openai.api_server --model ... --port 8000

# SGLang (समकक्ष)
python -m sglang.launch_server --model-path ... --port 8000
```

***

## GPU के अनुसार सिफारिशें

| GPU           | एकल उपयोगकर्ता | बहु-उपयोगकर्ता | तर्क मॉडल |
| ------------- | -------------- | -------------- | --------- |
| RTX 3060 12GB | Ollama         | Ollama         | Ollama    |
| RTX 3090 24GB | Ollama         | vLLM           | SGLang    |
| RTX 4090 24GB | SGLang/vLLM    | SGLang/vLLM    | SGLang    |
| A100 40GB+    | SGLang         | SGLang         | SGLang    |

***

## अगले चरण

* [Ollama गाइड](/guides/guides_v2-hi/language-models/ollama.md) - सबसे आसान सेटअप
* [vLLM गाइड](/guides/guides_v2-hi/language-models/vllm.md) - सबसे अधिक थ्रूपुट
* [LocalAI गाइड](/guides/guides_v2-hi/language-models/localai-openai-compatible.md) - मल्टी-मोडल समर्थन
* [DeepSeek-R1 गाइड](/guides/guides_v2-hi/language-models/deepseek-r1.md) - तर्कशील मॉडल
* [मल्टी-GPU सेटअप](/guides/guides_v2-hi/advanced/multi-gpu-setup.md) - बड़े मॉडलों तक स्केल करें
* [API एकीकरण](/guides/guides_v2-hi/advanced/api-integration.md) - एप्लिकेशन बनाएं


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/comparisons/llm-serving-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
