> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/sravneniya/llm-serving-comparison.md).

# Сервинг LLM: Ollama vs vLLM vs TGI

Выберите подходящее решение для обслуживания LLM под ваши задачи на CLORE.AI.

{% hint style="success" %}
Все варианты доступны на [маркетплейс CLORE.AI](https://clore.ai/marketplace).
{% endhint %}

{% hint style="info" %}
**Обновление 2025 года:** SGLang стал фреймворком топ-уровня, часто **обгоняя vLLM** в бенчмарках по пропускной способности и TTFT. Для производственных нагрузок рекомендуются и vLLM v0.7, и SGLang v0.4.
{% endhint %}

## Краткое руководство по выбору

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

| Сценарий использования                               | Лучший выбор            | Почему                                        |
| ---------------------------------------------------- | ----------------------- | --------------------------------------------- |
| Быстрое тестирование и чат                           | **компонент**           | Самая простая настройка, самый быстрый запуск |
| Production API (максимальная пропускная способность) | **SGLang** или **vLLM** | Наивысшая пропускная способность в 2025 году  |
| Модели рассуждения (DeepSeek-R1)                     | **SGLang**              | Лучшая поддержка цепочек рассуждений          |
| Интеграция с HuggingFace                             | **TGI**                 | Нативная поддержка HF                         |
| Локальная разработка                                 | **компонент**           | Работает везде                                |
| Высокая конкуренция                                  | **SGLang** или **vLLM** | Непрерывный батчинг                           |
| Мультимодальность (TTS, STT, эмбеддинги)             | **LocalAI**             | Универсальное решение                         |
| Стриминговые приложения                              | **vLLM** или **SGLang** | Оба отличные                                  |

## Сравнение времени запуска

| Решение   | Типичный запуск | Примечания                      |
| --------- | --------------- | ------------------------------- |
| компонент | 30–60 секунд    | Самый быстрый, лёгкий           |
| SGLang    | 3–8 минут       | Загружает модель из HF          |
| vLLM      | 5–15 минут      | Загружает модель из HF          |
| TGI       | 3–10 минут      | Загружает модель из HF          |
| LocalAI   | 5–10 минут      | Предзагружает несколько моделей |

{% hint style="info" %}
Ошибки HTTP 502 во время запуска — это нормально: служба всё ещё инициализируется.
{% endhint %}

***

## Сравнение обзора

| Функция                  | компонент                 | vLLM          | SGLang                   | TGI                       | LocalAI              |
| ------------------------ | ------------------------- | ------------- | ------------------------ | ------------------------- | -------------------- |
| **Простота настройки**   | ⭐⭐⭐⭐⭐                     | ⭐⭐⭐           | ⭐⭐⭐                      | ⭐⭐⭐                       | ⭐⭐⭐⭐                 |
| **Производительность**   | ⭐⭐⭐                       | ⭐⭐⭐⭐⭐         | ⭐⭐⭐⭐⭐                    | ⭐⭐⭐⭐                      | ⭐⭐⭐                  |
| **Поддержка моделей**    | ⭐⭐⭐⭐                      | ⭐⭐⭐⭐⭐         | ⭐⭐⭐⭐⭐                    | ⭐⭐⭐⭐                      | ⭐⭐⭐⭐                 |
| **Совместимость API**    | Пользовательский + OpenAI | OpenAI        | OpenAI                   | Пользовательский + OpenAI | OpenAI               |
| **Несколько GPU**        | Ограниченная              | Отлично       | Отлично                  | Хорошо                    | Ограниченная         |
| **Эффективность памяти** | Хорошо                    | Отлично       | Отлично                  | Очень хорошо              | Хорошо               |
| **Мультимодальность**    | Только vision             | Только vision | Только vision            | Нет                       | TTS, STT, эмбеддинги |
| **Время запуска**        | 30 сек                    | 5–15 мин      | 3–8 мин                  | 3–10 мин                  | 5–10 мин             |
| **Модели рассуждения**   | Ограниченная              | Хорошо        | Отлично                  | Хорошо                    | Ограниченная         |
| **Лучше всего для**      | Разработка                | Продакшен     | Production + рассуждения | Экосистема HF             | Мультимодальный      |

***

## Бенчмарки 2025: DeepSeek-R1-32B

### TTFT, TPOT и пропускная способность (A100 80GB, batch=32, input=512, output=512)

| Фреймворк       | TTFT (мс) | TPOT (мс/токен) | Пропускная способность (токенов/с) | Примечания                       |
| --------------- | --------- | --------------- | ---------------------------------- | -------------------------------- |
| **SGLang v0.4** | **180**   | **14**          | **2,850**                          | Лучший в целом в 2025 году       |
| **vLLM v0.7**   | 240       | 17              | 2,400                              | Отлично, близко к SGLang         |
| llama.cpp       | 420       | 28              | 1,100                              | CPU+GPU, квантизованные          |
| компонент       | 510       | 35              | 820                                | Приоритет простоты использования |

> **TTFT** = Time to First Token (задержка до первого токена). **TPOT** = Time Per Output Token. Меньше — лучше для обоих.

### Сравнение пропускной способности (RTX 4090, Llama 3.1 8B, 10 одновременных пользователей)

| Фреймворк   | Токенов/сек | Одновременные пользователи | Примечания                   |
| ----------- | ----------- | -------------------------- | ---------------------------- |
| SGLang v0.4 | 920         | 20-30                      | Кеширование внимания Radix   |
| vLLM v0.7   | 870         | 20-30                      | PagedAttention               |
| TGI         | 550         | 10-20                      |                              |
| компонент   | 160\*       | —                          | Последовательно по умолчанию |

\*Ollama по умолчанию обрабатывает запросы последовательно

***

## SGLang

### Обзор

SGLang (Structured Generation Language) — это фреймворк обслуживания LLM с высокой пропускной способностью, разработанный исследователями из UC Berkeley и LMSYS. В бенчмарках 2025 года он часто сравним с vLLM или превосходит его — особенно для моделей рассуждения, таких как DeepSeek-R1.

### Плюсы

* ✅ Часто самый быстрый TTFT и максимальная пропускная способность в бенчмарках 2025 года
* ✅ Radix attention для эффективного повторного использования KV-кеша
* ✅ Отличная поддержка моделей рассуждения (DeepSeek-R1, QwQ)
* ✅ API, совместимый с OpenAI
* ✅ Непрерывный батчинг и кеширование префиксов
* ✅ Поддержка speculative decoding
* ✅ Тензорный параллелизм на нескольких GPU

### Минусы

* ❌ Более новая экосистема, меньше материалов сообщества, чем у vLLM
* ❌ Более сложная настройка, чем у Ollama
* ❌ Только Linux

### Быстрый старт

```bash
pip install sglang[all]

# Запустить модель
python -m sglang.launch_server \",
    --model-path meta-llama/Llama-3.1-8B-Instruct \",
    --host 0.0.0.0 \
    --port 8000
```

### DeepSeek-R1 с SGLang

```bash
python -m sglang.launch_server \",
    --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \",
    --host 0.0.0.0 \
    --port 8000 \\
    --tp 2 \
    --reasoning-parser deepseek-r1
```

### Использование API

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:8000/v1', api_key='dummy')

response = client.chat.completions.create(
    model='meta-llama/Llama-3.1-8B-Instruct',
    messages=[
        {'role': 'user', 'content': 'Объясни квантовую запутанность'}
    ],
    temperature=0.7,
    max_tokens=512
)
print(response.choices[0].message.content)
```

### Несколько GPU

```bash
# 2 GPU (тензорный параллелизм)
python -m sglang.launch_server \",
    --model-path meta-llama/Llama-3.1-70B-Instruct \",
    --host 0.0.0.0 \
    --port 8000 \\
    --tp 2
```

### Лучше всего для

* 🎯 Production API с максимальной пропускной способностью
* 🎯 Модели рассуждения (DeepSeek-R1, QwQ, в стиле o1)
* 🎯 Приложения с низкой задержкой (TTFT)
* 🎯 Нагрузки с большим числом префиксов (высокое повторное использование KV-кеша)

***

## компонент

### Обзор

Ollama — это самый простой способ запускать LLM локально. Идеально подходит для разработки, тестирования и личного использования.

### Плюсы

* ✅ Установка и запуск одной командой
* ✅ Встроенная библиотека моделей
* ✅ Отличный опыт работы через CLI
* ✅ Работает на Mac, Linux, Windows
* ✅ Автоматическая квантизация
* ✅ Низкие затраты ресурсов

### Минусы

* ❌ Ниже пропускная способность, чем у альтернатив
* ❌ Ограниченная поддержка нескольких GPU
* ❌ Менее готово к продакшену
* ❌ Меньше вариантов оптимизации

### Быстрый старт

```bash
# Установка
curl -fsSL https://ollama.com/install.sh | sh

# Запустить любую модель
ollama run llama3.2
ollama run mistral
ollama run codellama

# Поднять API
ollama serve
```

### Использование API

```python
import requests

# Генерировать
response = requests.post('http://localhost:11434/api/generate', json={
    'model': 'llama3.2',
    'prompt': 'Объясни квантовые вычисления',
    'stream': False
})
print(response.json()['response'])

# Чат
response = requests.post('http://localhost:11434/api/chat', json={
    'model': 'llama3.2',
    'messages': [
        {'role': 'user', 'content': 'Привет!'}
    ]
})
```

### Совместимость с OpenAI

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')

response = client.chat.completions.create(
    model='llama3.2',
    messages=[{'role': 'user', 'content': 'Привет!'}]
)
```

### Производительность

| Модель        | GPU        | Токенов/сек |
| ------------- | ---------- | ----------- |
| Llama 3.2 3B  | RTX 3060   | 45-55       |
| Llama 3.1 8B  | RTX 3090   | 35-45       |
| Llama 3.1 70B | A100 40 ГБ | 15-20       |

### Лучше всего для

* 🎯 Быстрое прототипирование
* 🎯 Личный AI-ассистент
* 🎯 Обучение и эксперименты
* 🎯 Простые развёртывания

***

## vLLM

### Обзор

vLLM — это проверенный в боях движок инференса LLM с высокой пропускной способностью для продакшена. v0.7 (2025) приносит улучшенную производительность, лучшую поддержку квантизации и новые опции speculative decoding.

### Плюсы

* ✅ Наивысшая пропускная способность (непрерывный батчинг + PagedAttention)
* ✅ PagedAttention для эффективной работы с памятью
* ✅ Отличная поддержка нескольких GPU
* ✅ API, совместимый с OpenAI
* ✅ Готов к продакшену, большое сообщество
* ✅ Поддерживает многие форматы квантизации (AWQ, GPTQ, FP8)
* ✅ Speculative decoding в v0.7

### Минусы

* ❌ Более сложная настройка
* ❌ Более высокие затраты памяти при запуске
* ❌ Только Linux (нет нативной поддержки Windows/Mac)
* ❌ Требует больше конфигурации

### Быстрый старт

```bash
pip install vllm

# Запустить модель (vLLM v0.7)
python -m vllm.entrypoints.openai.api_server \\
    --model meta-llama/Llama-3.1-8B-Instruct \",
    --host 0.0.0.0 \
    --port 8000
```

### Развёртывание через Docker

```bash
docker run --gpus all -p 8000:8000 \
    vllm/vllm-openai:v0.7.0 \",
    --model meta-llama/Llama-3.1-8B-Instruct
```

### Использование API

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:8000/v1', api_key='dummy')

# Завершение чата
response = client.chat.completions.create(
    model='meta-llama/Llama-3.1-8B-Instruct',
    messages=[
        {'role': 'system', 'content': 'Вы полезный ассистент.'},
        {'role': 'user', 'content': 'Напиши хайку о программировании'}
    ],
    temperature=0.7,
    max_tokens=100
)

# Потоковая передача
stream = client.chat.completions.create(
    model='meta-llama/Llama-3.1-8B-Instruct',
    messages=[{'role': 'user', 'content': 'Расскажи мне историю'}],
    stream=True
)
for chunk in stream:
    print(chunk.choices[0].delta.content, end='')
```

### Несколько GPU

```bash
# 2 GPU
python -m vllm.entrypoints.openai.api_server \\
    --model meta-llama/Llama-3.1-70B-Instruct \\
    --tensor-parallel-size 2

# 4 GPU
python -m vllm.entrypoints.openai.api_server \\
    --model meta-llama/Llama-3.1-70B-Instruct \\
    --tensor-parallel-size 4
```

### Производительность

| Модель        | GPU        | Токенов/сек | Одновременные пользователи |
| ------------- | ---------- | ----------- | -------------------------- |
| Llama 3.1 8B  | RTX 3090   | 80-100      | 10-20                      |
| Llama 3.1 8B  | RTX 4090   | 120-150     | 20-30                      |
| Llama 3.1 70B | A100 40 ГБ | 25-35       | 5-10                       |
| Llama 3.1 70B | 2x A100    | 50-70       | 15-25                      |

### Лучше всего для

* 🎯 Production API с большим сообществом
* 🎯 Приложения с высоким трафиком
* 🎯 Сервисы чата для множества пользователей
* 🎯 Потребность в максимальной пропускной способности

***

## Text Generation Inference (TGI)

### Обзор

Продакшен-сервер HuggingFace, тесно интегрированный с экосистемой HF.

### Плюсы

* ✅ Нативная интеграция с HuggingFace
* ✅ Отлично подходит для моделей HF
* ✅ Хорошая поддержка нескольких GPU
* ✅ Встроенные функции безопасности
* ✅ Метрики Prometheus
* ✅ Хорошо документирован

### Минусы

* ❌ Немного ниже пропускная способность, чем у vLLM/SGLang
* ❌ Более требователен к ресурсам
* ❌ Сложная конфигурация
* ❌ Более длительное время запуска

### Быстрый старт

```bash
# Docker (рекомендуется)
docker run --gpus all -p 8080:80 \",
    ghcr.io/huggingface/text-generation-inference:latest \",
    --model-id meta-llama/Llama-3.1-8B-Instruct

# С HF-токеном для закрытых моделей
docker run --gpus all -p 8080:80 \",
    -e HUGGING_FACE_HUB_TOKEN=$HF_TOKEN \",
    ghcr.io/huggingface/text-generation-inference:latest \",
    --model-id meta-llama/Llama-3.1-8B-Instruct
```

### Производительность

| Модель        | GPU        | Токенов/сек | Одновременные пользователи |
| ------------- | ---------- | ----------- | -------------------------- |
| Llama 3.1 8B  | RTX 3090   | 60-80       | 8-15                       |
| Llama 3.1 8B  | RTX 4090   | 90-120      | 15-25                      |
| Llama 3.1 70B | A100 40 ГБ | 20-30       | 3-8                        |

### Лучше всего для

* 🎯 Пользователи моделей HuggingFace
* 🎯 Исследовательские среды
* 🎯 Нужны встроенные функции безопасности
* 🎯 Нужен мониторинг Prometheus

***

## LocalAI

### Обзор

LocalAI — это API, совместимый с OpenAI, которое поддерживает несколько модальностей: LLM, TTS, STT, эмбеддинги и генерацию изображений.

### Плюсы

* ✅ Поддержка нескольких модальностей (LLM, TTS, STT, эмбеддинги)
* ✅ Полная замена OpenAI без изменений кода
* ✅ Доступны готовые модели
* ✅ Поддерживает модели GGUF
* ✅ Поддержка reranking
* ✅ Документация Swagger UI

### Минусы

* ❌ Более долгое время запуска (5–10 минут)
* ❌ Ниже пропускная способность LLM, чем у vLLM/SGLang
* ❌ При генерации изображений могут быть проблемы с CUDA
* ❌ Более сложно для использования только с LLM

### Быстрый старт

```bash
docker run --gpus all -p 8080:8080 localai/localai:master-aio-gpu-nvidia-cuda-12
```

### Использование API

```python
from openai import OpenAI

client = OpenAI(base_url='http://localhost:8080/v1', api_key='dummy')

# Чат
response = client.chat.completions.create(
    model='gpt-4',
    messages=[{'role': 'user', 'content': 'Привет!'}]
)

# TTS
audio = client.audio.speech.create(model='tts-1', input='Hello world', voice='alloy')

# STT
transcript = client.audio.transcriptions.create(model='whisper-1', file=open('audio.mp3', 'rb'))

# Эмбеддинги
embeddings = client.embeddings.create(model='text-embedding-ada-002', input='Hello world')
```

### Лучше всего для

* 🎯 Нужны несколько модальностей (TTS, STT, LLM)
* 🎯 Нужна совместимость с API OpenAI
* 🎯 Запуск моделей GGUF
* 🎯 Рабочие процессы reranking документов

***

## Сравнение производительности (2025)

### Пропускная способность (токенов/сек) — один пользователь

| Модель                    | компонент | vLLM v0.7 | SGLang v0.4 | TGI |
| ------------------------- | --------- | --------- | ----------- | --- |
| Llama 3.1 8B (RTX 3090)   | 40        | 90        | 100         | 70  |
| Llama 3.1 8B (RTX 4090)   | 65        | 140       | 160         | 110 |
| Llama 3.1 70B (A100 40GB) | 18        | 30        | 35          | 25  |

### Пропускная способность — несколько пользователей (10 одновременно)

| Модель                    | компонент | vLLM v0.7 | SGLang v0.4 | TGI |
| ------------------------- | --------- | --------- | ----------- | --- |
| Llama 3.1 8B (RTX 4090)   | 150\*     | 800       | 920         | 500 |
| Llama 3.1 70B (A100 40GB) | 50\*      | 200       | 240         | 150 |

\*Ollama по умолчанию обрабатывает последовательно

### Использование памяти

| Модель             | компонент | vLLM v0.7 | SGLang v0.4 | TGI   |
| ------------------ | --------- | --------- | ----------- | ----- |
| Llama 3.1 8B       | 5 ГБ      | 6 ГБ      | 6 ГБ        | 7 ГБ  |
| Llama 3.1 70B (Q4) | 38 ГБ     | 40 ГБ     | 39 ГБ       | 42 ГБ |

### Время до первого токена (TTFT) — DeepSeek-R1-32B

| Фреймворк   | TTFT (A100 80GB) | TPOT (мс/токен) |
| ----------- | ---------------- | --------------- |
| SGLang v0.4 | **180 мс**       | **14 мс**       |
| vLLM v0.7   | 240 мс           | 17 мс           |
| llama.cpp   | 420 мс           | 28 мс           |
| компонент   | 510 мс           | 35 мс           |

***

## Сравнение функций

| Функция                     | компонент    | vLLM v0.7      | SGLang v0.4    | TGI               | LocalAI      |
| --------------------------- | ------------ | -------------- | -------------- | ----------------- | ------------ |
| API OpenAI                  | ✅            | ✅              | ✅              | ✅                 | ✅            |
| Потоковая передача          | ✅            | ✅              | ✅              | ✅                 | ✅            |
| Батчинг                     | Базовый      | Непрерывный    | Непрерывный    | Динамический      | Базовый      |
| Несколько GPU               | Ограниченная | Отлично        | Отлично        | Хорошо            | Ограниченная |
| Квантование                 | GGUF         | AWQ, GPTQ, FP8 | AWQ, GPTQ, FP8 | bitsandbytes, AWQ | GGUF         |
| LoRA                        | ✅            | ✅              | ✅              | ✅                 | ✅            |
| Спекулятивное декодирование | ❌            | ✅              | ✅              | ✅                 | ❌            |
| Кеширование префиксов       | ❌            | ✅              | ✅ (Radix)      | ✅                 | ❌            |
| Модели рассуждения          | Ограниченная | Хорошо         | Отлично        | Хорошо            | Ограниченная |
| Метрики                     | Базовый      | Prometheus     | Prometheus     | Prometheus        | Prometheus   |
| Вызов функций               | ✅            | ✅              | ✅              | ✅                 | ✅            |
| Модели зрения               | ✅            | ✅              | ✅              | ✅                 | Ограниченная |
| TTS                         | ❌            | ❌              | ❌              | ❌                 | ✅            |
| STT                         | ❌            | ❌              | ❌              | ❌                 | ✅            |
| Эмбеддинги                  | ✅            | Ограниченная   | Ограниченная   | Ограниченная      | ✅            |

***

## Когда что использовать

### Используйте Ollama, если:

* Вы хотите начать через 5 минут
* Вы прототипируете или учитесь
* Вам нужен личный AI-ассистент
* Вы на Mac или Windows
* Простота важнее скорости

### Используйте SGLang, если:

* Вам нужна **абсолютно минимальная задержка** (TTFT)
* Вы обслуживаете **модели рассуждения** (DeepSeek-R1, QwQ, в стиле o1)
* У вас нагрузки с высоким уровнем **совместного использования префиксов** (RAG, системные промпты)
* Вам нужна топовая пропускная способность в бенчмарках 2025 года
* Вы хотите передовые оптимизации (Radix attention)

### Используйте vLLM, если:

* Вам нужна максимальная пропускная способность с **зрелым, хорошо поддерживаемым** фреймворком
* Вы обслуживаете много пользователей в масштабе
* Вам нужна надёжность продакшена и большое сообщество
* Вам нужна замена OpenAI без изменений кода
* У вас мульти-GPU конфигурации
* Вам нужна широкая поддержка форматов моделей (AWQ, GPTQ, FP8)

### Используйте TGI, если:

* Вы в экосистеме HuggingFace
* Вам нужны встроенные функции безопасности
* Вам нужны подробные метрики Prometheus
* Вам нужно напрямую обслуживать модели HF
* Вы работаете в исследовательской среде

### Используйте LocalAI, если:

* Вам нужны TTS и STT вместе с LLM
* Вам нужны эмбеддинги для RAG
* Вам нужно ранжирование документов
* Вы хотите одно универсальное решение
* Вы создаёте приложения с голосовым интерфейсом

***

## Руководство по миграции

### С Ollama на SGLang

```python
# Ollama
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
response = client.chat.completions.create(model='llama3.2', ...)

# SGLang — просто измените URL и имя модели
client = OpenAI(base_url='http://localhost:8000/v1', api_key='dummy')
response = client.chat.completions.create(model='meta-llama/Llama-3.2-3B-Instruct', ...)
```

### С vLLM на SGLang

Оба поддерживают API OpenAI — просто измените URL конечной точки. API полностью совместимы.

```bash
# vLLM
python -m vllm.entrypoints.openai.api_server --model ... --port 8000

# SGLang (аналогично)
python -m sglang.launch_server --model-path ... --port 8000
```

***

## Рекомендации по GPU

| GPU           | Один пользователь | Несколько пользователей | Модели рассуждения |
| ------------- | ----------------- | ----------------------- | ------------------ |
| RTX 3060 12GB | компонент         | компонент               | компонент          |
| RTX 3090 24GB | компонент         | vLLM                    | SGLang             |
| RTX 4090 24GB | SGLang/vLLM       | SGLang/vLLM             | SGLang             |
| A100 40GB+    | SGLang            | SGLang                  | SGLang             |

***

## Дальнейшие шаги

* [Руководство по Ollama](/guides/guides_v2-ru/yazykovye-modeli/ollama.md) - Самая простая настройка
* [Руководство по vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) - Наивысшая пропускная способность
* [Руководство по LocalAI](/guides/guides_v2-ru/yazykovye-modeli/localai-openai-compatible.md) - Поддержка мультимодальности
* [Руководство по DeepSeek-R1](/guides/guides_v2-ru/yazykovye-modeli/deepseek-r1.md) - Модели для рассуждений
* [Настройка нескольких GPU](/guides/guides_v2-ru/prodvinutyi/multi-gpu-setup.md) - Масштабирование до более крупных моделей
* [Интеграция API](/guides/guides_v2-ru/prodvinutyi/api-integration.md) - Создавайте приложения


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/sravneniya/llm-serving-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
