> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/language-models.md).

# Обзор

Запускайте большие языковые модели (LLM) на GPU CLORE.AI для инференса и чат-приложений.

## Популярные инструменты

| Инструмент                                                                              | Сценарий использования                             | Сложность |
| --------------------------------------------------------------------------------------- | -------------------------------------------------- | --------- |
| [компонент](/guides/guides_v2-ru/yazykovye-modeli/ollama.md)                            | Самая простая настройка LLM                        | Начальный |
| [Open WebUI](/guides/guides_v2-ru/yazykovye-modeli/open-webui.md)                       | Интерфейс, похожий на ChatGPT                      | Начальный |
| [vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md)                                   | Продакшн-сервинг с высокой пропускной способностью | Средне    |
| [Сервер Llama.cpp](/guides/guides_v2-ru/yazykovye-modeli/llamacpp-server.md)            | Эффективный инференс GGUF                          | Лёгкий    |
| [Text Generation WebUI](/guides/guides_v2-ru/yazykovye-modeli/text-generation-webui.md) | Полнофункциональный чат-интерфейс                  | Лёгкий    |
| [ExLlamaV2](/guides/guides_v2-ru/yazykovye-modeli/exllamav2-fast.md)                    | Самый быстрый инференс EXL2                        | Средне    |
| [LocalAI](/guides/guides_v2-ru/yazykovye-modeli/localai-openai-compatible.md)           | API, совместимый с OpenAI                          | Средне    |
| [SGLang](/guides/guides_v2-ru/yazykovye-modeli/sglang.md)                               | Быстрая структурированная генерация                | Средне    |
| [Text Generation Inference (TGI)](/guides/guides_v2-ru/yazykovye-modeli/tgi.md)         | Решение для сервинга от HuggingFace                | Средне    |
| [LMDeploy](/guides/guides_v2-ru/yazykovye-modeli/lmdeploy.md)                           | Набор инструментов для сервинга MMlab              | Средне    |
| [Aphrodite Engine](/guides/guides_v2-ru/yazykovye-modeli/aphrodite-engine.md)           | Форк vLLM с дополнительными функциями              | Средне    |
| [MLC-LLM](/guides/guides_v2-ru/yazykovye-modeli/mlc-llm.md)                             | Компиляция машинного обучения                      | Сложный   |
| [LiteLLM](/guides/guides_v2-ru/yazykovye-modeli/litellm.md)                             | Единый API-прокси                                  | Средне    |
| [PowerInfer](/guides/guides_v2-ru/yazykovye-modeli/powerinfer.md)                       | Инференс разреженных моделей                       | Сложный   |
| [Mistral.rs](/guides/guides_v2-ru/yazykovye-modeli/mistral-rs.md)                       | Инференс-движок на Rust                            | Средне    |

## Руководства по моделям

### Новейшие и лучшие модели

| Модель                                                                        | Параметры               | Лицензия          | Помещается на           |
| ----------------------------------------------------------------------------- | ----------------------- | ----------------- | ----------------------- |
| [Qwen3.8-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md)            | 27B dense               | Apache 2.0        | 1× RTX 4090 (Q4)        |
| [Mistral Small 4](/guides/guides_v2-ru/yazykovye-modeli/mistral-small4.md)    | 119B / 6.5B active      | Apache 2.0        | 2× RTX 4090 (Q2)        |
| [GLM-5.2](/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md)                   | \~750B / 40B active     | MIT               | 10× RTX 5090 (Q2)       |
| [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md)           | Flash 167GB · Pro 893GB | MIT               | 6–8× RTX 5090 (Flash)   |
| [MiniMax M3](/guides/guides_v2-ru/yazykovye-modeli/minimax-m3.md)             | 428B / 23B active       | minimax-community | 6–8× RTX 5090 (Q2–Q3)   |
| [Nemotron 3 Ultra](/guides/guides_v2-ru/yazykovye-modeli/nemotron-3-ultra.md) | 550B / 55B active       | OpenMDW-1.1       | 4× RTX PRO 6000 (NVFP4) |
| [Kimi K3](/guides/guides_v2-ru/yazykovye-modeli/kimi-k3.md)                   | 2.8T                    | Лицензия Kimi K3  | Ничего на маркетплейсе  |
| [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md)                   | 744B / 40B active       | MIT               | Крупные фермы           |
| [Llama 4](/guides/guides_v2-ru/yazykovye-modeli/llama4.md)                    | Scout & Maverick        | Сообщество Llama  | 1× RTX 4090 (Scout Q4)  |
| [DeepSeek-R1](/guides/guides_v2-ru/yazykovye-modeli/deepseek-r1.md)           | 671 млрд MoE            | MIT               | Крупные фермы           |
| [Qwen2.5](/guides/guides_v2-ru/yazykovye-modeli/qwen25.md)                    | 0.5B–72B                | Apache 2.0        | Любая карта             |

### Специализированные модели

| Модель                                                                    | Параметры       | Лучше всего для               |
| ------------------------------------------------------------------------- | --------------- | ----------------------------- |
| [DeepSeek Coder](/guides/guides_v2-ru/yazykovye-modeli/deepseek-coder.md) | 6.7B-33B        | Генерация кода                |
| [CodeLlama](/guides/guides_v2-ru/yazykovye-modeli/codellama.md)           | 7B-34B          | Завершение кода               |
| [GLM-4.7-Flash](/guides/guides_v2-ru/yazykovye-modeli/glm-47-flash.md)    | 4.7B            | Быстрый китайский/английский  |
| [GLM-5](/guides/guides_v2-ru/yazykovye-modeli/glm5.md)                    | Будет объявлено | Последняя версия Zhipu AI     |
| [Kimi K2.5](/guides/guides_v2-ru/yazykovye-modeli/kimi-k2.md)             | Будет объявлено | Модель Moonshot AI            |
| [Ling-2.5-1T](/guides/guides_v2-ru/yazykovye-modeli/ling25.md)            | 1T              | Огромная open-source LLM      |
| [LFM2-24B](/guides/guides_v2-ru/yazykovye-modeli/lfm2-24b.md)             | 24B             | Модель Liquid AI              |
| [MiMo-V2-Flash](/guides/guides_v2-ru/yazykovye-modeli/mimo-v2-flash.md)   | Будет объявлено | Модель для быстрого инференса |

### Эффективные модели

| Модель                                                                      | Параметры       | Лучше всего для                    |
| --------------------------------------------------------------------------- | --------------- | ---------------------------------- |
| [Gemma 2](/guides/guides_v2-ru/yazykovye-modeli/gemma2.md)                  | 2B-27B          | Эффективный инференс               |
| [Gemma 3](/guides/guides_v2-ru/yazykovye-modeli/gemma3.md)                  | Будет объявлено | Последняя компактная модель Google |
| [Phi-4](/guides/guides_v2-ru/yazykovye-modeli/phi4.md)                      | 14B             | Маленькая, но способная            |
| [Mistral/Mixtral](/guides/guides_v2-ru/yazykovye-modeli/mistral-mixtral.md) | 7B / 8x7B       | Общего назначения                  |
| [Mistral Large 3](/guides/guides_v2-ru/yazykovye-modeli/mistral-large3.md)  | 675B MoE        | Корпоративного уровня              |
| [Mistral Small 3.1](/guides/guides_v2-ru/yazykovye-modeli/mistral-small.md) | Будет объявлено | Эффективная версия Mistral         |

## Рекомендации по GPU

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

| Размер модели | Минимальная GPU | Рекомендуется        | Стоимость Clore.ai |
| ------------- | --------------- | -------------------- | ------------------ |
| 7B (Q4)       | RTX 3060 12GB   | RTX 3090             | $0.03–0.21/ч       |
| 13B (Q4)      | RTX 3090 24GB   | RTX 4090             | $0.07–0.42/ч       |
| 27B (Q4)      | RTX 3090 24GB   | RTX 4090 / 5090      | $0.07–0.77/ч       |
| 34B (Q4)      | 2× RTX 3090     | 1× RTX 5090          | $0.14–0.77/ч       |
| 70B (Q4)      | 2× RTX 5090     | 1× RTX PRO 6000 96GB | $0.50–1.54/ч       |
| 120B+ (Q2)    | 2× RTX 4090     | 2× RTX 5090          | $0.28–1.54/ч       |
| 400B+ (Q2)    | 8× RTX 5090     | 4× RTX PRO 6000      | \~$2.00–5.00/ч     |

## Руководство по квантизации

| Формат   | Использование VRAM | Качество    | Скорость        |
| -------- | ------------------ | ----------- | --------------- |
| Q2\_K    | Минимальное        | Плохое      | Самое быстрое   |
| Q4\_K\_M | Низкая             | Хорошо      | Быстро          |
| Q5\_K\_M | Средне             | Отлично     | Средне          |
| Q8\_0    | Высокая            | Отлично     | Медленнее       |
| FP16     | Наивысшая          | Лучше всего | Самое медленное |

## См. также

* [Обучение и дообучение](/guides/guides_v2-ru/obuchenie/training.md)
* [Мультимодальные модели зрения и языка](/guides/guides_v2-ru/modeli-dlya-zreniya/vision-models.md)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/language-models.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
