> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/kimi-k2.md).

# Kimi K2.5

Kimi K2.5, выпущенная 27 января 2026 года компанией Moonshot AI, — это **мультимодальная модель Mixture-of-Experts с 1 триллионом параметров** с 32 млрд активных параметров на токен. Создана в результате непрерывного предобучения на \~15 триллионах смешанных визуальных и текстовых токенов поверх Kimi-K2-Base; нативно понимает текст, изображения и видео. K2.5 представляет **Рой агентов** технологию — координирующую до 100 специализированных ИИ-агентов одновременно — и достигает передового уровня в кодинге (76,8% SWE-bench Verified), визуальных задачах и агентных задачах. Доступна под **лицензией с открытыми весами** на HuggingFace.

## Ключевые особенности

* **1T всего / 32B активных** — архитектура MoE с 384 экспертами, вниманием MLA и SwiGLU
* **Нативная мультимодальность** — предобучена на визуально-языковых токенах; понимает изображения, видео и текст
* **Рой агентов** — разбивает сложные задачи на параллельные подзадачи с помощью динамически создаваемых агентов
* **Окно контекста 256K** — обрабатывать целые кодовые базы, длинные документы и расшифровки видео
* **Гибридное рассуждение** — поддерживает как режим мгновенного ответа (быстрый), так и режим размышления (глубокое рассуждение)
* **Сильные навыки кодирования** — 76,8% SWE-bench Verified, 73,0% SWE-bench Multilingual

## Требования

Kimi K2.5 — огромная модель: контрольная точка FP8 занимает \~630 ГБ. Для самостоятельного хостинга требуется серьёзное железо.

| Компонент | Квантованная (GGUF Q2)   | Полная FP8    |
| --------- | ------------------------ | ------------- |
| GPU       | 1× RTX 4090 + 256 ГБ ОЗУ | 8× H200 141GB |
| VRAM      | 24 ГБ + выгрузка на CPU  | 1,128GB       |
| ОЗУ       | 256 ГБ+                  | 256GB         |
| Диск      | SSD 400 ГБ               | 700GB NVMe    |
| CUDA      | 12.8+                    | 12.8+         |

**Рекомендация Clore.ai**: Для обслуживания в полной точности арендуйте 8× H200 ([голое железо](https://clore.ai/bare-metal)). Для локального инференса с квантованием подойдёт один H100 80 ГБ или даже RTX 4090 с сильной выгрузкой на CPU, но на пониженной скорости.

## Быстрый старт с llama.cpp (квантованная)

Самый доступный способ запустить K2.5 локально — использовать квантования GGUF от Unsloth:

```bash
# Клонировать и собрать llama.cpp
git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON && cmake --build build --config Release -j

# Скачать квантованную модель (Q2_K_XL — 375 ГБ, хороший баланс качества и размера)
huggingface-cli download unsloth/Kimi-K2.5-GGUF \\
  Kimi-K2.5-UD-Q2_K_XL-00001-of-00005.gguf \\
  Kimi-K2.5-UD-Q2_K_XL-00002-of-00005.gguf \\
  Kimi-K2.5-UD-Q2_K_XL-00003-of-00005.gguf \\
  Kimi-K2.5-UD-Q2_K_XL-00004-of-00005.gguf \\
  Kimi-K2.5-UD-Q2_K_XL-00005-of-00005.gguf \\
  --local-dir ./models

# Запустить инференс (подстройте --n-gpu-layers под вашу видеопамять)
./build/bin/llama-server \
  -m ./models/Kimi-K2.5-UD-Q2_K_XL-00001-of-00005.gguf \\
  --n-gpu-layers 10 \\
  --threads 32 \\
  --ctx-size 16384 \\
  --host 0.0.0.0 --port 8080
```

> **Примечание**: Поддержка изображений в GGUF/llama.cpp для K2.5 пока недоступна. Для мультимодальных функций используйте vLLM.

## Настройка vLLM (производство — полная модель)

Для продакшн-обслуживания с полной мультимодальной поддержкой:

```bash
# Установить nightly-версию vLLM (для K2.5 нужна последняя)
pip install -U vllm --pre \\
  --extra-index-url https://wheels.vllm.ai/nightly/cu129 \\
  --extra-index-url https://download.pytorch.org/whl/cu128 \\
  --index-strategy unsafe-best-match
```

### Запуск на 8× GPU H200

```bash
vllm serve moonshotai/Kimi-K2.5 \\
  -tp 8 \\
  --mm-encoder-tp-mode data \\
  --tool-call-parser kimi_k2 \\
  --reasoning-parser kimi_k2 \\
  --trust-remote-code \\
  --gpu-memory-utilization 0.90
```

### Запрос с текстом

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="moonshotai/Kimi-K2.5",
    messages=[
        {"role": "system", "content": "Вы — Kimi, ИИ-ассистент, созданный Moonshot AI."},
        {"role": "user", "content": "Напишите сервис FastAPI с поддержкой WebSocket для чата в реальном времени"}
    ],
    temperature=0.6,
    max_tokens=4096
)
print(response.choices[0].message.content)
```

### Запрос с изображением (мультимодально)

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY", timeout=3600)

response = client.chat.completions.create(
    model="moonshotai/Kimi-K2.5",
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {"url": "https://example.com/diagram.png"}
            },
            {
                "type": "text",
                "text": "Опишите эту диаграмму подробно и извлеките весь текст."
            }
        ]
    }],
    max_tokens=2048
)
print(response.choices[0].message.content)
```

## Доступ к API (GPU не требуется)

Если самостоятельный хостинг избыточен, используйте официальный API Moonshot:

```python
from openai import OpenAI

# Платформа Moonshot — API, совместимый с OpenAI
client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k2.5",
    messages=[
        {"role": "user", "content": "Объясните архитектуру роя агентов в Kimi K2.5"}
    ],
    temperature=0.6,
    max_tokens=2048
)
print(response.choices[0].message.content)
```

## Вызов инструментов

K2.5 отлично справляется с агентным использованием инструментов:

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

tools = [{
    "type": "function",
    "function": {
        "name": "search_code",
        "description": "Поиск в кодовой базе релевантных файлов и функций",
        "parameters": {
            "type": "object",
            "required": ["query"],
            "properties": {
                "query": {"type": "string", "description": "Поисковый запрос"}
            }
        }
    }
}]

response = client.chat.completions.create(
    model="moonshotai/Kimi-K2.5",
    messages=[{"role": "user", "content": "Найдите весь код, связанный с аутентификацией, в проекте"}],
    tools=tools,
    tool_choice="auto",
    temperature=0.6
)

for tool_call in response.choices[0].message.tool_calls:
    print(f"Function: {tool_call.function.name}")
    print(f"Args: {json.loads(tool_call.function.arguments)}")
```

## Быстрый старт с Docker

```bash
# Использование vLLM Docker с 8 GPU
docker run --gpus all -p 8000:8000 \
  --ipc=host \\
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:latest \\
  --model moonshotai/Kimi-K2.5 \\
  --tensor-parallel-size 8 \
  --mm-encoder-tp-mode data \\
  --tool-call-parser kimi_k2 \\
  --reasoning-parser kimi_k2 \\
  --trust-remote-code
```

## Советы для пользователей Clore.ai

* **Компромисс между API и самостоятельным хостингом**: Полная K2.5 требует 8× H200 по [голое железо](https://clore.ai/bare-metal). API Moonshot доступен на бесплатном тарифе или с оплатой за токен — используйте API для изучения, а self-hosting для стабильных production-нагрузок.
* **Квантованная на одной GPU**: Unsloth GGUF Q2\_K\_XL (\~375 ГБ) может работать на RTX 4090 ($0.14–0.42/ч) с 256 ГБ ОЗУ через выгрузку на CPU — ожидайте \~5–10 ток/с. Достаточно для личного использования и разработки.
* **K2 только для текста для бюджетных конфигураций**: Если вам не нужен ввод с изображениями, `moonshotai/Kimi-K2-Instruct` — это текстовая предшествующая версия: тот же MoE на 1T, но проще в развёртывании (без накладных расходов визуального энкодера).
* **Правильно задайте temperature**: Используйте `temperature=0.6` для режима мгновенного ответа, `temperature=1.0` для режима размышления. Неверная temperature приводит к повторениям или бессвязности.
* **Параллелизм экспертов для пропускной способности**: В многоузловых конфигурациях используйте `--enable-expert-parallel` в vLLM для более высокой пропускной способности. Смотрите документацию vLLM по настройке EP.

## Устранение неполадок

| Проблема                                      | Решение                                                                                                       |
| --------------------------------------------- | ------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` с полной моделью           | Требуется 8× H200 (всего 1128 ГБ). Используйте веса FP8, задайте `--gpu-memory-utilization 0.90`.             |
| Инференс GGUF очень медленный                 | Убедитесь, что объёма ОЗУ достаточно для размера квантизации. Q2\_K\_XL требует около 375 ГБ ОЗУ+VRAM вместе. |
| Поддержка изображений не работает в llama.cpp | Поддержка изображений для K2.5 GGUF пока недоступна — используйте vLLM для мультимодальности.                 |
| Повторяющийся вывод                           | Установите `temperature=0.6` (мгновенно) или `1.0` (thinking). Добавьте `min_p=0.01`.                         |
| Скачивание модели занимает целую вечность     | \~630 ГБ контрольной точки FP8. Используйте `huggingface-cli download` с `--resume-download`.                 |
| Вызовы инструментов не разбираются            | Добавьте `--tool-call-parser kimi_k2 --enable-auto-tool-choice` в команду запуска vLLM.                       |

## Дополнительное чтение

* [Kimi K2.5 на HuggingFace](https://huggingface.co/moonshotai/Kimi-K2.5)
* [Технический блог о Kimi K2.5](https://www.kimi.com/blog/kimi-k2-5.html)
* [Статья о Kimi K2.5](https://arxiv.org/abs/2602.02276)
* [Рецепт K2.5 для vLLM](https://docs.vllm.ai/projects/recipes/en/latest/moonshotai/Kimi-K2.5.html)
* [Квантования Unsloth GGUF](https://huggingface.co/unsloth/Kimi-K2.5-GGUF)
* [Платформа API Moonshot](https://platform.moonshot.ai)
* [GitHub Kimi K2](https://github.com/MoonshotAI/Kimi-K2)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/kimi-k2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
