> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mimo-v25-pro.md).

# MiMo-V2.5-Pro (Xiaomi 1T MoE)

{% hint style="info" %}
**Статус (апрель 2026):** MiMo-V2.5-Pro был выпущен **27 апреля 2026 года** подразделением ИИ Xiaomi как первая модель с открытыми весами в их **Pro** уровне — предыдущая MiMo-V2-Pro была доступна только через API и не имела публичных весов. Веса размещены на [huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro) под **лицензией MIT**. Карточка модели последний раз обновлялась 28 апреля 2026 года, так что инструменты развёртывания, общественные кванты и воспроизведения результатов всё ещё появляются день за днём.
{% endhint %}

MiMo-V2.5-Pro — это **Mixture-of-Experts с 1,02 трлн параметров** модель, которая активирует только **\~42 млрд параметров на токен**. Команда MiMo — во главе с бывшим исследователем DeepSeek **Ло Фули** — спроектировала её вокруг двух идей: **гибридной схемы внимания** — сочетания Sliding Window Attention (SWA) и Global Attention (GA) в соотношении 6:1 (примерно 7-кратное сокращение KV-кэша при окне 128 токенов), и **3 лёгких модулей Multi-Token Prediction (MTP)** которые дают примерно **3-кратную скорость вывода** в автогрегрессивных задачах. Архитектура имеет 70 слоёв (1 плотный + 69 MoE), скрытый размер 6144 и изначально поставляется в **смешанной точности FP8 E4M3**.

Две вещи важны для пользователей Clore.ai. Во-первых, это **первая версия MiMo Pro с публичными весами**: предыдущие варианты Pro существовали только как размещённый API и как незаметно тестируемая модель "Hunter Alpha" на OpenRouter (таймлайн на март 2026). Во-вторых, **лицензией MIT** полностью снимает коммерческие ограничения — дообучайте, распространяйте, запускайте как платную конечную точку, без оговорок. В анонсе запуска Xiaomi утверждается, что V2.5-Pro **превосходит DeepSeek V4 в агентных задачах**, но этот бенчмарк опубликован только самим вендором — стороннее воспроизведение ещё не появилось, и вам не следует цитировать это внешне без этого оговорочного замечания.

### Ключевые характеристики

| Параметр                    | Значение                                                                  |
| --------------------------- | ------------------------------------------------------------------------- |
| Общее число параметров      | 1,02T (MoE)                                                               |
| Активные параметры          | \~42 млрд на один проход                                                  |
| Окно контекста              | 1 000 000 токенов (1M)                                                    |
| Точность                    | FP8 E4M3 mixed (нативно)                                                  |
| Архитектура                 | Гибрид SWA + GA (6:1), 70 слоёв (1 плотный + 69 MoE), скрытый размер 6144 |
| KV-кэш                      | Скользящее окно 128, сокращение примерно в 7× по сравнению с полным GA    |
| Спекулятивное декодирование | 3 лёгких модуля MTP, примерно 3-кратная скорость вывода                   |
| Лицензия                    | MIT                                                                       |
| Дата выпуска                | 27 апреля 2026 года                                                       |
| Организация                 | Команда Xiaomi MiMo (XiaomiMiMo на HuggingFace)                           |
| Основные инструменты        | SGLang (приоритетно), vLLM                                                |

### Почему MiMo-V2.5-Pro?

* **Первый открытый MiMo уровня Pro** — предшественник MiMo-V2-Pro был доступен только через API, это первый раз, когда веса Pro опубликованы
* **Контекст на 1M токенов** — позволяет работать с целыми кодовыми базами, длинными трассами агента или много-документным RAG без нарезки на фрагменты
* **Гибридное внимание** — SWA + GA в соотношении 6:1 сокращают KV-кэш примерно в 7× по сравнению с чистым глобальным вниманием; длинные контексты остаются управляемыми
* **Нативный FP8** — без пост-фактум квантизации, веса поставляются в FP8 E4M3 напрямую от вендора
* **Спекулятивное декодирование MTP** — 3 встроенных модуля MTP дают примерно 3-кратную пропускную способность декодирования сразу из коробки
* **лицензией MIT** — никаких коммерческих ограничений, никаких ограничений по сфере использования
* **42B активных** — вы платите за стоимость инференса плотной модели на 42B, несмотря на заголовочное число 1,02T
* **Происхождение** — ведущий исследователь Ло Фули ранее работала в DeepSeek, и архитектурные решения это показывают

***

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

{% hint style="warning" %}
**Всё ещё модель на 1T.** "42B active" звучит приятно, но полные веса 1,02T должны находиться в VRAM (или быть агрессивно выгружены). Нативным весам FP8 требуется **\~600GB+ VRAM** до активационной памяти и KV-кэша. Планируйте 8×H200 или больше для полного контекста FP8.
{% endhint %}

| Компонент | Минимум (квантование + выгрузка, в будущем)          | Рекомендуется (FP8)  | Полный FP8, 1M ctx      |
| --------- | ---------------------------------------------------- | -------------------- | ----------------------- |
| VRAM GPU  | \~141GB (Q4 + выгрузка в ОЗУ, когда появятся кванты) | 8× H100 80GB (640GB) | 8× H200 141GB (1,128GB) |
| ОЗУ       | 256GB                                                | 512GB                | 512GB                   |
| Диск      | 700GB NVMe                                           | 1,5TB NVMe           | 2TB NVMe                |
| CUDA      | 12.8+                                                | 12.8+                | 12.8+                   |

**Подходит по железу:** Для полного FP8 с запасом на 1M-контекст, **8×H200** — естественная цель — это [голое железо](https://clore.ai/bare-metal) развёртывание, а не аренда на маркетплейсе — см. [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html). 8×H100 80GB также запускает чекпойнт FP8, но вы ограничите `--context-length` ниже (обычно 256K), чтобы оставить место для KV-кэша. Для оборудования класса Blackwell см. [clore.ai/rent-b200.html](https://clore.ai/rent-b200.html).

***

## Вариант A — Ollama / GGUF (квантизованные, сборки сообщества)

{% hint style="warning" %}
**Внимание:** По состоянию на 28 апреля 2026 года (через один день после выпуска) **общественные GGUF-кванты для MiMo-V2.5-Pro ещё не опубликованы**. Ожидайте, что сборки Q4\_K\_M / Q5\_K\_M / Q6\_K появятся в течение 1–2 недель на [huggingface.co/models?search=mimo-v2.5-pro+gguf](https://huggingface.co/models?search=mimo-v2.5-pro+gguf). До тех пор поддерживаемый путь — FP8 через SGLang или vLLM.
{% endhint %}

```bash
# Когда станет доступна сборка Q4_K_M
docker exec ollama ollama pull mimo-v2.5-pro:q4_K_M
docker exec ollama ollama run mimo-v2.5-pro:q4_K_M

# Или напрямую с llama.cpp на файле GGUF (когда будет опубликован)
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/mimo-v2.5-pro-q4_k_m.gguf \\
  --n-gpu-layers 99 --ctx-size 65536 \\
  --port 8080 --host 0.0.0.0
```

***

## Вариант B — vLLM (продакшен API, рекомендуется)

vLLM поддерживает MiMo-V2.5-Pro через `--trust-remote-code` (гибридное внимание + модули MTP поставляются как пользовательский код в репозитории). Используйте настройки сэмплирования от вендора: **temperature 1.0, top\_p 0.95**.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model XiaomiMiMo/MiMo-V2.5-Pro
      --tensor-parallel-size 8
      --quantization fp8
      --max-model-len 262144
      --gpu-memory-utilization 0.90
      --trust-remote-code
      --served-model-name mimo-v2.5-pro
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Тестирование API (рекомендуемое вендором сэмплирование)
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mimo-v2.5-pro",
    "messages": [
      {"role": "system", "content": "Вы — автономный кодирующий агент."},
      {"role": "user", "content": "Просмотрите этот монорепозиторий на 30 тыс. строк и предложите план миграции с Express 4 на Fastify 5."}
    ],
    "max_tokens": 8192,
    "temperature": 1.0,
    "top_p": 0.95
  }'
```

{% hint style="info" %}
На 8×H100 80GB ограничьте `--max-model-len` до 262144 (256K), чтобы оставить запас для активаций + KV-кэша. На 8×H200 141GB вы можете комфортно поднять до 524288 или выше; 1,048,576 (полный 1M) достижим, но ожидайте долгих prefill-стадий — проверьте перед тем, как на это полагаться.
{% endhint %}

***

## Вариант C — SGLang (рекомендуется для максимальной пропускной способности)

SGLang — это **приоритетная цель обслуживания** в карточке модели MiMo-V2.5-Pro. Вендор публикует команду запуска с **`SGLANG_ENABLE_SPEC_V2=1`** для активации нового пути спекулятивного декодирования с учётом MTP, именно там и проявляется примерно 3-кратное ускорение декодирования.

```bash
docker pull lmsysorg/sglang:latest

# Точное воспроизведение из карточки модели HF
SGLANG_ENABLE_SPEC_V2=1 python3 -m sglang.launch_server \\
    --model-path XiaomiMiMo/MiMo-V2.5-Pro \\
    --trust-remote-code \\
    --quantization fp8 \\
    --context-length 1048576 \\
    --host 0.0.0.0 --port 9001
```

Для многопроцессорной TP-настройки на 8×H200 добавьте `--tp-size 8` и `--mem-fraction-static 0.88`. Подтвердите с помощью `nvidia-smi` что все 8 карт задействованы перед тем, как пускать реальный трафик — 1M-контекст не прощает, если один ранг обделён.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация  | VRAM    | Ожидаемая производительность                                 | Стоимость на Clore.ai                       |
| ------------- | ------- | ------------------------------------------------------------ | ------------------------------------------- |
| 4× H100 80GB  | 320GB   | FP8 с тяжёлой выгрузкой, макс. контекст \~64K, \~10–15 ток/с | \~$4.16/ч                                   |
| 8× H100 80GB  | 640GB   | Полный FP8, макс. контекст \~256K, \~30–45 ток/с             | \~$8.32/ч                                   |
| 8× H200 141GB | 1,128GB | Полный FP8, макс. контекст 1M, \~60+ ток/с с MTP             | [голое железо](https://clore.ai/bare-metal) |
| 8× B200       | 1,536GB | Полный FP8, макс. контекст 1M, самая быстрая доступная       | цены на маркетплейсе                        |

{% hint style="success" %}
**Лучшее качество:** 8× H200 141GB на чекпойнте FP8 ([голое железо](https://clore.ai/bare-metal)) с `SGLANG_ENABLE_SPEC_V2=1`. Вы получаете полное окно контекста 1M, спекулятивное декодирование MTP и достаточный запас KV-кэша для реальных циклов агента. См. [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html) для текущей доступности.
{% endhint %}

***

## Сценарии использования

* **Агенты с длинным горизонтом** — команда MiMo явно оптимизирует модель под длительные вызовы инструментов. Контекст на 1M + ускорение MTP означает тысячи обращений к инструментам без сложной нарезки на фрагменты.
* **Анализ всей кодовой базы** — загрузите в контекст монорепозиторий на 500K токенов для планирования рефакторинга, аудита зависимостей или проектирования миграции
* **RAG по длинным документам** — целые книги, многолетние клиентские транскрипты или годовые истории чатов помещаются в один запрос
* **Кодинг** — заявленные вендором 75,6% на HumanEval+ и агентный подход делают её кандидатом для автономных SWE-задач (в паре с SWE-agent / OpenHands)
* **Черновик для исследований** — контекст на 1M терпит такой сценарий "вставь всю статью, вставь предыдущие работы, попроси синтез", который меньшие модели обрезают

***

## Бенчмарки

{% hint style="warning" %}
**Заявлены вендором — стороннего воспроизведения пока нет.** Все числа ниже взяты из анонса Xiaomi от 27 апреля 2026 года и карточки модели на HuggingFace. Модели **всего два дня** на момент написания — независимые воспроизведения на агентных и длинноконтекстных бенчмарках всё ещё ожидаются. В частности, утверждение "превосходит DeepSeek V4 в агентных задачах" исходит из собственного текста Xiaomi; воспринимайте это как маркетинг, пока не будет воспроизведено.
{% endhint %}

| Бенчмарк                       | MiMo-V2.5-Pro (вендор) | Примечания                                                |
| ------------------------------ | ---------------------- | --------------------------------------------------------- |
| GSM8K                          | **99.6%**              | Текстовые задачи по математике                            |
| HumanEval+                     | 75.6%                  | Кодирование (расширенное)                                 |
| MMLU                           | 89.4%                  | Общие знания                                              |
| GraphWalks (1M ctx) BFS        | 0.37                   | Обход графа с длинным контекстом                          |
| GraphWalks (1M ctx) Parents    | 0.62                   | Обход графа с длинным контекстом                          |
| Агентные задачи vs DeepSeek V4 | "превосходит" (вендор) | **Не подтверждено — стороннее воспроизведение ожидается** |

***

## Устранение неполадок

| Проблема                                     | Решение                                                                                                                                     |
| -------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` при загрузке              | Нативный FP8 всё ещё требует примерно 600GB+ VRAM. Используйте 8× H200 или уменьшите `--context-length` до 65536 на 8× H100.                |
| Медленная загрузка с HuggingFace             | `huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download`. Ожидайте около 600GB FP8.                      |
| `--trust-remote-code` отклонено              | Гибридное внимание и MTP поставляются как пользовательский код в репозитории. Флаг **обязателен** и для vLLM, и для SGLang.                 |
| Ускорение MTP не проявляется в SGLang        | Проверьте `SGLANG_ENABLE_SPEC_V2=1` экспортируется ли `в той же оболочке, что и`python3 -m sglang.launch\_server                            |
| Трасса рассуждений плоская / низкое качество | Используйте `temperature=1.0` и `top_p=0.95`. Более низкие температуры ухудшают поведение MiMo при рассуждении.                             |
| 1M-контекст вызывает OOM на 8× H100          | 8× H100 80GB не могут удержать KV-кэш для 1M токенов. Ограничьте до 256K или перейдите на 8× H200.                                          |
| Prefill занимает минуты                      | Ожидаемо при контексте 1M. Используйте `--enable-chunked-prefill` (vLLM) или группируйте более короткие запросы для интерактивных нагрузок. |
| Не удаётся выполнить pull GGUF / Ollama      | Общественные кванты по состоянию на 28 апреля 2026 года не опубликованы. Подождите 1–2 недели или используйте FP8 напрямую.                 |

***

## Дальнейшие шаги

* **Предшественник / родственная модель:** [MiMo-V2-Flash](/guides/guides_v2-ru/yazykovye-modeli/mimo-v2-flash.md) — 309B MoE, 15B активных, 32K ctx, быстрее, но меньше
* **Заявленный конкурент от вендора:** [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md) — 1M ctx, мультимодальная, \~1T параметров (модель, которую, по словам Xiaomi, они превзошли в агентных задачах)
* **Открытая кодовая модель-конкурент:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — 744B MoE, 40B активных, MIT, сейчас №1 на SWE-Bench Pro
* **Ёмкость H200:** [голое железо по запросу](https://clore.ai/bare-metal) — лучший вариант для полного FP8 1T MoE при контексте 1M
* **Маркетплейс Clore.ai:** [clore.ai/marketplace](https://clore.ai/marketplace)

### Ссылки

* [MiMo-V2.5-Pro на HuggingFace](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro)
* [Организация Xiaomi MiMo на HuggingFace](https://huggingface.co/XiaomiMiMo)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)
* [Документация vLLM](https://docs.vllm.ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mimo-v25-pro.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
