> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/minimax-m27.md).

# MiniMax M2.7 (229B MoE для кодинга)

{% hint style="info" %}
**Статус (апрель 2026):** MiniMax M2.7 был опубликован на HuggingFace **9 апреля 2026 года** MiniMaxAI и достиг **496 тыс. загрузок за три недели** — по уровню принятия это крупнейший релиз с открытыми весами в нашем апрельском обновлении. Весы доступны по адресу [huggingface.co/MiniMaxAI/MiniMax-M2.7](https://huggingface.co/MiniMaxAI/MiniMax-M2.7) по **пользовательской лицензии MiniMax** (`лицензия: другая`). Это **не** Apache/MIT — прочитайте [LICENSE](https://huggingface.co/MiniMaxAI/MiniMax-M2.7/blob/main/LICENSE) перед любым коммерческим развёртыванием.
{% endhint %}

{% hint style="warning" %}
**Исправление:** В более ранних версиях нашего индекса моделей M2.7 был указан как проприетарная модель только для API. Это было неверно по состоянию на 9 апреля 2026 года — веса общедоступны. Это руководство заменяет ту запись.
{% endhint %}

MiniMax M2.7 — это **смесь экспертов с 229 миллиардами параметров** (256 экспертов, 8 активных на токен) и последняя версия семейства M2 от MiniMax — линейки, построенной вокруг **самоэволюционирующего / управляемого RL постобучения** и **агентного кодинга** задач. Релиз 2.7 — это общедоступный, пригодный для самостоятельного хостинга аналог хостируемого кодирующего агента MiniMax, и MiniMax позиционирует его как конкурентоспособный с Claude Sonnet 4.5 в агентных бенчмарках, а по некоторым из них — приближающийся к уровню Claude Opus 4.6.

Интересная архитектурная деталь — это **перемежающееся мышление** (введено в M2.1 и доработано в 2.5/2.7): модель чередует `<think>` блоки рассуждений с обычной генерацией в рамках многоходовых вызовов инструментов, так что цепочка мыслей сохраняется между возвратами по функции, а не сбрасывается на каждом шаге. Именно это делает её интересной для долгосрочных агентов — трасса рассуждений не обнуляется каждый раз, когда вы достигаете `границы tool_use` .

Для пользователей Clore.ai практическая новость в том, что M2.7 поставляется с **контрольной точкой FP8 (float8\_e4m3fn)** в официальном репозитории. Это делает возможным развёртывание на одном узле на **4× H100 80GB** или **2× H200 141GB** — без октетов H200 или стоек на 16 GPU. Если вы уже запускали [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) и хотите второй open-weight-модель в своём агентном стеке с другим профилем смещения, это та модель, которую стоит к нему добавить.

### Ключевые характеристики

| Параметр                 | Значение                                                                                                                                                     |
| ------------------------ | ------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| Общее число параметров   | 229B (MoE, 256 экспертов)                                                                                                                                    |
| Экспертов на токен       | 8 из 256                                                                                                                                                     |
| Активные параметры       | **Официально не опубликовано** — см. карточку модели. Исторически в семействе M2 было около 10B активных параметров; перед публичным цитированием проверьте. |
| Скрытый размер / слои    | 3,072 / 62                                                                                                                                                   |
| Внимание                 | 48 голов, 8 KV (GQA)                                                                                                                                         |
| Окно контекста           | 204 800 токенов (200K)                                                                                                                                       |
| Типы тензоров            | F32, BF16, F8\_E4M3                                                                                                                                          |
| MTP                      | Предсказание нескольких токенов включено (3 модуля MTP)                                                                                                      |
| Лицензия                 | **Пользовательская лицензия MiniMax — по умолчанию некоммерческая**                                                                                          |
| Дата выпуска             | 9 апреля 2026 года                                                                                                                                           |
| Загрузки с HF (3 недели) | \~496K                                                                                                                                                       |
| Рекомендуемая выборка    | `temperature=1.0`, `top_p=0.95`, `top_k=40`                                                                                                                  |
| Основные инструменты     | vLLM, SGLang, Transformers, KTransformers, MLX-LM                                                                                                            |

### Почему MiniMax M2.7?

* **Открытые веса в 229B** — крупнейшая «реальная» модель для кодинга с открытыми весами, которая всё ещё помещается на одном узле 4×H100 в FP8
* **перемежающееся мышление** — `<think>` блоки сохраняются между ходами tool-call, что действительно полезно для агентов в стиле SWE
* **Фокус на многоязычном кодинге** — MiniMax заявляет о сильной производительности на Rust, Go, Java, Kotlin, Swift и TypeScript, а не только на Python
* **Сигнал принятия** — 496 тыс. загрузок за три недели — это самый сильный отклик сообщества среди всех релизов с открытыми весами за апрель 2026 года, которые мы отслеживали
* **Поддержка MTP** — спекулятивное декодирование через модули Multi-Token Prediction встроено, что даёт реальный прирост пропускной способности на H100/H200
* **Резервный хостинг** — если ваша нагрузка перерастёт один узел, у MiniMax есть хостируемая конечная точка; на этапе архитектуры вам не нужно выбирать жёстко

***

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

{% hint style="warning" %}
**229B — это всё ещё 229B.** Весы BF16 занимают \~460 ГБ. Контрольная точка FP8 — примерно вдвое меньше, \~230 ГБ, именно поэтому развертывание на одном узле становится реальным. Комьюнити-кванты INT4 укладываются ниже \~120 ГБ, но официально не поддерживаются.
{% endhint %}

| Компонент        | Для хобби (INT4 GGUF, выгрузка)       | Рекомендуется (FP8 на одном узле)  | Полный BF16                  |
| ---------------- | ------------------------------------- | ---------------------------------- | ---------------------------- |
| VRAM GPU         | GPU 24–48 ГБ + выгрузка в RAM 128 ГБ+ | 4× H100 80GB **или** 2× H200 141GB | 8× H100 80GB / 4× H200 141GB |
| Общий объём VRAM | \~48 ГБ GPU + выгрузка                | 320 ГБ / 282 ГБ                    | 640 ГБ / 564 ГБ              |
| ОЗУ              | 128 ГБ                                | 256GB                              | 512GB                        |
| Диск             | 200 ГБ NVMe                           | 400 ГБ NVMe                        | 600 ГБ NVMe                  |
| CUDA             | 12.8+                                 | 12.8+                              | 12.8+                        |

**Выбор Clore.ai:** Контрольная точка FP8 на **2× H200** — самый чистый вариант развёртывания: минимальное число разбиений tensor-parallel, меньше переходов NCCL, и математика для контекста 200K просто работает. **4× H100** — более дешёвая альтернатива, если H200 в дефиците.

***

## Вариант A — Ollama / GGUF (квантованная)

{% hint style="warning" %}
**Только комьюнити-кванты.** MiniMax не публикует официальные GGUF-веса для M2.7. Сборки сообщества Q4/Q5 обычно появляются через 1–2 недели после релиза — ищите [huggingface.co/models?search=minimax-m2.7+gguf](https://huggingface.co/models?search=minimax-m2.7+gguf) и проверяйте загрузившего. Качество у MoE-квантов ниже Q4 сильно варьируется.
{% endhint %}

```bash
# Когда появится комьюнити-сборка Q4_K_M (сначала проверьте HuggingFace)
docker exec ollama ollama pull minimax-m2.7:q4_K_M
docker exec ollama ollama run minimax-m2.7:q4_K_M

# Или напрямую через llama.cpp на скачанном GGUF
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/minimax-m2.7-q4_k_m.gguf \
  --n-gpu-layers 80 --ctx-size 32768 \
  --temp 1.0 --top-p 0.95 --top-k 40 \
  --port 8080 --host 0.0.0.0
```

Только для хобби. Для реальных нагрузок используйте vLLM или SGLang с FP8-контрольной точкой.

***

## Вариант B — vLLM (продакшен API, рекомендуется)

vLLM — первоочередная цель для обслуживания. Официальная контрольная точка FP8 — та, которую стоит загружать: такое же качество, как у BF16, но примерно с половиной потребления VRAM.

### docker-compose.yml — 4× H100 80GB

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model MiniMaxAI/MiniMax-M2.7
      --quantization fp8
      --tensor-parallel-size 4
      --max-model-len 65536
      --gpu-memory-utilization 0.88
      --enable-auto-tool-choice
      --tool-call-parser hermes
      --served-model-name minimax-m2.7
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

### docker-compose.yml — 2× H200 141GB

Уменьшите `--tensor-parallel-size` до 2 и увеличьте `--max-model-len` чтобы использовать запас по памяти:

```yaml
    command: >
      --model MiniMaxAI/MiniMax-M2.7
      --quantization fp8
      --tensor-parallel-size 2
      --max-model-len 131072
      --gpu-memory-utilization 0.90
      --enable-auto-tool-choice
      --tool-call-parser hermes
      --enable-chunked-prefill
      --served-model-name minimax-m2.7
      --trust-remote-code
```

### Проверка работоспособности

```bash
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "minimax-m2.7",
    "messages": [
      {"role": "system", "content": "Вы — старший инженер. Используйте перемежающееся мышление при рассуждении в рамках вызовов инструментов."},
      {"role": "user", "content": "Проверь этот async-хэндлер на Rust на безопасность при отмене в tokio: ..."}
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 0.95
  }'
```

{% hint style="info" %}
**Не снижайте `temperature` ниже 1.0.** Рекомендуемая MiniMax схема выборки — это `T=1.0, top_p=0.95, top_k=40`. Жадное декодирование незаметно ломает `<think>` перемежение в многоходовых вызовах инструментов.
{% endhint %}

***

## Вариант C — SGLang

Планировщик MoE в SGLang конкурентоспособен с vLLM на Hopper и часто выигрывает на длинных кодинговых завершениях благодаря спекулятивному декодированию EAGLE, работающему в связке с модулями MTP у M2.7.

```bash
docker pull lmsysorg/sglang:latest

python3 -m sglang.launch_server \
  --model-path MiniMaxAI/MiniMax-M2.7 \
  --quantization fp8 \\
  --tp-size 4 \
  --mem-fraction-static 0.88 \
  --context-length 65536 \
  --enable-mixed-chunk \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --served-model-name minimax-m2.7 \
  --trust-remote-code
```

Ожидайте прирост пропускной способности примерно в 1.5–2× по сравнению с обычным vLLM на длинных агентных трассах. Снизьте `--tp-size` до 2 на H200.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация                      | VRAM           | Ожидаемая производительность                                | Стоимость на Clore.ai                           |
| --------------------------------- | -------------- | ----------------------------------------------------------- | ----------------------------------------------- |
| 1× RTX 4090 24GB + выгрузка в RAM | 24 ГБ + 128 ГБ | INT4 для хобби, \~5–10 ток/с                                | $0.14–0.42/ч                                    |
| 4× A100 80GB                      | 320GB          | шардированный BF16, \~15–25 ток/с                           | [голое железо](https://clore.ai/bare-metal)     |
| **4× H100 80GB (FP8)**            | **320GB**      | **FP8 для продакшена, \~40–60 ток/с**                       | **\~$4.16/ч**                                   |
| **2× H200 141GB (FP8)**           | **282 ГБ**     | **FP8 для продакшена, \~50–70 ток/с, полный контекст 200K** | [**голое железо**](https://clore.ai/bare-metal) |
| 8× H100 80GB                      | 640GB          | Полный BF16, \~80+ ток/с                                    | \~$8.32/ч                                       |

{% hint style="success" %}
**Лучшее соотношение цены и качества:** 2× H200 с FP8-контрольной точкой. Та же класс пропускной способности, что и у 4× H100, но вдвое меньше переходов tensor-parallel, зачастую дешевле в день на маркетплейсе, и у вас остаётся достаточно запаса VRAM для полного контекста 200K.
{% endhint %}

Арендовать машины здесь:

* [**H200 как bare metal**](https://clore.ai/bare-metal) — рекомендуется для развёртывания 2× H200 FP8
* [**Арендовать GPU H100**](https://clore.ai/rent-h100.html) — для развёртывания 4× H100 FP8
* [**A100 80GB как bare metal**](https://clore.ai/bare-metal) — резервный вариант BF16 с несколькими GPU
* [**Арендовать RTX 4090**](https://clore.ai/rent-4090.html) — только для INT4-хобби
* [**Маркетплейс**](https://clore.ai/marketplace) — весь инвентарь, по запросу и спотовые ставки

***

## Сценарии использования

* **Многоязычные SWE-агенты** — Rust, Go, Java, Kotlin, Swift и TypeScript получают первоклассную поддержку, а не только Python/JS
* **Долгие циклы вызова инструментов** — перемежающееся мышление сохраняет трассу рассуждений на протяжении сотен `границы tool_use` обменов туда-обратно
* **Аудит кодовой базы** — контекст 200K помещает средний сервис вместе с тестами в один промпт
* **Пайплайны рефакторинга** — устойчивое качество на множестве правок файлов благодаря модулям MTP
* **Оркестрация агентов из агентов** — используйте M2.7 как планировщик, а меньшую модель (Qwen3.5, GLM-4.7-Flash) как исполнителя
* **Самостоятельно размещаемая альтернатива Claude Sonnet/Opus** для некоммерческих исследований кодинга — но **сначала прочитайте лицензию**

***

## Бенчмарки

{% hint style="warning" %}
**Утверждения вендора — проверяйте независимо.** Ниже приведённые числа взяты из релиз-нот MiniMax от 9 апреля 2026 года. Независимые воспроизведения всё ещё продолжают появляться.
{% endhint %}

| Бенчмарк         | MiniMax M2.7 | Claude Sonnet 4.5 (справка вендора) | Claude Opus 4.6 (справка вендора) | GPT-5.3-Codex |
| ---------------- | ------------ | ----------------------------------- | --------------------------------- | ------------- |
| SWE-Pro          | **56.22%**   | \~55%                               | \~57.3%                           | 56.2%         |
| VIBE-Pro         | **55.6%**    | —                                   | \~57%                             | —             |
| Terminal Bench 2 | **57.0%**    | —                                   | —                                 | —             |
| GDPval-AA (ELO)  | **1495**     | —                                   | —                                 | —             |

Формулировка MiniMax: M2.7 сопоставим с Claude Sonnet 4.5 или превосходит его в наборе агентного кодинга, который для них важен, и находится в пределах нескольких баллов от Claude Opus 4.6 на SWE-Pro / VIBE-Pro. Рассматривайте это как ориентир, а не как окончательный рейтинг — разрыв до закрытых frontier-моделей сокращается с каждым релизом.

***

## Семейство MiniMax M2

| Версия   | Выпущено       | Архитектурный фокус                                          | Рекомендуется для                                        |
| -------- | -------------- | ------------------------------------------------------------ | -------------------------------------------------------- |
| M2       | Окт 2025       | Первоначальный релиз MoE 229B, RL-настроенный кодинг         | Справочный / исторический                                |
| M2.1     | Дек 2025       | **перемежающееся мышление** представлена                     | Самая ранняя версия, которую стоит запускать для агентов |
| M2.5     | Фев 2026       | Самоэволюционирующее RL-постобучение, более длинный контекст | Неплохая модель для кодинга, если ограничен диск         |
| **M2.7** | **9 апр 2026** | **Доработанный многоязычный кодинг, MTP, официальный FP8**   | **Выбор по умолчанию — используйте это**                 |

Если вы начинаете с нуля, пропустите более ранние версии и сразу переходите к M2.7. Архитектурные изменения накапливаются, а эргономика FP8 заметно лучше.

***

## Устранение неполадок

| Проблема                               | Решение                                                                                                                           |
| -------------------------------------- | --------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` при загрузке FP8    | Требуется около 230 ГБ VRAM. Используйте 4× H100 80GB или 2× H200 141GB. Снизьте `--max-model-len` сначала до 32768.              |
| Медленная загрузка с HuggingFace       | `huggingface-cli download MiniMaxAI/MiniMax-M2.7 --local-dir ./weights --resume-download`. Ожидайте \~230 ГБ FP8 / \~460 ГБ BF16. |
| Вызовы инструментов тихо отбрасываются | Установите `--enable-auto-tool-choice --tool-call-parser hermes` в vLLM. M2.7 использует теги инструментов в стиле Hermes.        |
| `<think>` блоки пустые или искажённые  | Сэмплинг должен быть `temperature=1.0, top_p=0.95, top_k=40`. Жадное декодирование ломает Interleaved Thinking.                   |
| Ошибки MTP / несовпадение форм         | Обновите vLLM до последней стабильной версии; поддержка MTP появилась поздно, и в старых сборках модули отсутствуют.              |
| Контекст 200K вызывает OOM на H100     | Используйте `--enable-chunked-prefill` и начинайте с `--max-model-len 65536`. Полные 200K реалистично требуют H200.               |
| Путаница с лицензией                   | По умолчанию = некоммерческая. Напишите `api@minimax.io` с темой "M2.7 licensing" перед любым использованием в платном продукте.  |

***

## Дальнейшие шаги

* **Аудио-родственная модель:** [MiniMax Speech](/guides/guides_v2-ru/audio-i-golos/minimax-speech.md) — тот же вендор, генерация аудио/голоса
* **Альтернатива с открытой лицензией:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — 744B / 40B активных, лицензия MIT, топовый SWE-Bench Pro
* **Альтернатива с огромным контекстом:** [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md) — контекст 1M, мультимодальная
* **Более дешёвый агентный вариант:** [GLM-4.7 Flash](/guides/guides_v2-ru/yazykovye-modeli/glm-47-flash.md) — помещается на одном H100, MIT
* **Маркетплейс Clore.ai:** [clore.ai/marketplace](https://clore.ai/marketplace) — H100/H200/A100 со спотового рынка

### Ссылки

* [MiniMax M2.7 на HuggingFace](https://huggingface.co/MiniMaxAI/MiniMax-M2.7)
* [ЛИЦЕНЗИЯ MiniMax M2.7](https://huggingface.co/MiniMaxAI/MiniMax-M2.7/blob/main/LICENSE) — прочитайте перед коммерческим использованием
* [платформа MiniMax](https://www.minimax.io)
* [Документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)
* [KTransformers](https://github.com/kvcache-ai/ktransformers)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/minimax-m27.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
