> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/minimax-m3.md).

# MiniMax M3 (428B мультимодальная)

Разверните MiniMax M3, нативно мультимодальную MoE на 428B с контекстом 1M токенов, на много-GPU ригах Clore.ai

{% hint style="info" %}
**Статус (август 2026):** MiniMax выпустила **M3** на **1 июня 2026**, а веса на Hugging Face — к 7 июня: [MiniMaxAI/MiniMax-M3](https://huggingface.co/MiniMaxAI/MiniMax-M3). **428 млрд всего / \~23 млрд активных**, **Контекст на 1M токенов**, нативный **текст + изображение + видео** вход, под собственной **`minimax-community`** лицензией (не Apache и не MIT — прочитайте её перед коммерческим использованием).
{% endhint %}

Интересная особенность M3 — не его размер, а его механизм внимания. **Разреженное внимание MiniMax (MSA)** сокращает вычисления на токен при контексте 1M примерно до **1/20** чем grouped-query attention, что, по утверждению MiniMax, даёт **в 9× более быстрое предзаполнение и в 15× более быстрое декодирование** чем M2 при полном контексте. Для работы с длинными документами и длинным видео это разница между моделью, которой можно позволить заполнить окно, и той, которой нельзя.

При всего \~23 млрд активных параметров на токен скорость декодирования на квантизированной сборке ближе к модели среднего размера, чем к 428-миллиардной.

### Ключевые характеристики

| Параметр             | Значение                                                                    |
| -------------------- | --------------------------------------------------------------------------- |
| Параметры            | 428 млрд всего, \~23 млрд активных (MoE)                                    |
| Архитектура          | 60 слоёв, GQA + разреженное внимание MiniMax, встроенный визуальный энкодер |
| Модальность          | Текст, изображение, видео на вход → текст на выход                          |
| Контекст             | 1 000 000 токенов                                                           |
| Лицензия             | `minimax-community` (собственная, с коммерческими ограничениями)            |
| Дата выпуска         | 1 июня 2026                                                                 |
| Веса                 | BF16 854 ГБ · Q2\_K\_XL GGUF 143 ГБ · Q3\_K\_M GGUF 195 ГБ                  |
| Основные инструменты | vLLM, SGLang, llama.cpp, Transformers                                       |

***

## Требования

| Сборка            | Размер   | Сборка Clore.ai                                                   |
| ----------------- | -------- | ----------------------------------------------------------------- |
| `UD-IQ1_M`        | 128 ГБ   | 6× RTX 5090 (186 ГБ) — комфортно                                  |
| `UD-Q2_K_XL`      | 143 ГБ   | 6× RTX 5090 или 8× RTX 4090 (192 ГБ)                              |
| `UD-Q3_K_M`       | 195 ГБ   | 8× RTX 5090 (248GB)                                               |
| `UD-Q4_K_S`       | 248GB    | 10× RTX 5090 (310 ГБ) или 4× RTX PRO 6000 (380 ГБ)                |
| официальный MXFP8 | \~430 ГБ | Нет на маркетплейсе → [голое железо](https://clore.ai/bare-metal) |
| официальный BF16  | 854 ГБ   | [голое железо](https://clore.ai/bare-metal)                       |

На последнем снимке было **72 сервера с ≥167 ГБ VRAM (26 свободных)** и **54 с ≥192 ГБ (14 свободных)** — достаточно, чтобы разместить сборку Q2 или Q3, но не настолько много, чтобы предполагать, что одна из них будет ждать.

{% hint style="warning" %}
Для мультимодального ввода нужно загружать визуальный модуль вместе с языковой моделью. Закладывайте несколько дополнительных ГБ сверх размера квантизации, если планируете подавать изображения или видео, и предпочитайте сборки с большим объёмом системной RAM для декодирования видео.
{% endhint %}

***

## Развёртывание с llama.cpp

```bash
huggingface-cli download unsloth/MiniMax-M3-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/m3

llama-server -m /workspace/m3/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \
  -ngl 999 --split-mode layer \
  -c 262144 --flash-attn --no-mmap
```

## Развертывание с vLLM

```bash
vllm serve MiniMaxAI/MiniMax-M3 \\
  --tensor-parallel-size 8 \
  --trust-remote-code \\
  --max-model-len 262144 \
  --gpu-memory-utilization 0.92 \\
  --enable-expert-parallel
```

Предварительно квантизированные чекпойнты: [`MiniMaxAI/MiniMax-M3-MXFP8`](https://huggingface.co/MiniMaxAI/MiniMax-M3-MXFP8) (официальный), [`nvidia/MiniMax-M3-NVFP4`](https://huggingface.co/nvidia/MiniMax-M3-NVFP4) для Blackwell, [`cyankiwi/MiniMax-M3-AWQ-INT4`](https://huggingface.co/cyankiwi/MiniMax-M3-AWQ-INT4) для стеков AWQ.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация    | Общий объём VRAM | Сборка       | Стоимость Clore.ai |
| --------------- | ---------------- | ------------ | ------------------ |
| 6× RTX 5090     | 186 ГБ           | Q2\_K\_XL    | \~$1.50–2.60/ч     |
| 8× RTX 4090     | 192 ГБ           | Q2\_K\_XL    | \~$1.12–3.36/ч     |
| **8× RTX 5090** | **248GB**        | **Q3\_K\_M** | **\~$2.00–3.50/ч** |
| 4× RTX PRO 6000 | 380 ГБ           | Q4\_K\_S     | \~$5.00/ч          |

***

## Сценарии использования

* **Понимание длинного видео** — нативный ввод видео плюс кривая стоимости разреженного внимания
* **Анализ документов на миллион токенов** — контракты, кодовые базы, архивы за один проход
* **Агентное программирование и задачи "cowork"** — под что MiniMax оптимизировала M3
* **Недорогое декодирование на передовом масштабе** — 23 млрд активных параметров означают, что токены выходят быстро для модели такого размера
* **Мультимодальный RAG** — одна модель для текста, скриншотов и кадров видео

{% hint style="warning" %}
**Проверьте лицензию перед коммерческим использованием.** M3 поставляется под `minimax-community`, а не под лицензией OSI. Если вам нужны неограниченные условия, [GLM-5.2](/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md) — MIT, а [Qwen3.8-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md) — Apache 2.0.
{% endhint %}

***

## Устранение неполадок

| Проблема                               | Исправьте                                                                                                     |
| -------------------------------------- | ------------------------------------------------------------------------------------------------------------- |
| `trust_remote_code` ошибки             | M3 поставляется с собственным кодом моделирования — передайте `--trust-remote-code` в vLLM                    |
| Отсутствуют ядра разреженного внимания | Обновите vLLM/SGLang; поддержка MSA появилась после июньского релиза                                          |
| Не работает ввод видео                 | Проверьте, что у сборки достаточно системной RAM и CPU для декодирования; видео декодируется на стороне хоста |
| OOM при контексте 1M                   | KV-кэш меньше, чем у GQA, но не бесплатен — начинайте с 262K и повышайте                                      |
| Медленный префилл                      | Включите chunked prefill; преимущество MSA проявляется на длинном контексте, а не на коротких промптах        |

***

## Дальнейшие шаги

* **Предшественник:** [MiniMax M2.7](/guides/guides_v2-ru/yazykovye-modeli/minimax-m27.md) — апрельская MoE для кодирования
* **Альтернатива на MIT с похожим масштабом:** [GLM-5.2](/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md)
* **Альтернатива на одной карте:** [Qwen3.8-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md)
* **Подбор конфигурации:** [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md)

### Ссылки

* [MiniMax M3 на Hugging Face](https://huggingface.co/MiniMaxAI/MiniMax-M3) · [GGUF](https://huggingface.co/unsloth/MiniMax-M3-GGUF)
* [Технический отчёт (arXiv 2606.13392)](https://arxiv.org/abs/2606.13392) · [Репозиторий MSA](https://github.com/MiniMax-AI/MSA)
* [GitHub MiniMax-M3](https://github.com/MiniMax-AI/MiniMax-M3)
* **Арендовать GPU:** [RTX 5090](https://clore.ai/rent-5090.html) · [RTX 4090](https://clore.ai/rent-4090.html) · [Маркетплейс](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
