> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/minimax-m3.md).

# MiniMax M3 (428B multimodal)

Despliega MiniMax M3, un MoE nativamente multimodal de 428B con contexto de 1M tokens, en rigs multi-GPU de Clore.ai

{% hint style="info" %}
**Estado (agosto de 2026):** MiniMax lanzó **M3** el **1 de junio de 2026**, con pesos en Hugging Face para el 7 de junio: [MiniMaxAI/MiniMax-M3](https://huggingface.co/MiniMaxAI/MiniMax-M3). **428B en total / \~23B activos**, **Contexto de 1M tokens**, nativa **texto + imagen + vídeo** entrada, bajo una **`minimax-community`** licencia (no Apache ni MIT — léela antes de usarla comercialmente).
{% endhint %}

La propiedad interesante de M3 no es su tamaño, sino su atención. **MiniMax Sparse Attention (MSA)** reduce el cómputo por token a 1M de contexto a aproximadamente **1/20** de la atención de consulta agrupada, lo que le da a MiniMax una supuesta **prefill 9× más rápido y decodificación 15× más rápida** que M2 en contexto completo. Para trabajos con documentos largos y vídeo largo, esa es la diferencia entre un modelo para el que puedes permitirte llenar la ventana y uno para el que no.

Con solo \~23B parámetros activos por token, la velocidad de decodificación en una compilación cuantizada se acerca más a la de un modelo de tamaño medio que a la de uno de 428B.

### Especificaciones clave

| Propiedad                | Valor                                                                  |
| ------------------------ | ---------------------------------------------------------------------- |
| Parámetros               | 428B en total, \~23B activos (MoE)                                     |
| Arquitectura             | 60 capas, GQA + MiniMax Sparse Attention, codificador de visión nativo |
| Modalidad                | Texto, imagen y vídeo de entrada → texto de salida                     |
| Contexto                 | 1.000.000 tokens                                                       |
| Licencia                 | `minimax-community` (personalizada, con restricciones comerciales)     |
| Fecha de lanzamiento     | 1 de junio de 2026                                                     |
| Pesos                    | BF16 854GB · Q2\_K\_XL GGUF 143GB · Q3\_K\_M GGUF 195GB                |
| Herramientas principales | vLLM, SGLang, llama.cpp, Transformers                                  |

***

## Requisitos

| Compilación   | Tamaño  | equipo de Clore.ai                                               |
| ------------- | ------- | ---------------------------------------------------------------- |
| `UD-IQ1_M`    | 128GB   | 6× RTX 5090 (186GB) — cómodo                                     |
| `UD-Q2_K_XL`  | 143GB   | 6× RTX 5090 o 8× RTX 4090 (192GB)                                |
| `UD-Q3_K_M`   | 195GB   | 8× RTX 5090 (248GB)                                              |
| `UD-Q4_K_S`   | 248GB   | 10× RTX 5090 (310GB) o 4× RTX PRO 6000 (380GB)                   |
| MXFP8 oficial | \~430GB | No en el marketplace → [bare metal](https://clore.ai/bare-metal) |
| BF16 oficial  | 854GB   | [bare metal](https://clore.ai/bare-metal)                        |

En la última instantánea había **72 servidores con ≥167GB de VRAM (26 libres)** y **54 con ≥192GB (14 libres)** — suficiente para alojar una compilación Q2 o Q3, pero no tantos como para asumir que habrá una esperándote.

{% hint style="warning" %}
La entrada multimodal necesita que la torre de visión se cargue junto con el modelo de lenguaje. Reserva unos GB extra sobre el tamaño cuantizado si planeas alimentarlo con imágenes o vídeo, y prefiere equipos con mucha RAM del sistema para la decodificación de vídeo.
{% endhint %}

***

## Desplegar con llama.cpp

```bash
huggingface-cli download unsloth/MiniMax-M3-GGUF \
  --include "*UD-Q2_K_XL*" --local-dir /workspace/m3

llama-server -m /workspace/m3/*UD-Q2_K_XL*-00001-of-*.gguf \
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 262144 --flash-attn --no-mmap
```

## Despliega con vLLM

```bash
vllm serve MiniMaxAI/MiniMax-M3 \
  --tensor-parallel-size 8 \
  --trust-remote-code \\
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.92 \
  --enable-expert-parallel
```

Puntos de control precuantizados: [`MiniMaxAI/MiniMax-M3-MXFP8`](https://huggingface.co/MiniMaxAI/MiniMax-M3-MXFP8) (oficial), [`nvidia/MiniMax-M3-NVFP4`](https://huggingface.co/nvidia/MiniMax-M3-NVFP4) para Blackwell, [`cyankiwi/MiniMax-M3-AWQ-INT4`](https://huggingface.co/cyankiwi/MiniMax-M3-AWQ-INT4) para stacks AWQ.

***

## Recomendaciones de GPU para Clore.ai

| Configuración   | VRAM total | Compilación  | Coste en Clore.ai  |
| --------------- | ---------- | ------------ | ------------------ |
| 6× RTX 5090     | 186GB      | Q2\_K\_XL    | \~1,50–2,60 $/h    |
| 8× RTX 4090     | 192GB      | Q2\_K\_XL    | \~1,12–3,36 $/h    |
| **8× RTX 5090** | **248GB**  | **Q3\_K\_M** | **\~$2.00–3.50/h** |
| 4× RTX PRO 6000 | 380GB      | Q4\_K\_S     | \~5,00 $/h         |

***

## Casos de uso

* **Comprensión de vídeo largo** — entrada de vídeo nativa más la curva de coste de la atención dispersa
* **Análisis de documentos de un millón de tokens** — contratos, bases de código, archivos en una sola pasada
* **Programación agéntica y tareas de "cowork"** — para eso optimizó MiniMax M3
* **Decodificación barata a escala frontier** — 23B parámetros activos significa que los tokens salen rápido para el tamaño del modelo
* **RAG multimodal** — un solo modelo para texto, capturas de pantalla y fotogramas de vídeo

{% hint style="warning" %}
**Comprueba la licencia antes de usarlo comercialmente.** M3 se distribuye bajo `minimax-community`, no una licencia OSI. Si necesitas términos sin restricciones, [GLM-5.2](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md) es MIT y [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md) es Apache 2.0.
{% endhint %}

***

## Solución de problemas

| Problema                            | Solución                                                                                                                 |
| ----------------------------------- | ------------------------------------------------------------------------------------------------------------------------ |
| `trust_remote_code` errores         | M3 incluye código de modelado personalizado — pasa `--trust-remote-code` en vLLM                                         |
| Faltan kernels de atención dispersa | Actualiza vLLM/SGLang; el soporte de MSA llegó después del lanzamiento de junio                                          |
| Falla la entrada de vídeo           | Comprueba que el equipo tenga suficiente RAM del sistema y CPU para la decodificación; el vídeo se decodifica en el host |
| OOM en contexto de 1M               | La caché KV es más pequeña que GQA, pero no es gratis — empieza en 262K y ve subiendo                                    |
| Prefill lento                       | Activa el prefill por bloques; la ventaja de MSA se nota en contexto largo, no en prompts cortos                         |

***

## Siguientes pasos

* **Predecesor:** [MiniMax M2.7](/guides/guides_v2-es/modelos-de-lenguaje/minimax-m27.md) — el MoE de programación de abril
* **Alternativa MIT a escala similar:** [GLM-5.2](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md)
* **Alternativa de una sola tarjeta:** [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md)
* **Dimensionamiento del equipo:** [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md)

### Enlaces

* [MiniMax M3 en Hugging Face](https://huggingface.co/MiniMaxAI/MiniMax-M3) · [GGUF](https://huggingface.co/unsloth/MiniMax-M3-GGUF)
* [Informe técnico (arXiv 2606.13392)](https://arxiv.org/abs/2606.13392) · [Repositorio de MSA](https://github.com/MiniMax-AI/MSA)
* [MiniMax-M3 GitHub](https://github.com/MiniMax-AI/MiniMax-M3)
* **Alquila una GPU:** [RTX 5090](https://clore.ai/rent-5090.html) · [RTX 4090](https://clore.ai/rent-4090.html) · [Marketplace](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
