> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mimo-v25-pro.md).

# MiMo-V2.5-Pro (Xiaomi 1T MoE)

Despliega MiMo-V2.5-Pro (1.02T MoE, 42B activos, contexto de 1M) de Xiaomi en Clore.ai: el primer nivel Pro de pesos abiertos del equipo MiMo, FP8 nativo, atención híbrida

{% hint style="info" %}
**Estado (abril de 2026):** MiMo-V2.5-Pro se lanzó el **27 de abril de 2026** por la división de IA de Xiaomi como el primer modelo de pesos abiertos en su **Pro** categoría — el anterior MiMo-V2-Pro era solo API y no tenía pesos públicos. Los pesos están en [huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro) bajo la **licencia MIT**. La tarjeta del modelo se actualizó por última vez el 28 de abril de 2026, así que las herramientas de despliegue, los quants comunitarios y las reproducciones siguen llegando día a día.
{% endhint %}

MiMo-V2.5-Pro es un **modelo de mezcla de expertos de 1,02 billones de parámetros** que activa solo **\~42B parámetros por token**. El equipo de MiMo — liderado por la exinvestigadora de DeepSeek **Luo Fuli** — lo diseñó en torno a dos ideas: un **esquema de atención híbrida** que combina Sliding Window Attention (SWA) y Global Attention (GA) en una proporción 6:1 (\~7× de reducción de la KV cache con una ventana de 128 tokens), y **3 módulos ligeros de Predicción Multitoken (MTP)** que ofrecen aproximadamente **3× de velocidad de salida** en cargas de trabajo autorregresivas. La arquitectura tiene 70 capas (1 densa + 69 MoE), tamaño oculto 6144, y se entrega de forma nativa en **precisión mixta FP8 E4M3**.

Dos cosas importan para los usuarios de Clore.ai. Primero, esta es la **primera versión de MiMo Pro con pesos públicos**: las variantes Pro anteriores solo existían como una API alojada y como el modelo "Hunter Alpha" probado en modo sigiloso en OpenRouter (cronología de marzo de 2026). Segundo, la **licencia MIT** elimina por completo las restricciones comerciales — afina, redistribúyelo, ejecútalo como un endpoint de pago, sin advertencias. El anuncio de lanzamiento de Xiaomi afirma que V2.5-Pro **supera a DeepSeek V4 en tareas agénticas**, pero ese benchmark solo fue publicado por el proveedor — todavía no hay reproducción de terceros, y no deberías citarlo externamente sin esa advertencia.

### Especificaciones clave

| Propiedad                   | Valor                                                             |
| --------------------------- | ----------------------------------------------------------------- |
| Parámetros totales          | 1,02T (MoE)                                                       |
| Parámetros activos          | \~42B por pasada hacia delante                                    |
| Ventana de contexto         | 1.000.000 tokens (1M)                                             |
| Precisión                   | FP8 E4M3 mixta (nativa)                                           |
| Arquitectura                | SWA + GA híbridas (6:1), 70 capas (1 densa + 69 MoE), oculto 6144 |
| KV cache                    | Ventana deslizante de 128, \~7× de reducción frente a GA completa |
| Decodificación especulativa | 3 módulos MTP ligeros, \~3× de velocidad de salida                |
| Licencia                    | MIT                                                               |
| Fecha de lanzamiento        | 27 de abril de 2026                                               |
| Organización                | Equipo Xiaomi MiMo (XiaomiMiMo en HuggingFace)                    |
| Herramientas principales    | SGLang (prioritario), vLLM                                        |

### ¿Por qué MiMo-V2.5-Pro?

* **Primer MiMo abierto de nivel Pro** — el predecesor MiMo-V2-Pro era solo API; esta es la primera vez que los pesos Pro son públicos
* **Contexto de 1M tokens** — maneja bases de código completas, trazas de agentes largas o RAG de varios documentos sin fragmentación
* **Atención híbrida** — SWA + GA en 6:1 reduce la KV cache \~7× frente a la atención global pura; los contextos largos siguen siendo manejables
* **FP8 nativo** — sin cuantización posterior; los pesos se entregan en FP8 E4M3 directamente desde el proveedor
* **Decodificación especulativa MTP** — 3 módulos MTP integrados dan \~3× de rendimiento de decodificación desde el primer momento
* **licencia MIT** — sin restricciones comerciales, sin límites de uso
* **42B activos** — pagas el coste de inferencia de 42B densos a pesar del número destacado de 1,02T
* **Linaje** — el investigador principal Luo Fuli trabajó antes en DeepSeek, y las elecciones arquitectónicas lo muestran

***

## Requisitos

{% hint style="warning" %}
**Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai.** Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo pedido. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

{% hint style="warning" %}
**Sigue siendo un modelo de 1T.** "42B activos" suena amable, pero los 1,02T pesos completos deben residir en VRAM (o descargarse agresivamente). Los pesos FP8 nativos necesitan **\~600GB+ de VRAM** antes de la memoria de activación y la caché KV. Planifica 8×H200 o más para FP8 con contexto completo.
{% endhint %}

| Componente  | Mínimo (cuantización + descarga, futuro)                 | Recomendado (FP8)    | FP8 completo, 1M ctx    |
| ----------- | -------------------------------------------------------- | -------------------- | ----------------------- |
| VRAM de GPU | \~141GB (Q4 + descarga a RAM, cuando lleguen los quants) | 8× H100 80GB (640GB) | 8× H200 141GB (1.128GB) |
| RAM         | 256GB                                                    | 512GB                | 512GB                   |
| Disco       | 700GB NVMe                                               | 1,5TB NVMe           | 2TB NVMe                |
| CUDA        | 12.8+                                                    | 12.8+                | 12.8+                   |

**Ajuste de hardware:** Para FP8 completo con margen en el contexto de 1M, **8×H200** es el objetivo natural — eso es un [bare metal](https://clore.ai/bare-metal) despliegue, no un alquiler del marketplace — consulta [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html). 8×H100 80GB también ejecuta el checkpoint FP8, pero limitarás `--context-length` más bajo (normalmente 256K) para dejar espacio para la KV cache. Para hardware de clase Blackwell, consulta [clore.ai/rent-b200.html](https://clore.ai/rent-b200.html).

***

## Opción A — Ollama / GGUF (cuantizado, compilaciones comunitarias)

{% hint style="warning" %}
**Aviso:** A 28 de abril de 2026 (un día después del lanzamiento) **todavía no se han publicado quants GGUF comunitarios para MiMo-V2.5-Pro**. Se espera que aparezcan compilaciones Q4\_K\_M / Q5\_K\_M / Q6\_K\_M en 1–2 semanas en [huggingface.co/models?search=mimo-v2.5-pro+gguf](https://huggingface.co/models?search=mimo-v2.5-pro+gguf). Hasta entonces, FP8 vía SGLang o vLLM es la ruta soportada.
{% endhint %}

```bash
# Una vez que haya una compilación Q4_K_M disponible
docker exec ollama ollama pull mimo-v2.5-pro:q4_K_M
docker exec ollama ollama run mimo-v2.5-pro:q4_K_M

# O con llama.cpp directamente sobre un archivo GGUF (cuando se publique)
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/mimo-v2.5-pro-q4_k_m.gguf \\
  --n-gpu-layers 99 --ctx-size 65536 \\
  --port 8080 --host 0.0.0.0
```

***

## Opción B — vLLM (API de producción, recomendado)

vLLM es compatible con MiMo-V2.5-Pro mediante `--trust-remote-code` (la atención híbrida + los módulos MTP se entregan como código personalizado en el repositorio). Usa los valores predeterminados de muestreo del proveedor: **temperatura 1.0, top\_p 0.95**.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model XiaomiMiMo/MiMo-V2.5-Pro
      --tensor-parallel-size 8
      --quantization fp8
      --max-model-len 262144
      --gpu-memory-utilization 0.90
      --trust-remote-code
      --served-model-name mimo-v2.5-pro
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Prueba la API (muestreo recomendado por el proveedor)
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mimo-v2.5-pro",
    "messages": [
      {"role": "system", "content": "Eres un agente autónomo de programación."},
      {"role": "user", "content": "Recorre este monorrepo de 30 mil líneas y propone un plan de migración de Express 4 a Fastify 5."}
    ],
    "max_tokens": 8192,
    "temperature": 1.0,
    "top_p": 0.95
  }'
```

{% hint style="info" %}
En 8×H100 80GB, limita `--max-model-len` a 262144 (256K) para dejar margen para activaciones + caché KV. En 8×H200 141GB puedes subir cómodamente a 524288 o más; 1.048.576 (1M completo) es viable, pero espera tiempos largos de prellenado — pruébalo antes de depender de ello.
{% endhint %}

***

## Opción C — SGLang (recomendado para el máximo rendimiento)

SGLang es el **objetivo de servicio de primera clase** en la tarjeta del modelo MiMo-V2.5-Pro. El proveedor publica el comando de lanzamiento con **`SGLANG_ENABLE_SPEC_V2=1`** para activar la nueva ruta de decodificación especulativa con conciencia de MTP, que es donde realmente se materializa el \~3× de mejora de velocidad de decodificación.

```bash
docker pull lmsysorg/sglang:latest

# Literalmente de la tarjeta del modelo de HF
SGLANG_ENABLE_SPEC_V2=1 python3 -m sglang.launch_server \\
    --model-path XiaomiMiMo/MiMo-V2.5-Pro \\
    --trust-remote-code \\
    --quantization fp8 \\
    --context-length 1048576 \\
    --host 0.0.0.0 --port 9001
```

Para una configuración TP de varias GPU en 8×H200, añade `--tp-size 8` y `--mem-fraction-static 0.88`. Confirma con `nvidia-smi` que las 8 tarjetas estén ocupadas antes de enviar tráfico real — el contexto de 1M no perdona si una posición se queda sin recursos.

***

## Recomendaciones de GPU de Clore.ai

| Configuración | VRAM    | Rendimiento esperado                                   | Coste de Clore.ai                         |
| ------------- | ------- | ------------------------------------------------------ | ----------------------------------------- |
| 4× H100 80GB  | 320GB   | FP8 con descarga pesada, ctx máx. \~64K, \~10–15 tok/s | \~4,16 $/h                                |
| 8× H100 80GB  | 640GB   | FP8 completo, ctx máx. \~256K, \~30–45 tok/s           | \~8,32 $/h                                |
| 8× H200 141GB | 1.128GB | FP8 completo, ctx máx. 1M, \~60+ tok/s con MTP         | [bare metal](https://clore.ai/bare-metal) |
| 8× B200       | 1.536GB | FP8 completo, ctx máx. 1M, el más rápido disponible    | precios del marketplace                   |

{% hint style="success" %}
**Mejor calidad:** 8× H200 141GB en el checkpoint FP8 ([bare metal](https://clore.ai/bare-metal)) con `SGLANG_ENABLE_SPEC_V2=1`. Obtienes la ventana de contexto completa de 1M, decodificación especulativa MTP y suficiente margen de caché KV para bucles reales de agentes. Consulta [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html) para ver disponibilidad en vivo.
{% endhint %}

***

## Casos de uso

* **Agentes de largo horizonte** — el equipo de MiMo ajusta explícitamente para el uso sostenido de herramientas. El contexto de 1M más la mejora de velocidad MTP significa miles de turnos de herramientas sin malabares de fragmentación.
* **Análisis de bases de código completas** — mete un monorrepo de 500K tokens en el contexto para planificación de refactorización, auditorías de dependencias o diseño de migraciones
* **RAG de documentos largos** — libros enteros, transcripciones de clientes de varios años o historiales de chat de un año caben en un solo prompt
* **Programación** — la cifra reclamada por el proveedor en HumanEval+ de 75,6% y la postura agéntica lo convierten en candidato para cargas de trabajo SWE autónomas (combínalo con SWE-agent / OpenHands)
* **Bloc de notas de investigación** — el contexto de 1M tolera el tipo de uso de "pega el artículo completo, pega el trabajo previo, pide una síntesis" que los modelos más pequeños truncarían

***

## Pruebas comparativas

{% hint style="warning" %}
**Reclamados por el proveedor — aún no hay reproducción de terceros.** Todas las cifras siguientes provienen del anuncio de Xiaomi del 27 de abril de 2026 y de la tarjeta del modelo en HuggingFace. El modelo tiene **dos días** al momento de escribir esto — las reproducciones independientes en benchmarks agénticos y de contexto largo siguen pendientes. En particular, la afirmación de que "supera a DeepSeek V4 en tareas agénticas" procede del propio texto de Xiaomi; tómala como marketing hasta que se reproduzca.
{% endhint %}

| Benchmark                       | MiMo-V2.5-Pro (proveedor) | Notas                                                  |
| ------------------------------- | ------------------------- | ------------------------------------------------------ |
| GSM8K                           | **99.6%**                 | Problemas de texto de matemáticas                      |
| HumanEval+                      | 75.6%                     | Programación (ampliada)                                |
| MMLU                            | 89.4%                     | Conocimiento general                                   |
| GraphWalks (1M ctx) BFS         | 0.37                      | Recorrido de grafos de contexto largo                  |
| GraphWalks (1M ctx) Parents     | 0.62                      | Recorrido de grafos de contexto largo                  |
| Tareas agénticas vs DeepSeek V4 | "supera" (proveedor)      | **Sin verificar — reproducción de terceros pendiente** |

***

## Solución de problemas

| Problema                                        | Solución                                                                                                                                             |
| ----------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` al cargar                    | FP8 nativo aún necesita \~600GB+ de VRAM. Usa 8× H200 o reduce `--context-length` a 65536 en 8× H100.                                                |
| Descarga lenta de HuggingFace                   | `huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download`. Espera \~600GB en FP8.                                  |
| `--trust-remote-code` rechazado                 | La atención híbrida y MTP se entregan como código personalizado en el repositorio. La bandera es **obligatoria** para vLLM y SGLang.                 |
| La mejora de velocidad MTP no aparece en SGLang | Confirma `SGLANG_ENABLE_SPEC_V2=1` que está exportado en la misma shell que `python3 -m sglang.launch_server`. La ruta predeterminada no activa MTP. |
| Traza de razonamiento plana / de baja calidad   | Usa `temperature=1.0` y `top_p=0.95`. Las temperaturas más bajas degradan el comportamiento de razonamiento de MiMo.                                 |
| OOM en el contexto de 1M en 8× H100             | 8× H100 80GB no puede alojar la caché KV para 1M tokens. Limita a 256K o cambia a 8× H200.                                                           |
| El prellenado tarda minutos                     | Se espera en contexto de 1M. Usa `--enable-chunked-prefill` (vLLM) o agrupa solicitudes más cortas para cargas interactivas.                         |
| Falla la descarga GGUF / Ollama                 | Los quants comunitarios no están publicados a 28 de abril de 2026. Espera 1–2 semanas o usa FP8 directamente.                                        |

***

## Siguientes pasos

* **Predecesor / modelo hermano:** [MiMo-V2-Flash](/guides/guides_v2-es/modelos-de-lenguaje/mimo-v2-flash.md) — 309B MoE, 15B activos, 32K ctx, más rápido pero más pequeño
* **Rival reclamado por el proveedor:** [DeepSeek V4](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v4.md) — 1M ctx, multimodal, \~1T params (el modelo que Xiaomi dice haber superado en tareas agénticas)
* **Rival de código de pesos abiertos:** [GLM-5.1](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-1.md) — 744B MoE, 40B activos, MIT, actualmente #1 en SWE-Bench Pro
* **Capacidad H200:** [bare metal bajo pedido](https://clore.ai/bare-metal) — el mejor ajuste para un MoE de 1T FP8 completo con contexto de 1M
* **Marketplace de Clore.ai:** [clore.ai/marketplace](https://clore.ai/marketplace)

### Enlaces

* [MiMo-V2.5-Pro en HuggingFace](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro)
* [organización HuggingFace de Xiaomi MiMo](https://huggingface.co/XiaomiMiMo)
* [repositorio SGLang](https://github.com/sgl-project/sglang)
* [documentación de vLLM](https://docs.vllm.ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mimo-v25-pro.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
