For the complete documentation index, see llms.txt. This page is also available as Markdown.

MiMo-V2.5-Pro (Xiaomi 1T MoE)

Despliega MiMo-V2.5-Pro (1.02T MoE, 42B activos, contexto de 1M) de Xiaomi en Clore.ai: el primer nivel Pro de pesos abiertos del equipo MiMo, FP8 nativo, atención híbrida

Estado (abril de 2026): MiMo-V2.5-Pro se lanzó el 27 de abril de 2026 por la división de IA de Xiaomi como el primer modelo de pesos abiertos en su Pro categoría — el anterior MiMo-V2-Pro era solo API y no tenía pesos públicos. Los pesos están en huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro bajo la licencia MIT. La tarjeta del modelo se actualizó por última vez el 28 de abril de 2026, así que las herramientas de despliegue, los quants comunitarios y las reproducciones siguen llegando día a día.

MiMo-V2.5-Pro es un modelo de mezcla de expertos de 1,02 billones de parámetros que activa solo ~42B parámetros por token. El equipo de MiMo — liderado por la exinvestigadora de DeepSeek Luo Fuli — lo diseñó en torno a dos ideas: un esquema de atención híbrida que combina Sliding Window Attention (SWA) y Global Attention (GA) en una proporción 6:1 (~7× de reducción de la KV cache con una ventana de 128 tokens), y 3 módulos ligeros de Predicción Multitoken (MTP) que ofrecen aproximadamente 3× de velocidad de salida en cargas de trabajo autorregresivas. La arquitectura tiene 70 capas (1 densa + 69 MoE), tamaño oculto 6144, y se entrega de forma nativa en precisión mixta FP8 E4M3.

Dos cosas importan para los usuarios de Clore.ai. Primero, esta es la primera versión de MiMo Pro con pesos públicos: las variantes Pro anteriores solo existían como una API alojada y como el modelo "Hunter Alpha" probado en modo sigiloso en OpenRouter (cronología de marzo de 2026). Segundo, la licencia MIT elimina por completo las restricciones comerciales — afina, redistribúyelo, ejecútalo como un endpoint de pago, sin advertencias. El anuncio de lanzamiento de Xiaomi afirma que V2.5-Pro supera a DeepSeek V4 en tareas agénticas, pero ese benchmark solo fue publicado por el proveedor — todavía no hay reproducción de terceros, y no deberías citarlo externamente sin esa advertencia.

Especificaciones clave

Propiedad
Valor

Parámetros totales

1,02T (MoE)

Parámetros activos

~42B por pasada hacia delante

Ventana de contexto

1.000.000 tokens (1M)

Precisión

FP8 E4M3 mixta (nativa)

Arquitectura

SWA + GA híbridas (6:1), 70 capas (1 densa + 69 MoE), oculto 6144

KV cache

Ventana deslizante de 128, ~7× de reducción frente a GA completa

Decodificación especulativa

3 módulos MTP ligeros, ~3× de velocidad de salida

Licencia

MIT

Fecha de lanzamiento

27 de abril de 2026

Organización

Equipo Xiaomi MiMo (XiaomiMiMo en HuggingFace)

Herramientas principales

SGLang (prioritario), vLLM

¿Por qué MiMo-V2.5-Pro?

  • Primer MiMo abierto de nivel Pro — el predecesor MiMo-V2-Pro era solo API; esta es la primera vez que los pesos Pro son públicos

  • Contexto de 1M tokens — maneja bases de código completas, trazas de agentes largas o RAG de varios documentos sin fragmentación

  • Atención híbrida — SWA + GA en 6:1 reduce la KV cache ~7× frente a la atención global pura; los contextos largos siguen siendo manejables

  • FP8 nativo — sin cuantización posterior; los pesos se entregan en FP8 E4M3 directamente desde el proveedor

  • Decodificación especulativa MTP — 3 módulos MTP integrados dan ~3× de rendimiento de decodificación desde el primer momento

  • licencia MIT — sin restricciones comerciales, sin límites de uso

  • 42B activos — pagas el coste de inferencia de 42B densos a pesar del número destacado de 1,02T

  • Linaje — el investigador principal Luo Fuli trabajó antes en DeepSeek, y las elecciones arquitectónicas lo muestran


Requisitos

Componente
Mínimo (cuantización + descarga, futuro)
Recomendado (FP8)
FP8 completo, 1M ctx

VRAM de GPU

~141GB (Q4 + descarga a RAM, cuando lleguen los quants)

8× H100 80GB (640GB)

8× H200 141GB (1.128GB)

RAM

256GB

512GB

512GB

Disco

700GB NVMe

1,5TB NVMe

2TB NVMe

CUDA

12.8+

12.8+

12.8+

Ajuste de hardware: Para FP8 completo con margen en el contexto de 1M, 8×H200 es el objetivo natural — eso es un bare metal despliegue, no un alquiler del marketplace — consulta clore.ai/rent-h200.html. 8×H100 80GB también ejecuta el checkpoint FP8, pero limitarás --context-length más bajo (normalmente 256K) para dejar espacio para la KV cache. Para hardware de clase Blackwell, consulta clore.ai/rent-b200.html.


Opción A — Ollama / GGUF (cuantizado, compilaciones comunitarias)


Opción B — vLLM (API de producción, recomendado)

vLLM es compatible con MiMo-V2.5-Pro mediante --trust-remote-code (la atención híbrida + los módulos MTP se entregan como código personalizado en el repositorio). Usa los valores predeterminados de muestreo del proveedor: temperatura 1.0, top_p 0.95.

En 8×H100 80GB, limita --max-model-len a 262144 (256K) para dejar margen para activaciones + caché KV. En 8×H200 141GB puedes subir cómodamente a 524288 o más; 1.048.576 (1M completo) es viable, pero espera tiempos largos de prellenado — pruébalo antes de depender de ello.


Opción C — SGLang (recomendado para el máximo rendimiento)

SGLang es el objetivo de servicio de primera clase en la tarjeta del modelo MiMo-V2.5-Pro. El proveedor publica el comando de lanzamiento con SGLANG_ENABLE_SPEC_V2=1 para activar la nueva ruta de decodificación especulativa con conciencia de MTP, que es donde realmente se materializa el ~3× de mejora de velocidad de decodificación.

Para una configuración TP de varias GPU en 8×H200, añade --tp-size 8 y --mem-fraction-static 0.88. Confirma con nvidia-smi que las 8 tarjetas estén ocupadas antes de enviar tráfico real — el contexto de 1M no perdona si una posición se queda sin recursos.


Recomendaciones de GPU de Clore.ai

Configuración
VRAM
Rendimiento esperado
Coste de Clore.ai

4× H100 80GB

320GB

FP8 con descarga pesada, ctx máx. ~64K, ~10–15 tok/s

~4,16 $/h

8× H100 80GB

640GB

FP8 completo, ctx máx. ~256K, ~30–45 tok/s

~8,32 $/h

8× H200 141GB

1.128GB

FP8 completo, ctx máx. 1M, ~60+ tok/s con MTP

8× B200

1.536GB

FP8 completo, ctx máx. 1M, el más rápido disponible

precios del marketplace


Casos de uso

  • Agentes de largo horizonte — el equipo de MiMo ajusta explícitamente para el uso sostenido de herramientas. El contexto de 1M más la mejora de velocidad MTP significa miles de turnos de herramientas sin malabares de fragmentación.

  • Análisis de bases de código completas — mete un monorrepo de 500K tokens en el contexto para planificación de refactorización, auditorías de dependencias o diseño de migraciones

  • RAG de documentos largos — libros enteros, transcripciones de clientes de varios años o historiales de chat de un año caben en un solo prompt

  • Programación — la cifra reclamada por el proveedor en HumanEval+ de 75,6% y la postura agéntica lo convierten en candidato para cargas de trabajo SWE autónomas (combínalo con SWE-agent / OpenHands)

  • Bloc de notas de investigación — el contexto de 1M tolera el tipo de uso de "pega el artículo completo, pega el trabajo previo, pide una síntesis" que los modelos más pequeños truncarían


Pruebas comparativas

Benchmark
MiMo-V2.5-Pro (proveedor)
Notas

GSM8K

99.6%

Problemas de texto de matemáticas

HumanEval+

75.6%

Programación (ampliada)

MMLU

89.4%

Conocimiento general

GraphWalks (1M ctx) BFS

0.37

Recorrido de grafos de contexto largo

GraphWalks (1M ctx) Parents

0.62

Recorrido de grafos de contexto largo

Tareas agénticas vs DeepSeek V4

"supera" (proveedor)

Sin verificar — reproducción de terceros pendiente


Solución de problemas

Problema
Solución

OutOfMemoryError al cargar

FP8 nativo aún necesita ~600GB+ de VRAM. Usa 8× H200 o reduce --context-length a 65536 en 8× H100.

Descarga lenta de HuggingFace

huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download. Espera ~600GB en FP8.

--trust-remote-code rechazado

La atención híbrida y MTP se entregan como código personalizado en el repositorio. La bandera es obligatoria para vLLM y SGLang.

La mejora de velocidad MTP no aparece en SGLang

Confirma SGLANG_ENABLE_SPEC_V2=1 que está exportado en la misma shell que python3 -m sglang.launch_server. La ruta predeterminada no activa MTP.

Traza de razonamiento plana / de baja calidad

Usa temperature=1.0 y top_p=0.95. Las temperaturas más bajas degradan el comportamiento de razonamiento de MiMo.

OOM en el contexto de 1M en 8× H100

8× H100 80GB no puede alojar la caché KV para 1M tokens. Limita a 256K o cambia a 8× H200.

El prellenado tarda minutos

Se espera en contexto de 1M. Usa --enable-chunked-prefill (vLLM) o agrupa solicitudes más cortas para cargas interactivas.

Falla la descarga GGUF / Ollama

Los quants comunitarios no están publicados a 28 de abril de 2026. Espera 1–2 semanas o usa FP8 directamente.


Siguientes pasos

  • Predecesor / modelo hermano: MiMo-V2-Flash — 309B MoE, 15B activos, 32K ctx, más rápido pero más pequeño

  • Rival reclamado por el proveedor: DeepSeek V4 — 1M ctx, multimodal, ~1T params (el modelo que Xiaomi dice haber superado en tareas agénticas)

  • Rival de código de pesos abiertos: GLM-5.1 — 744B MoE, 40B activos, MIT, actualmente #1 en SWE-Bench Pro

  • Capacidad H200: bare metal bajo pedido — el mejor ajuste para un MoE de 1T FP8 completo con contexto de 1M

  • Marketplace de Clore.ai: clore.ai/marketplace

Enlaces

Última actualización

¿Te fue útil?