MiMo-V2.5-Pro (Xiaomi 1T MoE)
Despliega MiMo-V2.5-Pro (1.02T MoE, 42B activos, contexto de 1M) de Xiaomi en Clore.ai: el primer nivel Pro de pesos abiertos del equipo MiMo, FP8 nativo, atención híbrida
MiMo-V2.5-Pro es un modelo de mezcla de expertos de 1,02 billones de parámetros que activa solo ~42B parámetros por token. El equipo de MiMo — liderado por la exinvestigadora de DeepSeek Luo Fuli — lo diseñó en torno a dos ideas: un esquema de atención híbrida que combina Sliding Window Attention (SWA) y Global Attention (GA) en una proporción 6:1 (~7× de reducción de la KV cache con una ventana de 128 tokens), y 3 módulos ligeros de Predicción Multitoken (MTP) que ofrecen aproximadamente 3× de velocidad de salida en cargas de trabajo autorregresivas. La arquitectura tiene 70 capas (1 densa + 69 MoE), tamaño oculto 6144, y se entrega de forma nativa en precisión mixta FP8 E4M3.
Dos cosas importan para los usuarios de Clore.ai. Primero, esta es la primera versión de MiMo Pro con pesos públicos: las variantes Pro anteriores solo existían como una API alojada y como el modelo "Hunter Alpha" probado en modo sigiloso en OpenRouter (cronología de marzo de 2026). Segundo, la licencia MIT elimina por completo las restricciones comerciales — afina, redistribúyelo, ejecútalo como un endpoint de pago, sin advertencias. El anuncio de lanzamiento de Xiaomi afirma que V2.5-Pro supera a DeepSeek V4 en tareas agénticas, pero ese benchmark solo fue publicado por el proveedor — todavía no hay reproducción de terceros, y no deberías citarlo externamente sin esa advertencia.
Especificaciones clave
Parámetros totales
1,02T (MoE)
Parámetros activos
~42B por pasada hacia delante
Ventana de contexto
1.000.000 tokens (1M)
Precisión
FP8 E4M3 mixta (nativa)
Arquitectura
SWA + GA híbridas (6:1), 70 capas (1 densa + 69 MoE), oculto 6144
KV cache
Ventana deslizante de 128, ~7× de reducción frente a GA completa
Decodificación especulativa
3 módulos MTP ligeros, ~3× de velocidad de salida
Licencia
MIT
Fecha de lanzamiento
27 de abril de 2026
Organización
Equipo Xiaomi MiMo (XiaomiMiMo en HuggingFace)
Herramientas principales
SGLang (prioritario), vLLM
¿Por qué MiMo-V2.5-Pro?
Primer MiMo abierto de nivel Pro — el predecesor MiMo-V2-Pro era solo API; esta es la primera vez que los pesos Pro son públicos
Contexto de 1M tokens — maneja bases de código completas, trazas de agentes largas o RAG de varios documentos sin fragmentación
Atención híbrida — SWA + GA en 6:1 reduce la KV cache ~7× frente a la atención global pura; los contextos largos siguen siendo manejables
FP8 nativo — sin cuantización posterior; los pesos se entregan en FP8 E4M3 directamente desde el proveedor
Decodificación especulativa MTP — 3 módulos MTP integrados dan ~3× de rendimiento de decodificación desde el primer momento
licencia MIT — sin restricciones comerciales, sin límites de uso
42B activos — pagas el coste de inferencia de 42B densos a pesar del número destacado de 1,02T
Linaje — el investigador principal Luo Fuli trabajó antes en DeepSeek, y las elecciones arquitectónicas lo muestran
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Sigue siendo un modelo de 1T. "42B activos" suena amable, pero los 1,02T pesos completos deben residir en VRAM (o descargarse agresivamente). Los pesos FP8 nativos necesitan ~600GB+ de VRAM antes de la memoria de activación y la caché KV. Planifica 8×H200 o más para FP8 con contexto completo.
VRAM de GPU
~141GB (Q4 + descarga a RAM, cuando lleguen los quants)
8× H100 80GB (640GB)
8× H200 141GB (1.128GB)
RAM
256GB
512GB
512GB
Disco
700GB NVMe
1,5TB NVMe
2TB NVMe
CUDA
12.8+
12.8+
12.8+
Ajuste de hardware: Para FP8 completo con margen en el contexto de 1M, 8×H200 es el objetivo natural — eso es un bare metal despliegue, no un alquiler del marketplace — consulta clore.ai/rent-h200.html. 8×H100 80GB también ejecuta el checkpoint FP8, pero limitarás --context-length más bajo (normalmente 256K) para dejar espacio para la KV cache. Para hardware de clase Blackwell, consulta clore.ai/rent-b200.html.
Opción A — Ollama / GGUF (cuantizado, compilaciones comunitarias)
Aviso: A 28 de abril de 2026 (un día después del lanzamiento) todavía no se han publicado quants GGUF comunitarios para MiMo-V2.5-Pro. Se espera que aparezcan compilaciones Q4_K_M / Q5_K_M / Q6_K_M en 1–2 semanas en huggingface.co/models?search=mimo-v2.5-pro+gguf. Hasta entonces, FP8 vía SGLang o vLLM es la ruta soportada.
Opción B — vLLM (API de producción, recomendado)
vLLM es compatible con MiMo-V2.5-Pro mediante --trust-remote-code (la atención híbrida + los módulos MTP se entregan como código personalizado en el repositorio). Usa los valores predeterminados de muestreo del proveedor: temperatura 1.0, top_p 0.95.
Opción C — SGLang (recomendado para el máximo rendimiento)
SGLang es el objetivo de servicio de primera clase en la tarjeta del modelo MiMo-V2.5-Pro. El proveedor publica el comando de lanzamiento con SGLANG_ENABLE_SPEC_V2=1 para activar la nueva ruta de decodificación especulativa con conciencia de MTP, que es donde realmente se materializa el ~3× de mejora de velocidad de decodificación.
Para una configuración TP de varias GPU en 8×H200, añade --tp-size 8 y --mem-fraction-static 0.88. Confirma con nvidia-smi que las 8 tarjetas estén ocupadas antes de enviar tráfico real — el contexto de 1M no perdona si una posición se queda sin recursos.
Recomendaciones de GPU de Clore.ai
4× H100 80GB
320GB
FP8 con descarga pesada, ctx máx. ~64K, ~10–15 tok/s
~4,16 $/h
8× H100 80GB
640GB
FP8 completo, ctx máx. ~256K, ~30–45 tok/s
~8,32 $/h
8× B200
1.536GB
FP8 completo, ctx máx. 1M, el más rápido disponible
precios del marketplace
Mejor calidad: 8× H200 141GB en el checkpoint FP8 (bare metal) con SGLANG_ENABLE_SPEC_V2=1. Obtienes la ventana de contexto completa de 1M, decodificación especulativa MTP y suficiente margen de caché KV para bucles reales de agentes. Consulta clore.ai/rent-h200.html para ver disponibilidad en vivo.
Casos de uso
Agentes de largo horizonte — el equipo de MiMo ajusta explícitamente para el uso sostenido de herramientas. El contexto de 1M más la mejora de velocidad MTP significa miles de turnos de herramientas sin malabares de fragmentación.
Análisis de bases de código completas — mete un monorrepo de 500K tokens en el contexto para planificación de refactorización, auditorías de dependencias o diseño de migraciones
RAG de documentos largos — libros enteros, transcripciones de clientes de varios años o historiales de chat de un año caben en un solo prompt
Programación — la cifra reclamada por el proveedor en HumanEval+ de 75,6% y la postura agéntica lo convierten en candidato para cargas de trabajo SWE autónomas (combínalo con SWE-agent / OpenHands)
Bloc de notas de investigación — el contexto de 1M tolera el tipo de uso de "pega el artículo completo, pega el trabajo previo, pide una síntesis" que los modelos más pequeños truncarían
Pruebas comparativas
Reclamados por el proveedor — aún no hay reproducción de terceros. Todas las cifras siguientes provienen del anuncio de Xiaomi del 27 de abril de 2026 y de la tarjeta del modelo en HuggingFace. El modelo tiene dos días al momento de escribir esto — las reproducciones independientes en benchmarks agénticos y de contexto largo siguen pendientes. En particular, la afirmación de que "supera a DeepSeek V4 en tareas agénticas" procede del propio texto de Xiaomi; tómala como marketing hasta que se reproduzca.
GSM8K
99.6%
Problemas de texto de matemáticas
HumanEval+
75.6%
Programación (ampliada)
MMLU
89.4%
Conocimiento general
GraphWalks (1M ctx) BFS
0.37
Recorrido de grafos de contexto largo
GraphWalks (1M ctx) Parents
0.62
Recorrido de grafos de contexto largo
Tareas agénticas vs DeepSeek V4
"supera" (proveedor)
Sin verificar — reproducción de terceros pendiente
Solución de problemas
OutOfMemoryError al cargar
FP8 nativo aún necesita ~600GB+ de VRAM. Usa 8× H200 o reduce --context-length a 65536 en 8× H100.
Descarga lenta de HuggingFace
huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download. Espera ~600GB en FP8.
--trust-remote-code rechazado
La atención híbrida y MTP se entregan como código personalizado en el repositorio. La bandera es obligatoria para vLLM y SGLang.
La mejora de velocidad MTP no aparece en SGLang
Confirma SGLANG_ENABLE_SPEC_V2=1 que está exportado en la misma shell que python3 -m sglang.launch_server. La ruta predeterminada no activa MTP.
Traza de razonamiento plana / de baja calidad
Usa temperature=1.0 y top_p=0.95. Las temperaturas más bajas degradan el comportamiento de razonamiento de MiMo.
OOM en el contexto de 1M en 8× H100
8× H100 80GB no puede alojar la caché KV para 1M tokens. Limita a 256K o cambia a 8× H200.
El prellenado tarda minutos
Se espera en contexto de 1M. Usa --enable-chunked-prefill (vLLM) o agrupa solicitudes más cortas para cargas interactivas.
Falla la descarga GGUF / Ollama
Los quants comunitarios no están publicados a 28 de abril de 2026. Espera 1–2 semanas o usa FP8 directamente.
Siguientes pasos
Predecesor / modelo hermano: MiMo-V2-Flash — 309B MoE, 15B activos, 32K ctx, más rápido pero más pequeño
Rival reclamado por el proveedor: DeepSeek V4 — 1M ctx, multimodal, ~1T params (el modelo que Xiaomi dice haber superado en tareas agénticas)
Rival de código de pesos abiertos: GLM-5.1 — 744B MoE, 40B activos, MIT, actualmente #1 en SWE-Bench Pro
Capacidad H200: bare metal bajo pedido — el mejor ajuste para un MoE de 1T FP8 completo con contexto de 1M
Marketplace de Clore.ai: clore.ai/marketplace
Enlaces
Última actualización
¿Te fue útil?