> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mimo-v2-flash.md).

# MiMo-V2-Flash

Despliega MiMo-V2-Flash (309B MoE) con decodificación especulativa en Clore.ai: inferencia ultrarrápida con más de 150 tok/s

> MiMo-V2-Flash es un **Modelo Mixture-of-Experts de 309 mil millones de parámetros** modelo de lenguaje que activa 15 mil millones de parámetros por token. Construido con decodificación especulativa avanzada (EAGLE/MTP), ofrece **más de 150 tokens/segundo** en 8×H100, manteniendo un rendimiento de vanguardia. Publicado bajo **licencia MIT**, representa la vanguardia de la inferencia eficiente a gran escala.

## De un vistazo

* **Tamaño del modelo**: 309 mil millones en total / 15 mil millones de parámetros activos (MoE)
* **Licencia**: MIT (uso comercial total)
* **Contexto**: 32K tokens
* **Rendimiento**: Estado del arte en benchmarks de razonamiento
* **VRAM**: \~320 GB FP16 (mínimo 4×A100 80GB)
* **Velocidad**: más de 150 tok/s en 8×H100 con decodificación especulativa

## ¿Por qué MiMo-V2-Flash?

**Velocidad revolucionaria**: MiMo-V2-Flash logra velocidades de inferencia sin precedentes mediante EAGLE (Extrapolation Algorithm for Greater Language model Efficiency) y MTP (Multi-Token Prediction). Mientras los modelos tradicionales generan un token a la vez, MiMo-V2 predice y valida múltiples tokens en paralelo.

**Escala lista para producción**: Con 309 mil millones de parámetros, MiMo-V2-Flash compite con los modelos de vanguardia más grandes, al tiempo que sigue siendo desplegable en configuraciones de hardware realistas. Los 15 mil millones de parámetros activos garantizan una inferencia eficiente a pesar de la enorme cantidad de parámetros.

**Arquitectura avanzada**: Más allá del MoE estándar, MiMo-V2-Flash incorpora de forma nativa la decodificación especulativa en la arquitectura del modelo. Esto no es una optimización posterior al entrenamiento: está integrado en la base, lo que permite aceleraciones garantizadas.

**Calidad empresarial**: Licencia MIT sin restricciones de uso. Despliega a gran escala, ajusta finamente o integra en productos comerciales sin preocupaciones de licencia.

## Recomendaciones de GPU

{% hint style="warning" %}
**Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai.** Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo pedido. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

| Configuración   | VRAM   | Rendimiento          | Coste diario\* |
| --------------- | ------ | -------------------- | -------------- |
| **4×A100 80GB** | 320GB  | \~80 tok/s           | \~$16.00       |
| **8×A100 40GB** | 320GB  | \~70 tok/s           | \~$28.00       |
| **2×H100**      | 160GB  | \~90 tok/s           | \~$12.00       |
| **8×H100**      | 640GB  | **más de 150 tok/s** | \~$48.00       |
| 4×H200          | 564 GB | \~120 tok/s          | \~$32.00       |

**Mejor relación calidad-precio**: 4×A100 80GB ofrece un excelente rendimiento por dólar, disponible como [bare metal](https://clore.ai/bare-metal). En el marketplace, el equivalente es una configuración 4× RTX PRO 6000 Blackwell (380 GB). **Máximo rendimiento**: 8×H100 libera todo el potencial de la decodificación especulativa.

\*Precios estimados del marketplace de Clore.ai

## Desplegar con SGLang (recomendado)

SGLang ofrece el mejor soporte para las funciones de decodificación especulativa de MiMo-V2-Flash:

### Instalar SGLang

```bash
pip install "sglang[all]>=0.3.0"
# o la versión más reciente
pip install git+https://github.com/sgl-project/sglang.git
```

### Configuración de varias GPU con MTP

```bash
python -m sglang.launch_server \\
  --model-path mimo-ai/MiMo-V2-Flash \\
  --tp-size 8 \\
  --enable-mtp \\
  --mtp-max-draft-tokens 8 \\
  --mtp-acceptance-rate 0.8 \\
  --mem-fraction-static 0.85 \\
  --dtype float16 \
  --context-length 32768 \\
  --served-model-name mimo-v2-flash
```

### Consultar con la API de OpenAI

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:30000/v1", 
    api_key="EMPTY"
)

response = client.chat.completions.create(
    model="mimo-v2-flash",
    messages=[
        {"role": "system", "content": "Eres un investigador experto en IA."},
        {"role": "user", "content": "Explica el algoritmo de decodificación especulativa EAGLE y por qué permite una inferencia más rápida"}
    ],
    max_tokens=1024,
    temperature=0.7,
    stream=True  # Recomendado para la mejor latencia
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end='', flush=True)
```

## Despliega con vLLM

vLLM también admite MiMo-V2-Flash con decodificación especulativa:

```bash
pip install vllm>=0.6.0

vllm serve mimo-ai/MiMo-V2-Flash \\
  --tensor-parallel-size 8 \
  --speculative-model mimo-ai/MiMo-V2-Flash-Draft \\
  --speculative-max-model-len 32768 \\
  --speculative-draft-tensor-parallel-size 2 \\
  --use-v2-block-manager \\
  --dtype float16 \
  --served-model-name mimo-v2-flash \\
  --trust-remote-code
```

## Plantilla de Docker

```dockerfile
FROM nvidia/cuda:12.8.1-devel-ubuntu22.04

# Instalar dependencias
RUN apt-get update && \\
    apt-get install -y python3.10 python3-pip git && \\
    rm -rf /var/lib/apt/lists/*

# Instala SGLang con soporte para MTP
RUN pip install "sglang[all]>=0.3.0" transformers

# Configura las variables de entorno
ENV PYTHONUNBUFFERED=1
ENV CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7

# Descargar el modelo previamente (opcional, ahorra tiempo de inicio)
# RUN python3 -c "from transformers import AutoModel; AutoModel.from_pretrained('mimo-ai/MiMo-V2-Flash', trust_remote_code=True)"

EXPOSE 30000

CMD ["python", "-m", "sglang.launch_server", \\
     "--model-path", "mimo-ai/MiMo-V2-Flash", \\
     "--host", "0.0.0.0", \\
     "--port", "30000", \\
     "--tp-size", "8", \\
     "--enable-mtp", \\
     "--mtp-max-draft-tokens", "8", \\
     "--dtype", "float16"]
```

Ejecútalo con todas las GPU:

```bash
docker build -t mimo-v2-flash .
docker run --gpus all -p 30000:30000 \\
  --shm-size=64g \\
  --ulimit memlock=-1 \\
  --ulimit stack=67108864 \\
  mimo-v2-flash
```

## Configuración avanzada

### Optimización de la decodificación especulativa

Ajusta los parámetros especulativos según tu carga de trabajo:

```bash
# Para generación de código (mayor tasa de aceptación)
python -m sglang.launch_server \\
  --model-path mimo-ai/MiMo-V2-Flash \\
  --tp-size 8 \\
  --enable-mtp \\
  --mtp-max-draft-tokens 12 \\
  --mtp-acceptance-rate 0.9 \\
  --temperature 0.1

# Para escritura creativa (menor tasa de aceptación)
python -m sglang.launch_server \\
  --model-path mimo-ai/MiMo-V2-Flash \\
  --tp-size 8 \\
  --enable-mtp \\
  --mtp-max-draft-tokens 6 \\
  --mtp-acceptance-rate 0.7 \\
  --temperature 0.8
```

### Optimización de memoria

Para configuraciones con memoria limitada:

```bash
# Reduce el uso de memoria (más lento, pero cabe en 4×A100)
python -m sglang.launch_server \\
  --model-path mimo-ai/MiMo-V2-Flash \\
  --tp-size 4 \
  --mem-fraction-static 0.75 \\
  --context-length 16384 \\
  --dtype float16 \
  --disable-cuda-graph  # Ahorra VRAM
```

## Ejemplo de evaluación comparativa

Prueba la ventaja de velocidad de MiMo-V2-Flash:

```python
import time
from openai import OpenAI

client = OpenAI(base_url="http://localhost:30000/v1", api_key="EMPTY")

def benchmark_generation():
    start_time = time.time()
    
    response = client.chat.completions.create(
        model="mimo-v2-flash",
        messages=[
            {"role": "user", "content": "Escribe una explicación detallada de la computación cuántica en exactamente 500 palabras"}
        ],
        max_tokens=600,
        temperature=0.1,
        stream=False
    )
    
    end_time = time.time()
    content = response.choices[0].message.content
    
    tokens = len(content.split())  # Estimación aproximada de tokens
    duration = end_time - start_time
    tokens_per_second = tokens / duration
    
    print(f"Se generaron {tokens} tokens en {duration:.2f}s")
    print(f"Velocidad: {tokens_per_second:.1f} tokens/segundo")
    
    return tokens_per_second

# Ejecuta la evaluación
speed = benchmark_generation()
print(f"\nMiMo-V2-Flash alcanzó {speed:.1f} tok/s")
```

## Consejos para usuarios de Clore.ai

* **Esencial usar varias GPU**: MiMo-V2-Flash requiere un mínimo de 4×A100 80GB. El despliegue en una sola GPU no es viable.
* **Ventaja de NVLink**: Elige hosts de Clore.ai con NVLink entre las GPU para una comunicación óptima entre varias GPU.
* **Requisitos de RAM**: Asegúrate de contar con más de 256 GB de RAM del sistema para un funcionamiento fluido con 8 GPU.
* **Ajuste especulativo**: Ajusta `mtp-max-draft-tokens` según tu caso de uso — más alto para tareas repetitivas, más bajo para trabajo creativo.
* **Longitud del contexto**: Un contexto de 32K es óptimo. Los contextos más largos reducen la eficacia de la decodificación especulativa.

## Solución de problemas

| Problema                                     | Solución                                                                                      |
| -------------------------------------------- | --------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` al iniciar                | Reduce `mem-fraction-static` o `tp-size`                                                      |
| Comunicación lenta entre GPU                 | Verifica NVLink: `nvidia-ml-py3` o `nvidia-smi topo -m`                                       |
| MTP no acelera                               | Consulta `mtp-acceptance-rate` — los valores demasiado altos deshabilitan la especulación     |
| Tiempo de espera agotado al cargar el modelo | Descarga previa: `huggingface-cli download mimo-ai/MiMo-V2-Flash`                             |
| Baja aceptación de tokens                    | Verifica la configuración de temperatura — temperaturas muy bajas/altas reducen la aceptación |

## Comparación de rendimiento

| Modelo            | Tamaño   | Velocidad (8×H100)   | Calidad |
| ----------------- | -------- | -------------------- | ------- |
| GPT-4 Turbo       | \~1.7T   | \~15-25 tok/s        | ★★★★★   |
| Claude Sonnet 3.5 | \~200B   | \~25-35 tok/s        | ★★★★★   |
| **MiMo-V2-Flash** | **309B** | **más de 150 tok/s** | ★★★★☆   |
| Llama 3.1 405B    | 405B     | \~30-45 tok/s        | ★★★★☆   |

MiMo-V2-Flash logra una aceleración de 3 a 5 veces frente a modelos comparables, manteniendo una calidad competitiva.

## Recursos

* [MiMo-V2-Flash en Hugging Face](https://huggingface.co/mimo-ai/MiMo-V2-Flash)
* [Artículo de EAGLE](https://arxiv.org/abs/2401.15077)
* [Documentación de SGLang](https://sgl-project.github.io/start/install.html)
* [Predicción de múltiples tokens](https://arxiv.org/abs/2404.19737)
* [Guía de decodificación especulativa](https://huggingface.co/blog/assisted-generation)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mimo-v2-flash.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
