> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-small4.md).

# Mistral Small 4 (119B MoE, 6.5B activo)

Despliega Mistral Small 4 (119B MoE, 6.5B activo) en dos GPUs de consumo del marketplace de Clore.ai: Apache 2.0, contexto de 256K, visión y razonamiento en un solo modelo

{% hint style="info" %}
**Estado (agosto de 2026):** Mistral lanzó **Small 4** el **16 de marzo de 2026** bajo **Apache 2.0**. Pesos: [mistralai/Mistral-Small-4-119B-2603](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603). **119B de parámetros totales con solo 6.5B activos** (128 expertos, 4 activos por token), **contexto de 256K**, nativa **visión**, y un interruptor de razonamiento por solicitud. Integra las tres líneas anteriores de Mistral — Instruct, razonamiento Magistral y codificación Devstral — en un solo punto de control.
{% endhint %}

"Small" es un nombre incorrecto por recuento de parámetros y totalmente acertado por coste. Solo **6.5B de parámetros se activan por token**, así que la velocidad de decodificación se siente como la de un modelo de 7B mientras que la calidad proviene de un conjunto de 119B. Cuantizado a Q2 es **40 GB** — dos RTX 4090, para las que el marketplace de Clore.ai tiene capacidad libre equivalente a 322 servidores. En Q3–Q4 ocupa 54–59GB, cómodo en dos RTX 5090.

Si quieres un único modelo abierto que responda al instante a prompts sencillos, piense más a fondo cuando se le indique, lea imágenes y escriba código, este es actualmente el mejor ajuste para hardware que realmente puedes alquilar por minuto.

### Especificaciones clave

| Propiedad                | Valor                                                                              |
| ------------------------ | ---------------------------------------------------------------------------------- |
| Parámetros               | 119B en total, 6.5B activos (128 expertos, 4 activos)                              |
| Modalidad                | Texto + imagen de entrada → texto de salida                                        |
| Contexto                 | 262,144 tokens (256K)                                                              |
| Licencia                 | Apache 2.0                                                                         |
| Fecha de lanzamiento     | 16 de marzo de 2026                                                                |
| Pesos                    | Oficial \~242GB · Q3\_K\_M GGUF 54GB · Q2\_K\_XL GGUF 40GB                         |
| Razonamiento             | `reasoning_effort`: `ninguna` (instantáneo) o `alto` (cómputo en tiempo de prueba) |
| Herramientas principales | vLLM, llama.cpp, Transformers                                                      |

***

## Requisitos

| Compilación              | Tamaño  | Configuración de Clore.ai                                       |
| ------------------------ | ------- | --------------------------------------------------------------- |
| `UD-IQ1_M`               | 32GB    | 1× RTX PRO 6000 96GB, o 2× RTX 4090                             |
| `UD-Q2_K_XL`             | 40 GB   | **2× RTX 4090 / 3090 (48GB)** — 322 servidores libres con ≥48GB |
| `UD-Q3_K_M`              | 54GB    | 2× RTX 5090 (64GB)                                              |
| `UD-IQ4_NL`              | 59GB    | 2× RTX 5090 (64GB)                                              |
| Punto de control oficial | \~242GB | 8× RTX 5090 (248GB)                                             |

Añade margen para la caché KV: con un contexto de 256K es considerable incluso con un MoE tan disperso. Empieza en 32–64K y súbelo una vez que veas el uso real.

***

## Despliega con llama.cpp (dos tarjetas de consumo)

```bash
huggingface-cli download unsloth/Mistral-Small-4-119B-2603-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/ms4

llama-server -m /workspace/ms4/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 65536 --flash-attn
```

## Despliega con vLLM

```bash
vllm serve mistralai/Mistral-Small-4-119B-2603 \\
  --tensor-parallel-size 8 \
  --tokenizer-mode mistral \\
  --config-format mistral \\
  --load-format mistral \\
  --max-model-len 262144 \\
  --enable-expert-parallel
```

Una compilación oficial NVFP4 ([`mistralai/Mistral-Small-4-119B-2603-NVFP4`](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603-NVFP4)) apunta a tarjetas Blackwell — útil en equipos RTX serie 50 y RTX PRO 6000.

## Razonamiento bajo demanda

```python
client.chat.completions.create(
    model="mistral-small-4",
    messages=[{"role": "user", "content": "Find the deadlock in this scheduler."}],
    extra_body={"reasoning_effort": "high"},   # "none" para respuestas instantáneas
    temperature=0.7,                            # 0.0–0.7 cuando el razonamiento está desactivado
)
```

Mistral recomienda temperature 0.7 con el razonamiento activado. Con el razonamiento desactivado, mantente entre 0.0 y 0.7 según lo determinista que necesites la salida.

***

## Recomendaciones de GPU para Clore.ai

| Configuración   | VRAM  | Compilación                | Contexto      | Coste en Clore.ai |
| --------------- | ----- | -------------------------- | ------------- | ----------------- |
| **2× RTX 4090** | 48GB  | Q2\_K\_XL                  | \~64K         | **$0.28–0.84/h**  |
| 2× RTX 3090     | 48GB  | Q2\_K\_XL                  | \~64K         | $0.14–0.42/h      |
| **2× RTX 5090** | 64GB  | Q3\_K\_M / IQ4\_NL         | \~96K         | **$0.50–1.54/h**  |
| 1× RTX PRO 6000 | 96GB  | Q3\_K\_M, una sola tarjeta | \~131K        | $0.92–1.38/h      |
| 8× RTX 5090     | 248GB | punto de control oficial   | 256K completo | \~$2.00–3.50/h    |

{% hint style="success" %}
**Un par de RTX 3090 es la opción con mejor relación calidad-precio** — 48GB de VRAM por alrededor de $0.14–0.42/h en total, ejecutando un modelo de 119B. Usa [alquiler parcial de GPU](/guides/guides_v2-es/primeros-pasos/partial-gpu-rental.md) para sacar dos tarjetas de un equipo más grande en lugar de buscar una caja dedicada de doble 3090.
{% endhint %}

***

## Casos de uso

* **Un modelo para todo un producto** — chat, programación y razonamiento sin tres implementaciones
* **Extracción de documentos e imágenes** — la visión más un contexto de 256K manejan documentos escaneados largos
* **Agentes de codificación con presupuesto limitado** — el linaje de Devstral, con 6.5B de parámetros activos por token
* **Servicio por niveles de latencia** — `reasoning_effort: none` para la ruta rápida, `alto` para la ruta difícil, mismo endpoint
* **Productos comerciales** — Apache 2.0, sin cláusula de ingresos, sin restricción regional

***

## Solución de problemas

| Problema                         | Solución                                                                                                                            |
| -------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------- |
| Errores del tokenizador de vLLM  | Los modelos de Mistral necesitan `--tokenizer-mode mistral --config-format mistral --load-format mistral`                           |
| OOM a 256K                       | La caché KV, no los pesos — reduce `--max-model-len`                                                                                |
| El razonamiento nunca se activa  | `reasoning_effort` es por solicitud; comprueba que tu cliente reenvíe `extra_body`                                                  |
| Primer token lento en 2 tarjetas | Dividir GGUF por capas a través de PCIe añade latencia; prefiere equipos con enlaces x8/x16                                         |
| La compilación NVFP4 no carga    | Necesita Blackwell — consulta [Compatibilidad de CUDA y PyTorch](/guides/guides_v2-es/primeros-pasos/cuda-pytorch-compatibility.md) |

***

## Siguientes pasos

* **Hermano menor:** [Mistral Small 3.1](/guides/guides_v2-es/modelos-de-lenguaje/mistral-small.md) — 24B denso, una sola tarjeta
* **Hermano mayor:** [Mistral Large 3](/guides/guides_v2-es/modelos-de-lenguaje/mistral-large3.md) — 675B MoE
* **Alternativa densa:** [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md) — 27B, una sola tarjeta, Apache 2.0
* **Ajusta fine-tuning:** [Unsloth](/guides/guides_v2-es/entrenamiento/unsloth-finetune.md) · [LLaMA-Factory](/guides/guides_v2-es/entrenamiento/llama-factory.md)

### Enlaces

* [Mistral Small 4 en Hugging Face](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603) · [GGUF](https://huggingface.co/unsloth/Mistral-Small-4-119B-2603-GGUF)
* [Anuncio de Mistral](https://mistral.ai/news/mistral-small-4/)
* **Alquila una GPU:** [RTX 4090](https://clore.ai/rent-4090.html) · [RTX 5090](https://clore.ai/rent-5090.html) · [Marketplace](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-small4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
