> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-large3.md).

# Mistral Large 3 (675B MoE)

Ejecuta Mistral Large 3: un modelo frontier MoE de 675B con 41B parámetros activos en GPUs de Clore.ai

Mistral Large 3 es el modelo de pesos abiertos más potente de Mistral AI, lanzado en diciembre de 2025 bajo la **licencia Apache 2.0**. Es un modelo de Mezcla de Expertos (MoE) con 675B de parámetros totales pero solo 41B activos por token — ofreciendo un rendimiento de clase frontera con una fracción del cómputo de un modelo denso de 675B. Con soporte multimodal nativo (texto + imágenes), una ventana de contexto de 256K y capacidades agentivas líderes en su clase, compite directamente con GPT-4o y modelos de la clase Claude, a la vez que puede alojarse completamente en tus propios servidores.

**HuggingFace:** [mistralai/Mistral-Large-3-675B-Instruct-2512](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512) **Ollama:** [mistral-large-3:675b](https://ollama.com/library/mistral-large-3) **Licencia:** Apache 2.0

## Características clave

* **675B de parámetros totales / 41B activos** — la eficiencia de MoE significa que obtienes rendimiento de frontera sin activar todos los parámetros
* **licencia Apache 2.0** — totalmente abierto para uso comercial y personal, sin restricciones
* **Nativamente multimodal** — entiende tanto texto como imágenes mediante un codificador visual de 2.5B
* **ventana de contexto de 256K** — maneja documentos masivos, bases de código y conversaciones largas
* **Capacidades agentivas líderes en su clase** — llamadas a funciones nativas, modo JSON, uso de herramientas
* **Múltiples opciones de despliegue** — FP8 en H200/B200, NVFP4 en H100/A100, cuantizado en GGUF para GPUs de consumo

## Arquitectura del modelo

| Componente          | Detalles                          |
| ------------------- | --------------------------------- |
| Arquitectura        | Mezcla de expertos granular (MoE) |
| Parámetros totales  | 675B                              |
| Parámetros activos  | 41B (por token)                   |
| Codificador visual  | 2.5B de parámetros                |
| Ventana de contexto | 256K tokens                       |
| Entrenamiento       | 3.000× GPUs H200                  |
| Lanzamiento         | diciembre de 2025                 |

## Requisitos

{% hint style="warning" %}
**Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai.** Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo pedido. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

| Configuración | Presupuesto (GGUF de Q4) | Estándar (NVFP4) | Completo (FP8) |
| ------------- | ------------------------ | ---------------- | -------------- |
| GPU           | 4× RTX 4090              | 8× A100 80GB     | 8× H100/H200   |
| VRAM          | 4×24GB (96GB)            | 8×80GB (640GB)   | 8×80GB (640GB) |
| RAM           | 128 GB                   | 256GB            | 256GB          |
| Disco         | 400GB                    | 700GB            | 1.4TB          |
| CUDA          | 12.8+                    | 12.8+            | 12.8+          |

**Configuración recomendada de Clore.ai:**

* **Mejor opción:** 4× RTX 4090 ($0.56–1.68/h) — ejecuta cuantización GGUF Q4 mediante llama.cpp u Ollama
* **Calidad de producción:** 8× A100 80GB ([bare metal](https://clore.ai/bare-metal)) — NVFP4 con contexto completo mediante vLLM
* **Máximo rendimiento:** 8× H100 (\~$8.32/h) — FP8, contexto completo de 256K

## Inicio rápido con Ollama

La forma más rápida de ejecutar Mistral Large 3 en una instancia multigPU de Clore.ai:

```bash
# Instalar Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Ejecuta el modelo de 675B (requiere varias GPU, ~96GB+ de VRAM para Q4)
ollama run mistral-large-3:675b

# Para las variantes densas más pequeñas (una sola GPU):
ollama run mistral3:14b    # 14B denso — cabe en una RTX 3060+
ollama run mistral3:8b     # 8B denso — cabe en cualquier GPU
```

## Inicio rápido con vLLM (producción)

Para servir en producción con una API compatible con OpenAI:

```bash
# Instalar vLLM
pip install vllm

# Sirve con cuantización NVFP4 en 8× A100/H100
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4 \\
    --tensor-parallel-size 8 \
    --tokenizer-mode mistral \\
    --config-format mistral \\
    --load-format mistral \\
    --max-model-len 65536 \
    --gpu-memory-utilization 0.90 \\
    --enable-auto-tool-choice \\
    --tool-call-parser mistral \\
    --host 0.0.0.0 \\
    --port 8000

# Para FP8 (pesos originales, máxima calidad):
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512 \\
    --tensor-parallel-size 8 \
    --tokenizer-mode mistral \\
    --config-format mistral \\
    --load-format mistral \\
    --max-model-len 131072 \\
    --host 0.0.0.0 \\
    --port 8000
```

## Ejemplos de uso

### 1. Finalización de chat (API compatible con OpenAI)

Una vez que vLLM esté en ejecución, usa cualquier cliente compatible con OpenAI:

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="no necesario"
)

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[
        {"role": "system", "content": "Eres un asistente de programación útil."},
        {"role": "user", "content": "Escribe un raspador web asíncrono en Python usando aiohttp y BeautifulSoup."}
    ],
    temperature=0.1,
    max_tokens=4096
)

print(response.choices[0].message.content)
```

### 2. Llamada a funciones / uso de herramientas

Mistral Large 3 destaca en la llamada estructurada a herramientas:

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

tools = [
    {
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "Obtén el clima actual de una ubicación",
            "parameters": {
                "type": "object",
                "properties": {
                    "location": {"type": "string", "description": "Nombre de la ciudad"},
                    "unit": {"type": "string", "enum": ["celsius", "fahrenheit"]}
                },
                "required": ["location"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[{"role": "user", "content": "¿Qué clima hace en Tokio?"}],
    tools=tools,
    tool_choice="auto"
)

tool_call = response.choices[0].message.tool_calls[0]
print(f"Función: {tool_call.function.name}")
print(f"Argumentos: {tool_call.function.arguments}")
```

### 3. Visión — análisis de imágenes

Mistral Large 3 entiende imágenes de forma nativa:

```python
import base64
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

# Codifica la imagen
with open("diagram.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Describe este diagrama de arquitectura en detalle."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_b64}"}}
        ]
    }],
    max_tokens=2048
)

print(response.choices[0].message.content)
```

## Consejos para usuarios de Clore.ai

1. **Empieza con NVFP4 en A100** — El `Mistral-Large-3-675B-Instruct-2512-NVFP4` el checkpoint está diseñado específicamente para nodos A100/H100 y ofrece una calidad casi sin pérdidas con la mitad del consumo de memoria de FP8.
2. **Usa Ollama para experimentos rápidos** — Si tienes una instancia 4× RTX 4090, Ollama gestiona la cuantización GGUF automáticamente. Perfecto para probar antes de comprometerte con una configuración de producción con vLLM.
3. **Expón la API de forma segura** — Al ejecutar vLLM en una instancia de Clore.ai, usa túnel SSH (`ssh -L 8000:localhost:8000 root@<ip>`) en lugar de exponer directamente el puerto 8000.
4. **Reduce `max-model-len` para ahorrar VRAM** — Si no necesitas el contexto completo de 256K, establece `--max-model-len 32768` o `65536` para reducir significativamente el uso de memoria de la caché KV.
5. **Considera las alternativas densas** — Para configuraciones de una sola GPU, Mistral 3 14B (`mistral3:14b` en Ollama) ofrece un excelente rendimiento en una sola RTX 4090 y pertenece a la misma familia de modelos.

## Solución de problemas

| Problema                         | Solución                                                                                                                                       |
| -------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------- |
| `CUDA sin memoria` en vLLM       | Reduce `--max-model-len` (prueba 32768), aumenta `--tensor-parallel-size`, o usa el checkpoint NVFP4                                           |
| Velocidad de generación lenta    | Asegúrate de `--tensor-parallel-size` coincide con tu número de GPUs; habilita la decodificación especulativa con el checkpoint Eagle          |
| Ollama no puede cargar 675B      | Asegúrate de tener 96GB+ de VRAM en todas las GPUs; Ollama necesita `OLLAMA_NUM_PARALLEL=1` para modelos grandes                               |
| `tokenizer_mode mistral` errores | Debes pasar las tres banderas: `--tokenizer-mode mistral --config-format mistral --load-format mistral`                                        |
| La visión no funciona            | Asegúrate de que las imágenes estén cerca de una relación de aspecto 1:1; evita imágenes muy anchas o delgadas para obtener mejores resultados |
| La descarga es demasiado lenta   | Usa `huggingface-cli download mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4` con `HF_TOKEN` establece                                     |

## Lecturas adicionales

* [Blog de anuncio de Mistral 3](https://mistral.ai/news/mistral-3) — publicación oficial de lanzamiento con benchmarks
* [Tarjeta del modelo en HuggingFace](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512) — instrucciones de despliegue y resultados de benchmarks
* [Versión cuantizada en NVFP4](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4) — optimizada para A100/H100
* [Cuantizada en GGUF (Unsloth)](https://huggingface.co/unsloth/Mistral-Large-3-675B-Instruct-2512-GGUF) — para llama.cpp y Ollama
* [Documentación de vLLM](https://docs.vllm.ai/) — marco de servicio para producción
* [Guía Day-0 de Red Hat](https://developers.redhat.com/articles/2025/12/02/run-mistral-large-3-ministral-3-vllm-red-hat-ai) — despliegue de vLLM paso a paso


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-large3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
