Mistral Large 3 (675B MoE)
Ejecuta Mistral Large 3: un modelo frontier MoE de 675B con 41B parámetros activos en GPUs de Clore.ai
Mistral Large 3 es el modelo de pesos abiertos más potente de Mistral AI, lanzado en diciembre de 2025 bajo la licencia Apache 2.0. Es un modelo de Mezcla de Expertos (MoE) con 675B de parámetros totales pero solo 41B activos por token — ofreciendo un rendimiento de clase frontera con una fracción del cómputo de un modelo denso de 675B. Con soporte multimodal nativo (texto + imágenes), una ventana de contexto de 256K y capacidades agentivas líderes en su clase, compite directamente con GPT-4o y modelos de la clase Claude, a la vez que puede alojarse completamente en tus propios servidores.
HuggingFace: mistralai/Mistral-Large-3-675B-Instruct-2512 Ollama: mistral-large-3:675b Licencia: Apache 2.0
Características clave
675B de parámetros totales / 41B activos — la eficiencia de MoE significa que obtienes rendimiento de frontera sin activar todos los parámetros
licencia Apache 2.0 — totalmente abierto para uso comercial y personal, sin restricciones
Nativamente multimodal — entiende tanto texto como imágenes mediante un codificador visual de 2.5B
ventana de contexto de 256K — maneja documentos masivos, bases de código y conversaciones largas
Capacidades agentivas líderes en su clase — llamadas a funciones nativas, modo JSON, uso de herramientas
Múltiples opciones de despliegue — FP8 en H200/B200, NVFP4 en H100/A100, cuantizado en GGUF para GPUs de consumo
Arquitectura del modelo
Arquitectura
Mezcla de expertos granular (MoE)
Parámetros totales
675B
Parámetros activos
41B (por token)
Codificador visual
2.5B de parámetros
Ventana de contexto
256K tokens
Entrenamiento
3.000× GPUs H200
Lanzamiento
diciembre de 2025
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
GPU
4× RTX 4090
8× A100 80GB
8× H100/H200
VRAM
4×24GB (96GB)
8×80GB (640GB)
8×80GB (640GB)
RAM
128 GB
256GB
256GB
Disco
400GB
700GB
1.4TB
CUDA
12.8+
12.8+
12.8+
Configuración recomendada de Clore.ai:
Mejor opción: 4× RTX 4090 ($0.56–1.68/h) — ejecuta cuantización GGUF Q4 mediante llama.cpp u Ollama
Calidad de producción: 8× A100 80GB (bare metal) — NVFP4 con contexto completo mediante vLLM
Máximo rendimiento: 8× H100 (~$8.32/h) — FP8, contexto completo de 256K
Inicio rápido con Ollama
La forma más rápida de ejecutar Mistral Large 3 en una instancia multigPU de Clore.ai:
Inicio rápido con vLLM (producción)
Para servir en producción con una API compatible con OpenAI:
Ejemplos de uso
1. Finalización de chat (API compatible con OpenAI)
Una vez que vLLM esté en ejecución, usa cualquier cliente compatible con OpenAI:
2. Llamada a funciones / uso de herramientas
Mistral Large 3 destaca en la llamada estructurada a herramientas:
3. Visión — análisis de imágenes
Mistral Large 3 entiende imágenes de forma nativa:
Consejos para usuarios de Clore.ai
Empieza con NVFP4 en A100 — El
Mistral-Large-3-675B-Instruct-2512-NVFP4el checkpoint está diseñado específicamente para nodos A100/H100 y ofrece una calidad casi sin pérdidas con la mitad del consumo de memoria de FP8.Usa Ollama para experimentos rápidos — Si tienes una instancia 4× RTX 4090, Ollama gestiona la cuantización GGUF automáticamente. Perfecto para probar antes de comprometerte con una configuración de producción con vLLM.
Expón la API de forma segura — Al ejecutar vLLM en una instancia de Clore.ai, usa túnel SSH (
ssh -L 8000:localhost:8000 root@<ip>) en lugar de exponer directamente el puerto 8000.Reduce
max-model-lenpara ahorrar VRAM — Si no necesitas el contexto completo de 256K, establece--max-model-len 32768o65536para reducir significativamente el uso de memoria de la caché KV.Considera las alternativas densas — Para configuraciones de una sola GPU, Mistral 3 14B (
mistral3:14ben Ollama) ofrece un excelente rendimiento en una sola RTX 4090 y pertenece a la misma familia de modelos.
Solución de problemas
CUDA sin memoria en vLLM
Reduce --max-model-len (prueba 32768), aumenta --tensor-parallel-size, o usa el checkpoint NVFP4
Velocidad de generación lenta
Asegúrate de --tensor-parallel-size coincide con tu número de GPUs; habilita la decodificación especulativa con el checkpoint Eagle
Ollama no puede cargar 675B
Asegúrate de tener 96GB+ de VRAM en todas las GPUs; Ollama necesita OLLAMA_NUM_PARALLEL=1 para modelos grandes
tokenizer_mode mistral errores
Debes pasar las tres banderas: --tokenizer-mode mistral --config-format mistral --load-format mistral
La visión no funciona
Asegúrate de que las imágenes estén cerca de una relación de aspecto 1:1; evita imágenes muy anchas o delgadas para obtener mejores resultados
La descarga es demasiado lenta
Usa huggingface-cli download mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4 con HF_TOKEN establece
Lecturas adicionales
Blog de anuncio de Mistral 3 — publicación oficial de lanzamiento con benchmarks
Tarjeta del modelo en HuggingFace — instrucciones de despliegue y resultados de benchmarks
Versión cuantizada en NVFP4 — optimizada para A100/H100
Cuantizada en GGUF (Unsloth) — para llama.cpp y Ollama
Documentación de vLLM — marco de servicio para producción
Guía Day-0 de Red Hat — despliegue de vLLM paso a paso
Última actualización
¿Te fue útil?