For the complete documentation index, see llms.txt. This page is also available as Markdown.

Llama 4 (Scout y Maverick)

Ejecuta los modelos MoE Meta Llama 4 Scout y Maverick en GPUs de Clore.ai

Llama 4 de Meta, lanzado en abril de 2025, marca un cambio fundamental hacia Mezcla de expertos (MoE) arquitectura. En lugar de activar todos los parámetros para cada token, Llama 4 dirige cada token a subredes especializadas "expertas" — ofreciendo rendimiento de vanguardia a una fracción del costo de cómputo. Hay dos modelos de pesos abiertos disponibles: Scout (ideal para una sola GPU) y Maverick (potente para varias GPU).

Características clave

  • Arquitectura MoE: Solo 17B parámetros activos por token (de un total de 109B/400B)

  • Ventanas de contexto masivas: Scout admite 10M tokens, Maverick admite 1M tokens

  • Multimodal de forma nativa: Entiende tanto texto como imágenes desde el primer momento

  • Dos modelos: Scout (16 expertos, compatible con una sola GPU) y Maverick (128 expertos, multi-GPU)

  • Rendimiento competitivo: Scout iguala a Gemma 3 27B; Maverick compite con modelos de la clase GPT-4o

  • Pesos abiertos: Licencia comunitaria de Llama (gratuita para la mayoría de usos comerciales)

Variantes del modelo

Modelo
Parámetros totales
Parámetros activos
Expertos
Contexto
VRAM mínima (Q4)
VRAM mínima (FP16)

Scout

109B

17B

16

10M

12GB

80 GB

Maverick

400B

17B

128

1M

48GB (multi)

320GB (multi)

Requisitos

Componente
Scout (Q4)
Scout (FP16)
Maverick (Q4)

GPU

1× RTX 4090

1× H100

4× RTX 4090

VRAM

24GB

80 GB

4×24GB

RAM

32GB

64GB

128GB

Disco

50GB

120GB

250GB

CUDA

12.8+

12.8+

12.8+

GPU recomendada de Clore.ai: RTX 4090 de 24GB ($0.14–0.42/h) para Scout — la mejor relación calidad-precio

Inicio rápido con Ollama

La forma más rápida de poner en marcha Llama 4:

Ollama como servidor de API

Configuración de vLLM (producción)

Para cargas de trabajo de producción con mayor rendimiento:

Consultar el servidor vLLM

Transformers de HuggingFace

Inicio rápido con Docker

Por qué MoE es importante en Clore.ai

Los modelos densos tradicionales (como Llama 3.3 70B) necesitan una VRAM enorme porque los 70B parámetros están activos. Llama 4 Scout tiene 109B en total pero solo activa 17B por token, lo que significa:

  • La misma calidad que los modelos densos de 70B+ a una fracción del costo de VRAM

  • Cabe en una sola RTX 4090 en modo cuantizado

  • contexto de 10M tokens — procesa bases de código completas, documentos largos, libros

  • Más barato de alquilar — una RTX 4090 a $0.14–0.42/h en lugar de un equipo multi-GPU para modelos de 70B

Consejos para usuarios de Clore.ai

  • Empieza con Scout Q4: La mejor relación calidad-precio en RTX 4090 — $0.14–0.42/h, cubre el 95% de los casos de uso

  • Usa --max-model-len con prudencia: No configures el contexto más alto de lo que necesitas — reserva VRAM. Empieza en 8192 y aumenta según sea necesario

  • Paralelismo tensorial para Maverick: Alquila máquinas con 4× RTX 4090 para Maverick; usa --tensor-parallel-size 4

  • Se requiere iniciar sesión en HuggingFace: huggingface-cli login — primero debes aceptar la licencia de Llama en HF

  • Ollama para pruebas rápidas, vLLM para producción: Ollama es más rápido de configurar; vLLM ofrece mayor rendimiento para servir APIs

  • Monitorea la memoria de la GPU: observa nvidia-smi — los modelos MoE pueden disparar la VRAM en secuencias largas

Solución de problemas

Problema
Solución

OutOfMemoryError

Reduce --max-model-len, usa cuantización Q4 o actualiza la GPU

La descarga del modelo falla

Ejecuta huggingface-cli login y acepta la licencia de Llama 4 en hf.co

Generación lenta

Asegúrate de que se esté usando la GPU (nvidia-smi); verifica --gpu-memory-utilization

vLLM falla al iniciarse

Reduce la longitud del contexto; asegúrate de tener instalado CUDA 11.8+

Ollama muestra el modelo incorrecto

Ejecuta ollama list para verificar; ollama rm + ollama pull para volver a descargar

Lecturas adicionales

Última actualización

¿Te fue útil?