Llama 4 (Scout y Maverick)
Ejecuta los modelos MoE Meta Llama 4 Scout y Maverick en GPUs de Clore.ai
Llama 4 de Meta, lanzado en abril de 2025, marca un cambio fundamental hacia Mezcla de expertos (MoE) arquitectura. En lugar de activar todos los parámetros para cada token, Llama 4 dirige cada token a subredes especializadas "expertas" — ofreciendo rendimiento de vanguardia a una fracción del costo de cómputo. Hay dos modelos de pesos abiertos disponibles: Scout (ideal para una sola GPU) y Maverick (potente para varias GPU).
Características clave
Arquitectura MoE: Solo 17B parámetros activos por token (de un total de 109B/400B)
Ventanas de contexto masivas: Scout admite 10M tokens, Maverick admite 1M tokens
Multimodal de forma nativa: Entiende tanto texto como imágenes desde el primer momento
Dos modelos: Scout (16 expertos, compatible con una sola GPU) y Maverick (128 expertos, multi-GPU)
Rendimiento competitivo: Scout iguala a Gemma 3 27B; Maverick compite con modelos de la clase GPT-4o
Pesos abiertos: Licencia comunitaria de Llama (gratuita para la mayoría de usos comerciales)
Variantes del modelo
Scout
109B
17B
16
10M
12GB
80 GB
Maverick
400B
17B
128
1M
48GB (multi)
320GB (multi)
Requisitos
GPU
1× RTX 4090
1× H100
4× RTX 4090
VRAM
24GB
80 GB
4×24GB
RAM
32GB
64GB
128GB
Disco
50GB
120GB
250GB
CUDA
12.8+
12.8+
12.8+
GPU recomendada de Clore.ai: RTX 4090 de 24GB ($0.14–0.42/h) para Scout — la mejor relación calidad-precio
Inicio rápido con Ollama
La forma más rápida de poner en marcha Llama 4:
Ollama como servidor de API
Configuración de vLLM (producción)
Para cargas de trabajo de producción con mayor rendimiento:
Consultar el servidor vLLM
Transformers de HuggingFace
Inicio rápido con Docker
Por qué MoE es importante en Clore.ai
Los modelos densos tradicionales (como Llama 3.3 70B) necesitan una VRAM enorme porque los 70B parámetros están activos. Llama 4 Scout tiene 109B en total pero solo activa 17B por token, lo que significa:
La misma calidad que los modelos densos de 70B+ a una fracción del costo de VRAM
Cabe en una sola RTX 4090 en modo cuantizado
contexto de 10M tokens — procesa bases de código completas, documentos largos, libros
Más barato de alquilar — una RTX 4090 a $0.14–0.42/h en lugar de un equipo multi-GPU para modelos de 70B
Consejos para usuarios de Clore.ai
Empieza con Scout Q4: La mejor relación calidad-precio en RTX 4090 — $0.14–0.42/h, cubre el 95% de los casos de uso
Usa
--max-model-lencon prudencia: No configures el contexto más alto de lo que necesitas — reserva VRAM. Empieza en 8192 y aumenta según sea necesarioParalelismo tensorial para Maverick: Alquila máquinas con 4× RTX 4090 para Maverick; usa
--tensor-parallel-size 4Se requiere iniciar sesión en HuggingFace:
huggingface-cli login— primero debes aceptar la licencia de Llama en HFOllama para pruebas rápidas, vLLM para producción: Ollama es más rápido de configurar; vLLM ofrece mayor rendimiento para servir APIs
Monitorea la memoria de la GPU:
observa nvidia-smi— los modelos MoE pueden disparar la VRAM en secuencias largas
Solución de problemas
OutOfMemoryError
Reduce --max-model-len, usa cuantización Q4 o actualiza la GPU
La descarga del modelo falla
Ejecuta huggingface-cli login y acepta la licencia de Llama 4 en hf.co
Generación lenta
Asegúrate de que se esté usando la GPU (nvidia-smi); verifica --gpu-memory-utilization
vLLM falla al iniciarse
Reduce la longitud del contexto; asegúrate de tener instalado CUDA 11.8+
Ollama muestra el modelo incorrecto
Ejecuta ollama list para verificar; ollama rm + ollama pull para volver a descargar
Lecturas adicionales
Última actualización
¿Te fue útil?