GLM-5.1 (744B MoE, #1 en SWE-Bench Pro)
Despliega GLM-5.1 (744B MoE, 40B activos) de Z.ai en Clore.ai: el modelo de pesos abiertos que encabezó SWE-Bench Pro en abril de 2026
GLM-5.1 es un modelo Mixture-of-Experts de 744 mil millones de parámetros modelo de lenguaje que activa solo ~40 mil millones de parámetros por token. En comparación con su predecesor GLM-5, la versión 5.1 mantiene la misma estructura MoE, pero incluye un enrutamiento de expertos más refinado, una ventana de contexto de 200K tokens, un salida máxima de 131K tokens, y un entrenamiento centrado en programación agéntica de largo horizonte — el modelo está ajustado explícitamente para sostener miles de llamadas a herramientas y cientos de rondas de refactorización sin desviarse.
Para los usuarios de Clore.ai, lo interesante es el 40B activos número: no necesitas un rack completo de 8×H200 para servirlo. Una configuración de paralelismo tensorial entre 2×H100 80GB (FP8) o 4×A100 80GB (BF16 con sharding) es suficiente para un rendimiento práctico — poniendo la programación de vanguardia al alcance en bare metal en el mercado.
Especificaciones clave
Parámetros totales
744B (MoE)
Parámetros activos
~40B por pasada hacia adelante
Ventana de contexto
200,000 tokens
Salida máxima
131,072 tokens
Licencia
MIT
Fecha de lanzamiento
7 de abril de 2026
Organización
Z.ai (zai-org en HuggingFace)
Herramientas principales
vLLM, SGLang, llama.cpp (GGUF), xLLM, KTransformers
¿Por qué GLM-5.1?
#1 en SWE-Bench Pro — 58.4% según el proveedor, por delante de GPT-5.4 y Claude Opus 4.6
Agentes de largo horizonte — mantiene la optimización a lo largo de cientos de rondas y miles de llamadas a herramientas
Contexto de 200K — suficiente para una base de código completa de tamaño mediano más su suite de pruebas
MoE activo de 40B — pagas el costo de inferencia de un modelo denso de 40B, no de uno de 744B
licencia MIT — pesos totalmente abiertos, sin restricciones para uso comercial o ajuste fino
Pila de entrenamiento abierta — Z.ai publicó el modelo, al parecer entrenado sin GPUs de centro de datos de Nvidia
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Sigue siendo un modelo grande. Aunque "40B activos" suena amable, los pesos completos de 744B deben cargarse en VRAM (o descargarse). Los pesos FP8 son ~860 GB; BF16 es ~1,5 TB. Planifica en consecuencia.
VRAM de GPU
~80 GB (Q4 + descarga a RAM)
2× H100 80GB activos, 8× en total
8× H200 141GB
RAM
256GB
256GB
512GB
Disco
500 GB NVMe
1TB NVMe
2TB NVMe
CUDA
12.8+
12.8+
12.8+
Elección de Clore.ai: Para la mayoría de los equipos, 2× H100 de 80 GB ejecutando el checkpoint FP8 con descarga agresiva es el punto ideal (~$2.08/h). Si necesitas el rendimiento completo de BF16, pasa a 8× H200 o usa la API de Z.ai para llamadas ocasionales.
Opción A — Ollama / GGUF (Cuantizado, compilaciones de la comunidad)
Aviso: Las cuantizaciones GGUF de la comunidad suelen aparecer 1–2 semanas después de un lanzamiento de Z.ai. Si ollama pull falla, revisa huggingface.co/models?search=glm-5.1+gguf y apunta llama.cpp directamente al archivo.
Opción B — vLLM (API de producción, recomendado)
vLLM es el objetivo de servicio de primera clase de Z.ai. El checkpoint FP8 (zai-org/GLM-5.1-FP8) es el que quieres — misma calidad que BF16, aproximadamente la mitad de memoria.
Opción C — SGLang (alternativa, a menudo más rápida en Hopper)
La decodificación especulativa EAGLE de SGLang suele dar un aumento de rendimiento de 1,5–2× en completaciones largas de código.
Recomendaciones de GPU para Clore.ai
2× H100 80GB
160 GB
FP8 con descarga, ~15–25 tok/s
~$2.08/hr
8× H100 80GB
640 GB
FP8 completo, ~60+ tok/s
~$8.32/hr
Mejor opción: 2× H100 de 80 GB con el checkpoint FP8. Obtienes un rendimiento de programación de vanguardia por aproximadamente el precio de una suscripción a Claude Opus — y los pesos se quedan en tu máquina.
Casos de uso
Agentes SWE autónomos — GLM-5.1 está entrenado explícitamente para bucles largos de llamadas a herramientas; combínalo con algo como SWE-agent u OpenHands
Comprensión de bases de código — mete 100K+ tokens de Go/Rust/Python en el contexto y pide revisiones arquitectónicas
RAG de contexto largo — 200K de contexto maneja documentación completa del producto + tickets de soporte de una sola vez
Pipelines de refactorización — corrección sostenida a lo largo de cientos de ediciones de archivos
Orquestación agente-de-agentes — usa GLM-5.1 como planificador y modelos más pequeños (Qwen3.5-35B, GLM-4.7) como trabajadores
Pruebas comparativas
Afirmado por el proveedor — verifica de forma independiente. Las cifras siguientes provienen del anuncio de Z.ai del 7 de abril de 2026. Las reproducciones independientes en SWE-Bench Pro siguen llegando.
SWE-Bench Pro
58.4%
57.7%
57.3%
~52%
SWE-Bench Verified
~79%
~78%
~80%
77.8%
HumanEval
~94%
~95%
~94%
~93%
LiveCodeBench
~72%
~73%
~70%
~68%
Solución de problemas
OutOfMemoryError al cargar
El checkpoint FP8 necesita ~860 GB de VRAM total. Usa 8× H100/H200 o baja a GGUF Q4 con descarga a RAM.
Descarga lenta de HuggingFace
Usa huggingface-cli download zai-org/GLM-5.1-FP8 --local-dir ./weights --resume-download. Espera 800 GB+.
Llamadas a herramientas descartadas silenciosamente
Asegúrate de --tool-call-parser glm47 y --enable-auto-tool-choice están ambos configurados en vLLM.
Modo de pensamiento vacío
Requiere temperature=1.0 — el muestreo a temperatura cero rompe la traza de razonamiento.
vLLM rechaza la configuración
GLM-5.1 necesita vLLM ≥ 0.7.x (versión de abril de 2026). Usa pip install -U vllm --pre si estás en versiones anteriores.
OOMs de contexto de 200K
Empieza con --max-model-len 65536 y añade --enable-chunked-prefill; súbelo una vez que sea estable.
Siguientes pasos
Predecesor: GLM-5 — misma estructura MoE, algo menos centrado en programación
Alternativa más barata: Qwen3.5 — un modelo denso de 35B cabe en una sola RTX 4090
Alternativa de contexto masivo: DeepSeek V4 — 1M de contexto, multimodal, ~1T de parámetros
Mercado de Clore.ai: clore.ai/marketplace — alquila H100/H200/A100 en bare metal
Enlaces
Última actualización
¿Te fue útil?