For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.1 (744B MoE, #1 en SWE-Bench Pro)

Despliega GLM-5.1 (744B MoE, 40B activos) de Z.ai en Clore.ai: el modelo de pesos abiertos que encabezó SWE-Bench Pro en abril de 2026

Estado (abril de 2026): GLM-5.1 se lanzó el 7 de abril de 2026 por Z.ai (antes Zhipu AI) como una actualización incremental pero seria de GLM-5. Es el primer modelo de pesos abiertos en encabezar SWE-Bench Pro (58.4%), superando por poco a GPT-5.4 (57.7) y Claude Opus 4.6 (57.3), según las cifras publicadas por el proveedor. Los pesos están en huggingface.co/zai-org/GLM-5.1 bajo la licencia MIT.

GLM-5.1 es un modelo Mixture-of-Experts de 744 mil millones de parámetros modelo de lenguaje que activa solo ~40 mil millones de parámetros por token. En comparación con su predecesor GLM-5, la versión 5.1 mantiene la misma estructura MoE, pero incluye un enrutamiento de expertos más refinado, una ventana de contexto de 200K tokens, un salida máxima de 131K tokens, y un entrenamiento centrado en programación agéntica de largo horizonte — el modelo está ajustado explícitamente para sostener miles de llamadas a herramientas y cientos de rondas de refactorización sin desviarse.

Para los usuarios de Clore.ai, lo interesante es el 40B activos número: no necesitas un rack completo de 8×H200 para servirlo. Una configuración de paralelismo tensorial entre 2×H100 80GB (FP8) o 4×A100 80GB (BF16 con sharding) es suficiente para un rendimiento práctico — poniendo la programación de vanguardia al alcance en bare metal en el mercado.

Especificaciones clave

Propiedad
Valor

Parámetros totales

744B (MoE)

Parámetros activos

~40B por pasada hacia adelante

Ventana de contexto

200,000 tokens

Salida máxima

131,072 tokens

Licencia

MIT

Fecha de lanzamiento

7 de abril de 2026

Organización

Z.ai (zai-org en HuggingFace)

Herramientas principales

vLLM, SGLang, llama.cpp (GGUF), xLLM, KTransformers

¿Por qué GLM-5.1?

  • #1 en SWE-Bench Pro — 58.4% según el proveedor, por delante de GPT-5.4 y Claude Opus 4.6

  • Agentes de largo horizonte — mantiene la optimización a lo largo de cientos de rondas y miles de llamadas a herramientas

  • Contexto de 200K — suficiente para una base de código completa de tamaño mediano más su suite de pruebas

  • MoE activo de 40B — pagas el costo de inferencia de un modelo denso de 40B, no de uno de 744B

  • licencia MIT — pesos totalmente abiertos, sin restricciones para uso comercial o ajuste fino

  • Pila de entrenamiento abierta — Z.ai publicó el modelo, al parecer entrenado sin GPUs de centro de datos de Nvidia


Requisitos

Componente
Mínimo (Q4 GGUF, offload)
Recomendado (FP8)
BF16 completo

VRAM de GPU

~80 GB (Q4 + descarga a RAM)

2× H100 80GB activos, 8× en total

8× H200 141GB

RAM

256GB

256GB

512GB

Disco

500 GB NVMe

1TB NVMe

2TB NVMe

CUDA

12.8+

12.8+

12.8+

Elección de Clore.ai: Para la mayoría de los equipos, 2× H100 de 80 GB ejecutando el checkpoint FP8 con descarga agresiva es el punto ideal (~$2.08/h). Si necesitas el rendimiento completo de BF16, pasa a 8× H200 o usa la API de Z.ai para llamadas ocasionales.


Opción A — Ollama / GGUF (Cuantizado, compilaciones de la comunidad)


Opción B — vLLM (API de producción, recomendado)

vLLM es el objetivo de servicio de primera clase de Z.ai. El checkpoint FP8 (zai-org/GLM-5.1-FP8) es el que quieres — misma calidad que BF16, aproximadamente la mitad de memoria.

Usa --tensor-parallel-size 2 en 2× H100 si andas justo de cantidad de GPU, pero prepárate para un prefill más lento en contextos de 200K. --enable-chunked-prefill ayuda mucho.


Opción C — SGLang (alternativa, a menudo más rápida en Hopper)

La decodificación especulativa EAGLE de SGLang suele dar un aumento de rendimiento de 1,5–2× en completaciones largas de código.


Recomendaciones de GPU para Clore.ai

Configuración
VRAM
Rendimiento esperado
Coste de Clore.ai

2× H100 80GB

160 GB

FP8 con descarga, ~15–25 tok/s

~$2.08/hr

4× A100 80GB

320 GB

BF16 fragmentado, ~20–30 tok/s

8× H100 80GB

640 GB

FP8 completo, ~60+ tok/s

~$8.32/hr

8× H200 141GB

1,128GB

BF16 completo, rendimiento máximo


Casos de uso

  • Agentes SWE autónomos — GLM-5.1 está entrenado explícitamente para bucles largos de llamadas a herramientas; combínalo con algo como SWE-agent u OpenHands

  • Comprensión de bases de código — mete 100K+ tokens de Go/Rust/Python en el contexto y pide revisiones arquitectónicas

  • RAG de contexto largo — 200K de contexto maneja documentación completa del producto + tickets de soporte de una sola vez

  • Pipelines de refactorización — corrección sostenida a lo largo de cientos de ediciones de archivos

  • Orquestación agente-de-agentes — usa GLM-5.1 como planificador y modelos más pequeños (Qwen3.5-35B, GLM-4.7) como trabajadores


Pruebas comparativas

Benchmark
GLM-5.1
GPT-5.4
Claude Opus 4.6
GLM-5

SWE-Bench Pro

58.4%

57.7%

57.3%

~52%

SWE-Bench Verified

~79%

~78%

~80%

77.8%

HumanEval

~94%

~95%

~94%

~93%

LiveCodeBench

~72%

~73%

~70%

~68%


Solución de problemas

Problema
Solución

OutOfMemoryError al cargar

El checkpoint FP8 necesita ~860 GB de VRAM total. Usa 8× H100/H200 o baja a GGUF Q4 con descarga a RAM.

Descarga lenta de HuggingFace

Usa huggingface-cli download zai-org/GLM-5.1-FP8 --local-dir ./weights --resume-download. Espera 800 GB+.

Llamadas a herramientas descartadas silenciosamente

Asegúrate de --tool-call-parser glm47 y --enable-auto-tool-choice están ambos configurados en vLLM.

Modo de pensamiento vacío

Requiere temperature=1.0 — el muestreo a temperatura cero rompe la traza de razonamiento.

vLLM rechaza la configuración

GLM-5.1 necesita vLLM ≥ 0.7.x (versión de abril de 2026). Usa pip install -U vllm --pre si estás en versiones anteriores.

OOMs de contexto de 200K

Empieza con --max-model-len 65536 y añade --enable-chunked-prefill; súbelo una vez que sea estable.


Siguientes pasos

  • Predecesor: GLM-5 — misma estructura MoE, algo menos centrado en programación

  • Alternativa más barata: Qwen3.5 — un modelo denso de 35B cabe en una sola RTX 4090

  • Alternativa de contexto masivo: DeepSeek V4 — 1M de contexto, multimodal, ~1T de parámetros

  • Mercado de Clore.ai: clore.ai/marketplace — alquila H100/H200/A100 en bare metal

Enlaces

Última actualización

¿Te fue útil?