GLM-5
Despliega GLM-5 (744B MoE) de Zhipu AI en Clore.ai: acceso por API y autoalojamiento con vLLM
GLM-5, lanzado en febrero de 2026 por Zhipu AI (Z.AI), es un modelo Mixture-of-Experts de 744 mil millones de parámetros modelo de lenguaje que activa solo 40 mil millones de parámetros por token. Logra un rendimiento de código abierto de primer nivel en razonamiento, programación y tareas agénticas — obteniendo un 77.8% en SWE-bench Verified y compitiendo con modelos punteros como Claude Opus 4.5 y GPT-5.2. El modelo está disponible bajo la licencia MIT en HuggingFace.
Características clave
744B total / 40B activo — MoE de 256 expertos con enrutamiento altamente eficiente
Rendimiento de programación de vanguardia — 77.8% en SWE-bench Verified, 73.3% en SWE-bench Multilingual
Razonamiento profundo — 92.7% en AIME 2026, 96.9% en HMMT Nov 2025, modo de pensamiento incorporado
Capacidades agénticas — llamadas nativas a herramientas, ejecución de funciones y planificación de tareas a largo plazo
ventana de contexto de 200K+ — maneja enormes bases de código y documentos extensos
licencia MIT — pesos completamente abiertos, se permite uso comercial
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Autoalojar GLM-5 es una tarea seria — el checkpoint FP8 requiere ~860GB de VRAM.
GPU
8× H100 80GB
8× H200 141GB
VRAM
640GB
1,128GB
RAM
256GB
512GB
Disco
1.5TB NVMe
2TB NVMe
CUDA
12.8+
12.8+
Recomendación de Clore.ai: Para la mayoría de los usuarios, acceder a GLM-5 vía API (Z.AI, OpenRouter). El autoalojamiento solo tiene sentido si puedes alquilar 8× H100/H200 (bare metal en Clore.ai).
Acceso API (recomendado para la mayoría de los usuarios)
La forma más práctica de usar GLM-5 desde una máquina de Clore.ai o desde cualquier lugar:
Vía la plataforma Z.AI
Vía OpenRouter
Configuración de vLLM (autoalojamiento)
Para quienes tienen acceso a máquinas multinodo de gama alta con varias GPU en Clore.ai:
Servir FP8 en 8× GPUs H200
Consultar el servidor
Alternativa SGLang
SGLang también admite GLM-5 y puede ofrecer mejor rendimiento en algo de hardware:
Inicio rápido con Docker
Ejemplo de llamada a herramientas
GLM-5 tiene compatibilidad nativa con llamadas a herramientas — ideal para crear aplicaciones agénticas:
Consejos para usuarios de Clore.ai
API primero, autoalojamiento después: GLM-5 requiere 8× H200 (bare metal en Clore.ai). Para un uso ocasional, la API de Z.AI o OpenRouter es mucho más rentable. Autoalójalo solo si necesitas un rendimiento sostenido o privacidad de datos.
Considera GLM-4.7 en su lugar: Si 8× H200 es demasiado, el predecesor GLM-4.7 (355B, 32B activos) funciona en 4× H200 o 4× H100 (~$4.16/h) y sigue ofreciendo un rendimiento excelente.
Usa pesos FP8: Usa siempre
zai-org/GLM-5-FP8— la misma calidad que BF16 pero con casi la mitad de uso de memoria. La versión BF16 requiere 16× GPUs.Supervisa el uso de VRAM:
watch nvidia-smi— las consultas de contexto largo pueden disparar el uso de memoria. Deja--gpu-memory-utilization 0.85para mantener margen.Compromiso del modo de pensamiento: El modo de pensamiento produce mejores resultados para tareas complejas, pero usa más tokens y tiempo. Desactívalo para consultas simples con
enable_thinking: false.
Solución de problemas
OutOfMemoryError al iniciar
Asegúrate de tener 8× H200 (141GB cada una). FP8 necesita ~860GB de VRAM total.
Descargas lentas (~800GB)
Usa huggingface-cli download zai-org/GLM-5-FP8 con --local-dir para reanudar.
Incompatibilidad de versión de vLLM
GLM-5 requiere la versión nightly de vLLM. Instala mediante pip install -U vllm --pre.
Las llamadas a herramientas no funcionan
Añade --tool-call-parser glm47 --enable-auto-tool-choice al comando serve.
Errores de DeepGEMM
Instala DeepGEMM para FP8: usa el script install_deepgemm.sh del repositorio de vLLM.
Salida vacía en el modo de pensamiento
Establece temperature=1.0 — el modo de pensamiento requiere una temperatura distinta de cero.
Lecturas adicionales
Última actualización
¿Te fue útil?