For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5

Despliega GLM-5 (744B MoE) de Zhipu AI en Clore.ai: acceso por API y autoalojamiento con vLLM

GLM-5, lanzado en febrero de 2026 por Zhipu AI (Z.AI), es un modelo Mixture-of-Experts de 744 mil millones de parámetros modelo de lenguaje que activa solo 40 mil millones de parámetros por token. Logra un rendimiento de código abierto de primer nivel en razonamiento, programación y tareas agénticas — obteniendo un 77.8% en SWE-bench Verified y compitiendo con modelos punteros como Claude Opus 4.5 y GPT-5.2. El modelo está disponible bajo la licencia MIT en HuggingFace.

Características clave

  • 744B total / 40B activo — MoE de 256 expertos con enrutamiento altamente eficiente

  • Rendimiento de programación de vanguardia — 77.8% en SWE-bench Verified, 73.3% en SWE-bench Multilingual

  • Razonamiento profundo — 92.7% en AIME 2026, 96.9% en HMMT Nov 2025, modo de pensamiento incorporado

  • Capacidades agénticas — llamadas nativas a herramientas, ejecución de funciones y planificación de tareas a largo plazo

  • ventana de contexto de 200K+ — maneja enormes bases de código y documentos extensos

  • licencia MIT — pesos completamente abiertos, se permite uso comercial

Requisitos

Autoalojar GLM-5 es una tarea seria — el checkpoint FP8 requiere ~860GB de VRAM.

Componente
Mínimo (FP8)
Recomendado

GPU

8× H100 80GB

8× H200 141GB

VRAM

640GB

1,128GB

RAM

256GB

512GB

Disco

1.5TB NVMe

2TB NVMe

CUDA

12.8+

12.8+

Recomendación de Clore.ai: Para la mayoría de los usuarios, acceder a GLM-5 vía API (Z.AI, OpenRouter). El autoalojamiento solo tiene sentido si puedes alquilar 8× H100/H200 (bare metal en Clore.ai).

Acceso API (recomendado para la mayoría de los usuarios)

La forma más práctica de usar GLM-5 desde una máquina de Clore.ai o desde cualquier lugar:

Vía la plataforma Z.AI

Vía OpenRouter

Configuración de vLLM (autoalojamiento)

Para quienes tienen acceso a máquinas multinodo de gama alta con varias GPU en Clore.ai:

Servir FP8 en 8× GPUs H200

Consultar el servidor

Alternativa SGLang

SGLang también admite GLM-5 y puede ofrecer mejor rendimiento en algo de hardware:

Inicio rápido con Docker

Ejemplo de llamada a herramientas

GLM-5 tiene compatibilidad nativa con llamadas a herramientas — ideal para crear aplicaciones agénticas:

Consejos para usuarios de Clore.ai

  • API primero, autoalojamiento después: GLM-5 requiere 8× H200 (bare metal en Clore.ai). Para un uso ocasional, la API de Z.AI o OpenRouter es mucho más rentable. Autoalójalo solo si necesitas un rendimiento sostenido o privacidad de datos.

  • Considera GLM-4.7 en su lugar: Si 8× H200 es demasiado, el predecesor GLM-4.7 (355B, 32B activos) funciona en 4× H200 o 4× H100 (~$4.16/h) y sigue ofreciendo un rendimiento excelente.

  • Usa pesos FP8: Usa siempre zai-org/GLM-5-FP8 — la misma calidad que BF16 pero con casi la mitad de uso de memoria. La versión BF16 requiere 16× GPUs.

  • Supervisa el uso de VRAM: watch nvidia-smi — las consultas de contexto largo pueden disparar el uso de memoria. Deja --gpu-memory-utilization 0.85 para mantener margen.

  • Compromiso del modo de pensamiento: El modo de pensamiento produce mejores resultados para tareas complejas, pero usa más tokens y tiempo. Desactívalo para consultas simples con enable_thinking: false.

Solución de problemas

Problema
Solución

OutOfMemoryError al iniciar

Asegúrate de tener 8× H200 (141GB cada una). FP8 necesita ~860GB de VRAM total.

Descargas lentas (~800GB)

Usa huggingface-cli download zai-org/GLM-5-FP8 con --local-dir para reanudar.

Incompatibilidad de versión de vLLM

GLM-5 requiere la versión nightly de vLLM. Instala mediante pip install -U vllm --pre.

Las llamadas a herramientas no funcionan

Añade --tool-call-parser glm47 --enable-auto-tool-choice al comando serve.

Errores de DeepGEMM

Instala DeepGEMM para FP8: usa el script install_deepgemm.sh del repositorio de vLLM.

Salida vacía en el modo de pensamiento

Establece temperature=1.0 — el modo de pensamiento requiere una temperatura distinta de cero.

Lecturas adicionales

Última actualización

¿Te fue útil?