> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md).

# GLM-5.2 (MIT, contexto de 1M)

Ejecuta GLM-5.2, la joya de codificación con contexto de 1M de Z.ai con licencia MIT, en un gran rig multi-GPU del marketplace de Clore.ai

{% hint style="info" %}
**Estado (agosto de 2026):** Z.ai lanzó **GLM-5.2** el **13 de junio de 2026** bajo la **licencia MIT** — sin límites regionales, sin cláusula de ingresos. Pesos: [zai-org/GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) y [zai-org/GLM-5.2-FP8](https://huggingface.co/zai-org/GLM-5.2-FP8). MoE con atención dispersa, aproximadamente **750B de parámetros totales con \~40B activos**, un **sólido contexto de 1M de tokens**, y las puntuaciones abiertas más fuertes publicadas hasta ahora.
{% endhint %}

GLM-5.1 ya era el modelo abierto a batir en ingeniería de software. GLM-5.2 eleva Terminal-Bench 2.1 de 63.5 a **81.0** y SWE-bench Pro de 58.4 a **62.1**, y lo hace con una licencia MIT mientras el resto de la vanguardia se movía hacia términos personalizados con barreras de ingresos.

La pega es el tamaño. El checkpoint FP8 es **756 GB**. No es un modelo de una sola tarjeta y nunca lo será. Lo que lo hace interesante en Clore.ai es que las versiones cuantizadas caben dentro del límite de las rigs más grandes del mercado.

### Especificaciones clave

| Propiedad                | Valor                                                                                    |
| ------------------------ | ---------------------------------------------------------------------------------------- |
| Parámetros               | \~750B totales, \~40B activos (MoE)                                                      |
| Arquitectura             | 78 capas, 256 expertos enrutados, 8 activos por token, atención dispersa IndexShare, MTP |
| Contexto                 | 1.000.000 tokens                                                                         |
| Licencia                 | MIT                                                                                      |
| Fecha de lanzamiento     | 13 de junio de 2026                                                                      |
| Pesos                    | FP8 756GB · Q2\_K\_XL GGUF 254GB · IQ1\_S GGUF 217GB                                     |
| Herramientas principales | SGLang ≥ 0.5.13.post1, vLLM ≥ 0.23.0, llama.cpp                                          |

### Qué hay de nuevo frente a GLM-5.1

* **Contexto sólido de 1M** — no es una cifra llamativa, pero sí una ventana que se mantiene en trabajos de largo horizonte
* **IndexShare** — un indexador reutilizado en cada cuatro capas de atención dispersa, reduciendo los FLOPs por token en **2,9× con contexto de 1M**
* **Mejor MTP** — la longitud de aceptación de decodificación especulativa aumenta hasta un 20%
* **Esfuerzo de pensamiento flexible** — intercambia latencia por profundidad por solicitud
* **Sigue siendo MIT** — los pesos no llevan ninguna restricción de uso

***

## Requisitos

{% hint style="warning" %}
**Este modelo necesita una rig, no una tarjeta.** FP8 con 756 GB supera cualquier máquina en el mercado de Clore.ai. Las cajas más grandes listadas son 4× RTX PRO 6000 Blackwell (380 GB) y 10–11× RTX 5090 (310–341 GB). GGUF cuantizado es la única vía aquí; la atención en precisión completa pertenece a [bare metal](https://clore.ai/bare-metal).
{% endhint %}

| Versión      | Tamaño | Dónde se ejecuta en Clore.ai                                      |
| ------------ | ------ | ----------------------------------------------------------------- |
| `UD-IQ1_S`   | 217 GB | 8× RTX 5090 (248 GB) — 47 servidores listados con ≥242 GB         |
| `UD-IQ2_M`   | 239 GB | 8× RTX 5090, justo                                                |
| `UD-Q2_K_XL` | 254 GB | 10× RTX 5090 (310 GB) o 4× RTX PRO 6000 (380 GB)                  |
| `UD-Q3_K_M`  | 343 GB | solo 4× RTX PRO 6000 (380 GB) — hay 2 servidores así listados     |
| `UD-IQ4_XS`  | 365 GB | 4× RTX PRO 6000, sin margen                                       |
| FP8 oficial  | 756 GB | No está en el mercado → [bare metal](https://clore.ai/bare-metal) |

Añade un 10–15% sobre el tamaño de los pesos para la caché KV y las activaciones a longitudes de contexto de trabajo, y comprueba la RAM del sistema: estas rigs necesitan suficiente para preparar los pesos durante la carga.

***

## Despliega con llama.cpp en una rig con varias GPU

La vía realista en hardware del mercado. Alquila una rig de 10× RTX 5090 (aproximadamente **$5.00/h** en la última instantánea) y divide el modelo entre todas las tarjetas:

```bash
# ~254 GB — deja algo de margen en la rig
huggingface-cli download unsloth/GLM-5.2-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/glm52

llama-server -m /workspace/glm52/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 131072 --flash-attn \\
  --no-mmap
```

{% hint style="info" %}
`--no-mmap` importa en hardware alquilado: los pesos se descargan de nuevo en un disco que no conservas, y hacer mmap de un archivo de 254 GB sobre un disco lento convierte la latencia del primer token en minutos. Reserva 30–60 minutos solo para la descarga y elige un servidor con un enlace rápido.
{% endhint %}

## Despliega con vLLM o SGLang (FP8, hardware dedicado)

Si tienes capacidad — hardware dedicado, o tu propio clúster — Z.ai admite ambos motores directamente:

```bash
# vLLM >= 0.23.0
vllm serve zai-org/GLM-5.2-FP8 \\
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \\
  --enable-expert-parallel \\
  --gpu-memory-utilization 0.92

# SGLang >= 0.5.13.post1
python3 -m sglang.launch_server \\
  --model-path zai-org/GLM-5.2-FP8 \\
  --tp 8 --context-length 1000000 \\
  --speculative-algorithm EAGLE
```

Checkpoints cuantizados ya preparados para otras pilas: [`nvidia/GLM-5.2-NVFP4`](https://huggingface.co/nvidia/GLM-5.2-NVFP4) para Blackwell, [`cyankiwi/GLM-5.2-AWQ-INT4`](https://huggingface.co/cyankiwi/GLM-5.2-AWQ-INT4) para pilas AWQ, [`amd/GLM-5.2-MXFP4`](https://huggingface.co/amd/GLM-5.2-MXFP4) para Instinct.

***

## Recomendaciones de GPU para Clore.ai

| Configuración             | VRAM total | Versión                      | Coste en Clore.ai                         |
| ------------------------- | ---------- | ---------------------------- | ----------------------------------------- |
| 8× RTX 5090               | 248 GB     | IQ1\_S / IQ2\_M              | \~$2.00–3.50/h                            |
| **10× RTX 5090**          | **310 GB** | **Q2\_K\_XL**                | **\~$5.00/h**                             |
| 4× RTX PRO 6000 Blackwell | 380 GB     | Q2\_K\_XL or Q3\_K\_M        | \~$5.00/h                                 |
| 8× H200 dedicadas         | 1,128GB    | FP8, contexto completo de 1M | [bare metal](https://clore.ai/bare-metal) |

Solo existen unas pocas rigs de este tamaño en cualquier momento — 47 servidores con ≥242 GB, 9 de ellos libres en la última instantánea. Revisa el mercado antes de planificar en torno a una.

***

## Pruebas comparativas

Del propio model card de Z.ai (13 de junio de 2026). Existen reproducciones independientes para los conjuntos de codificación; trata las cifras de razonamiento como reportadas por el proveedor.

| Benchmark                        | GLM-5.2  | GLM-5.1 | DeepSeek-V4-Pro (Vista previa) | MiniMax M3 |
| -------------------------------- | -------- | ------- | ------------------------------ | ---------- |
| Terminal-Bench 2.1 (Terminus-2)  | **81.0** | 63.5    | 64                             | 65         |
| Terminal-Bench 2.1 (mejor marco) | **82.7** | 69      | —                              | —          |
| SWE-bench Pro                    | **62.1** | 58.4    | 55.4                           | 59         |
| NL2Repo                          | **48.9** | 42.7    | 35.5                           | 42.1       |
| DeepSWE                          | **46.2** | 18      | 8                              | 20         |
| HLE                              | 40.5     | 31      | 37.7                           | 37         |
| AIME 2026                        | 99.2     | 95.3    | 94.6                           | —          |
| GPQA-Diamond                     | 91.2     | 86.2    | 90.1                           | 93         |

***

## Casos de uso

* **Agentes de codificación autónomos** — los saltos en Terminal-Bench y DeepSWE son exactamente el comportamiento de largo horizonte que necesitan los agentes
* **Razonamiento sobre repositorios completos** — contexto de 1M con atención dispersa que sigue siendo asequible a gran longitud
* **Trabajo de migración y refactorización** — NL2Repo mide la construcción de un repo a partir de una especificación, y GLM-5.2 lidera el campo abierto
* **Alternativa autoalojada a las API cerradas de vanguardia** — MIT significa que puedes integrarlo en un producto
* **Marcos de evaluación por lotes** — alquila una gran rig por minuto, ejecuta la barrida y cierra el pedido

***

## Solución de problemas

| Problema                                 | Solución                                                                                                                     |
| ---------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------- |
| La descarga tarda una eternidad          | 254 GB en Q2 — filtra el mercado para servidores de alto ancho de banda y usa `--include` para obtener solo una cuantización |
| OOM distribuido entre GPUs               | `--split-mode layer` en llama.cpp; en vLLM aumenta `--tensor-parallel-size` al número total de GPUs                          |
| El primer token tarda minutos            | Quita `--mmap`, mantén el modelo en NVMe local y precaliéntalo con un prompt corto                                           |
| vLLM rechaza la configuración            | Necesita ≥ 0.23.0; SGLang necesita ≥ 0.5.13.post1                                                                            |
| La calidad se siente floja en IQ1        | Es una versión de 1 bit de un modelo de 750B. Pasa a Q2\_K\_XL o superior si la rig lo permite                               |
| La rig desaparece a mitad de la descarga | Otra persona la alquiló. Usa bajo demanda en lugar de spot para trabajos largos de preparación                               |

***

## Siguientes pasos

* **Predecesor:** [GLM-5.1](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-1.md) — la versión de abril de 744B
* **Cabe en una sola tarjeta en su lugar:** [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md) — Apache 2.0, 15 GB en Q4
* **Misma categoría de tamaño:** [MiniMax M3](/guides/guides_v2-es/modelos-de-lenguaje/minimax-m3.md) · [Nemotron 3 Ultra](/guides/guides_v2-es/modelos-de-lenguaje/nemotron-3-ultra.md) · [DeepSeek V4](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v4.md)
* **Dimensionamiento de la rig:** [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) · [Configuración multi-GPU](/guides/guides_v2-es/avanzado/multi-gpu-setup.md)

### Enlaces

* [GLM-5.2 en Hugging Face](https://huggingface.co/zai-org/GLM-5.2) · [FP8](https://huggingface.co/zai-org/GLM-5.2-FP8) · [GGUF](https://huggingface.co/unsloth/GLM-5.2-GGUF)
* [Blog de Z.ai](https://z.ai/blog/glm-5.2) · [GitHub de GLM-5](https://github.com/zai-org/GLM-5)
* [Receta de vLLM](https://recipes.vllm.ai/zai-org/GLM-5.2) · [Recetario de SGLang](https://cookbook.sglang.io/autoregressive/GLM/GLM-5.2)
* **Alquila una GPU:** [RTX 5090](https://clore.ai/rent-5090.html) · [Marketplace](https://clore.ai/marketplace) · [Hardware dedicado](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
