For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-4.7-Flash

Despliega GLM-4.7-Flash (30B MoE) de Zhipu AI en Clore.ai: modelo de lenguaje eficiente con un 59.2% de rendimiento en SWE-bench

GLM-4.7-Flash es un modelo de mezcla de expertos de 30 mil millones de parámetros modelo de lenguaje de Zhipu AI que activa solo 3 mil millones de parámetros por token. Ofrece un rendimiento excepcional en tareas de programación y razonamiento, alcanzando un 59.2% en SWE-bench mientras requiere solo 10-12 GB de VRAM para inferencia FP16. Lanzado bajo la licencia MIT, es una opción ideal para desarrolladores que buscan calidad de modelo de frontera a un coste asequible en una sola GPU.

De un vistazo

  • Tamaño del modelo: 30B en total / 3B parámetros activos (MoE)

  • Licencia: MIT (comercial sin restricciones)

  • Contexto: 128K tokens

  • Rendimiento: 59.2% SWE-bench, 75.4% HumanEval

  • VRAM: ~10-12GB FP16, ~6GB INT8

  • Velocidad: ~45-60 tok/s en una RTX 4090

¿Por qué GLM-4.7-Flash?

Rendimiento eficiente: GLM-4.7-Flash supera lo que cabría esperar de su tamaño. A pesar de usar solo 3B parámetros activos, supera a muchos modelos densos de 70B+ en benchmarks de programación. La arquitectura MoE ofrece la calidad de un modelo de 30B al coste de inferencia de un modelo de 7B.

Compatible con una sola GPU: A diferencia de los modelos masivos que requieren configuraciones con varias GPU, GLM-4.7-Flash funciona cómodamente en una sola RTX 4090 o A100 de 40GB. Esto lo hace perfecto para desarrollo, ajuste fino y despliegues de producción rentables.

Especialista en programación: Con un 59.2% en SWE-bench, GLM-4.7-Flash destaca en tareas de ingeniería de software — generación de código, depuración, refactorización y documentación técnica. Entiende más de 20 lenguajes de programación con una profunda conciencia del contexto.

Con licencia MIT: Sin restricciones de uso. Despliega comercialmente, ajusta o modifica sin preocupaciones de licencia. Los pesos completos y las recetas de entrenamiento están disponibles libremente.

Recomendaciones de GPU

GPU
VRAM
Rendimiento
Coste diario*

RTX 4090

24GB

~50 tok/s

~$2.10

RTX 3090

24GB

~35 tok/s

~$1.10

A100 40GB

40 GB

~80 tok/s

~$3.50

A100 80GB

80 GB

~90 tok/s

~$4.00

H100

80 GB

~120 tok/s

~$6.00

Mejor relación calidad-precio: La RTX 4090 ofrece el punto óptimo entre rendimiento y coste para GLM-4.7-Flash.

*Precios estimados del marketplace de Clore.ai

Despliega con vLLM

Instalar vLLM

Configuración para una sola GPU

Consultar el servidor

Desplegar con SGLang

SGLang a menudo ofrece mejor rendimiento para modelos MoE:

Desplegar con Ollama

Configuración sencilla para desarrollo local:

Luego consulta mediante la API REST:

Plantilla de Docker

Construir y ejecutar:

Ejemplo de generación de código

GLM-4.7-Flash destaca en generación de código compleja:

Consejos para usuarios de Clore.ai

  • Optimización de memoria: Usa --dtype float16 para reducir el uso de VRAM. Para GPUs de 16 GB, añade --max-model-len 16384 para limitar el contexto.

  • Procesamiento por lotes: Aumenta --max-num-seqs para obtener mayor rendimiento al servir múltiples solicitudes.

  • Cuantización: Para RTX 3060/4060 (12GB), usa versiones cuantizadas AWQ o GPTQ para un uso de ~6GB de VRAM.

  • Preempción: GLM-4.7-Flash maneja las interrupciones con elegancia — ideal para instancias preemptibles de Clore.ai.

  • Longitud del contexto: El contexto predeterminado de 128K puede ser excesivo. Establece --max-model-len 32768 para la mayoría de las aplicaciones.

Solución de problemas

Problema
Solución

OutOfMemoryError

Reduce --max-model-len o usa --dtype float16

Carga lenta del modelo

Precárgalo con huggingface-cli download THUDM/glm-4-flash

Errores de importación

Actualiza transformers: pip install transformers>=4.40.0

Rendimiento deficiente

Activa Flash Attention: pip install flash-attn

Conexión rechazada

Verifica el firewall: ufw allow 8000

Modelos alternativos

Si GLM-4.7-Flash no se ajusta a tus necesidades:

  • Qwen2.5-Coder-7B: Mejor programación pura, menor huella

  • CodeQwen1.5-7B: Especialista en programación en chino e inglés

  • GLM-4-9B: Versión mayor con mejor razonamiento

  • DeepSeek-V3: MoE de 671B para el máximo rendimiento (multi-GPU)

Recursos

Última actualización

¿Te fue útil?