GLM-5.1(744B MoE,SWE-Bench Pro 第 1 名)
在 Clore.ai 上部署 Z.ai 的 GLM-5.1(744B MoE,40B 激活)——于 2026 年 4 月在 SWE-Bench Pro 上登顶的开源权重模型
最后更新于
这有帮助吗?
这有帮助吗?
# 一旦可用 Q4_K_M 构建版本
docker exec ollama ollama pull glm-5.1:q4_K_M
docker exec ollama ollama run glm-5.1:q4_K_M
# 或直接使用 llama.cpp 处理 GGUF 文件
docker run --gpus all -it --rm -p 8080:8080 \
-v $(pwd)/models:/models \
ghcr.io/ggerganov/llama.cpp:server-cuda \
-m /models/glm-5.1-q4_k_m.gguf \
--n-gpu-layers 80 --ctx-size 32768 \
--port 8080 --host 0.0.0.0version: "3.8"
services:
vllm:
image: vllm/vllm-openai:latest
ports:
- "8000:8000"
volumes:
- hf_cache:/root/.cache/huggingface
command: >
--model zai-org/GLM-5.1-FP8
--tensor-parallel-size 8
--max-model-len 65536
--gpu-memory-utilization 0.88
--tool-call-parser glm47
--reasoning-parser glm45
--enable-auto-tool-choice
--served-model-name glm-5.1
--trust-remote-code
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
shm_size: "16gb"
volumes:
hf_cache:# 测试 API
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [
{"role": "system", "content": "你是一名资深软件工程师。"},
{"role": "user", "content": "请重构这个 Go 处理器,正确使用 context.Context,并添加重试。"}
],
"max_tokens": 4096,
"temperature": 1.0
}'docker pull lmsysorg/sglang:latest
python3 -m sglang.launch_server \
--model-path zai-org/GLM-5.1-FP8 \
--tp-size 8 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--speculative-algorithm EAGLE \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--mem-fraction-static 0.88 \
--context-length 65536 \
--served-model-name glm-5.1