GLM-5
在 Clore.ai 上部署 Zhipu AI 的 GLM-5(744B MoE)——通过 vLLM 提供 API 访问和自托管
最后更新于
这有帮助吗?
这有帮助吗?
from openai import OpenAI
client = OpenAI(
api_key="your-zai-api-key",
base_url="https://api.z.ai/v1"
)
response = client.chat.completions.create(
model="glm-5",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "使用 aiohttp 和 BeautifulSoup 编写一个 Python 异步网页爬虫"}
],
temperature=1.0,
max_tokens=4096
)
print(response.choices[0].message.content)from openai import OpenAI
client = OpenAI(
api_key="your-openrouter-key",
base_url="https://openrouter.ai/api/v1"
)
response = client.chat.completions.create(
model="zai-org/glm-5",
messages=[
{"role": "user", "content": "解释 GLM-5 中使用的 MoE 架构"}
],
max_tokens=2048
)
print(response.choices[0].message.content)# 安装 vLLM(需 nightly 以支持 GLM-5)
pip install -U vllm --pre --extra-index-url https://wheels.vllm.ai/nightly
# 安装最新 transformers(必需)
pip install git+https://github.com/huggingface/transformers.gitvllm serve zai-org/GLM-5-FP8 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 1 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm-5-fp8 \
--gpu-memory-utilization 0.85from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
# 使用思考模式(默认)
response = client.chat.completions.create(
model="glm-5-fp8",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "求解:找出所有使 p^2 + 2 也是素数的素数 p"}
],
temperature=1.0,
max_tokens=4096
)
print(response.choices[0].message.content)
# 不使用思考模式(更快、响应更短)
response = client.chat.completions.create(
model="glm-5-fp8",
messages=[
{"role": "user", "content": "用 Rust 写一个快速排序"}
],
temperature=1.0,
max_tokens=4096,
extra_body={
"chat_template_kwargs": {"enable_thinking": False}
}
)
print(response.choices[0].message.content)# 使用 Docker(Hopper GPU)
docker pull lmsysorg/sglang:glm5-hopper
# 启动服务器
python3 -m sglang.launch_server \
--model-path zai-org/GLM-5-FP8 \
--tp-size 8 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--speculative-algorithm EAGLE \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--mem-fraction-static 0.85 \
--served-model-name glm-5-fp8# 带有 GLM-5 支持的 vLLM Docker 镜像
docker run --gpus all -p 8000:8000 \
--ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:glm5 zai-org/GLM-5-FP8 \
--tensor-parallel-size 8 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm5 \
--trust-remote-codefrom openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "获取某城市的当前天气",
"parameters": {
"type": "object",
"required": ["city"],
"properties": {
"city": {"type": "string", "description": "城市名称"}
}
}
}
}]
response = client.chat.completions.create(
model="glm-5-fp8",
messages=[{"role": "user", "content": "东京的天气怎么样?"}],
tools=tools,
tool_choice="auto"
)
print(response.choices[0].message.tool_calls)