Qwen2.5
在 Clore.ai GPU 上运行阿里巴巴的 Qwen2.5 多语言 LLM
运行阿里巴巴的 Qwen2.5 系列模型——在 CLORE.AI GPU 上具备出色代码和数学能力的强大多语言 LLM。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
为什么选择 Qwen2.5?
多样化规格 - 0.5B 到 72B 参数
多语言 - 包含中文在内的 29 种语言
长上下文 - 最多 128K token
专用变体 - Coder、Math 版本
开源 - Apache 2.0 许可证
在 CLORE.AI 上快速部署
Docker 镜像:
vllm/vllm-openai:latest端口:
22/tcp
8000/http命令:
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 \\
--port 8000访问你的服务
部署后,找到你的 http_pub URL 在 我的订单:
前往 我的订单 页面
点击你的订单
找到
http_pubURL(例如,abc123.clorecloud.net)
使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。
验证是否正常工作
如果你收到 HTTP 502,请等待 5-15 分钟——模型仍在从 HuggingFace 下载。
Qwen3 推理模式
通过 vLLM 使用 Qwen3 模型时,响应可能包含推理内容:
使用带推理的 Qwen3:
模型变体
基础模型
Qwen2.5-0.5B
0.5B
2GB
32K
边缘端/测试
Qwen2.5-1.5B
1.5B
4GB
32K
极轻量
Qwen2.5-3B
3B
8GB
32K
预算
Qwen2.5-7B
7B
16GB
128K
均衡
Qwen2.5-14B
14B
32GB
128K
高质量
Qwen2.5-32B
32B
70GB
128K
非常高质量
Qwen2.5-72B
72B
150GB
128K
最佳质量
Qwen2.5-72B-Instruct
72B
150GB
128K
聊天/指令调优
专用变体
Qwen2.5-Coder-7B-Instruct
代码
编程、调试
16GB
Qwen2.5-Coder-14B-Instruct
代码
复杂代码任务
32GB
Qwen2.5-Coder-32B-Instruct
代码
最佳代码模型
70GB
Qwen2.5-Math-7B-Instruct
数学
计算、证明
16GB
Qwen2.5-Math-72B-Instruct
数学
研究级数学
150GB
Qwen2.5-Instruct
聊天
通用助手
因情况而异
硬件要求
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
0.5B-3B
RTX 3060 12GB
RTX 3080
2-6GB
7B
RTX 3090 24GB
RTX 4090
6GB
14B
A100 40GB
A100 80GB
12GB
32B
A100 80GB
2x A100 40GB
22GB
72B
2x A100 80GB
4x A100 80GB
48GB
Coder-32B
A100 80GB
2x A100 40GB
22GB
安装
使用 vLLM(推荐)
使用 Ollama
使用 Transformers
API 使用
OpenAI 兼容 API
流式输出
cURL
Qwen2.5-72B-Instruct
旗舰级 Qwen2.5 模型——该系列中规模最大、能力最强的模型。它在许多基准测试中可与 GPT-4 竞争,并且在 Apache 2.0 许可证下完全开源。
通过 vLLM 运行(多 GPU)
通过 Ollama 运行
Python 示例
Qwen2.5-Coder-32B-Instruct
当前可用的最佳开源代码模型。Qwen2.5-Coder-32B-Instruct 在许多编程基准上与 GPT-4o 持平甚至更强,支持 40+ 种编程语言。
通过 vLLM 运行
通过 Ollama 运行
代码生成示例
Qwen2.5-Coder
针对代码生成进行了优化:
Qwen2.5-Math
专为数学推理而设计:
多语言支持
Qwen2.5 支持 29 种语言:
长上下文(128K)
量化
Ollama 的 GGUF 格式
使用 vLLM 的 AWQ
使用 llama.cpp 的 GGUF
多 GPU 设置
张量并行
性能
吞吐量(tokens/秒)
Qwen2.5-0.5B
250
320
380
400
Qwen2.5-3B
150
200
250
280
Qwen2.5-7B
75
100
130
150
Qwen2.5-7B Q4
110
140
180
200
Qwen2.5-14B
-
55
70
85
Qwen2.5-32B
-
-
35
50
Qwen2.5-72B
-
-
20 (2x)
40 (2x)
Qwen2.5-72B Q4
-
-
-
55 (2x)
Qwen2.5-Coder-32B
-
-
32
48
首个 token 时间(TTFT)
7B
60ms
40ms
35ms
14B
120ms
80ms
60ms
32B
-
200ms
140ms
72B
-
400ms (2x)
280ms (2x)
上下文长度 vs VRAM(7B)
8K
16GB
10GB
6GB
32K
24GB
16GB
10GB
64K
40GB
26GB
16GB
128K
72GB
48GB
28GB
基准
Qwen2.5-7B
74.2%
75.6%
85.4%
55.2%
42.1%
Qwen2.5-14B
79.7%
81.1%
89.5%
65.8%
51.3%
Qwen2.5-32B
83.3%
84.2%
91.2%
72.1%
60.7%
Qwen2.5-72B
86.1%
86.2%
93.2%
79.5%
67.4%
Qwen2.5-Coder-7B
72.8%
88.4%
86.1%
58.4%
64.2%
Qwen2.5-Coder-32B
83.1%
92.7%
92.3%
76.8%
78.5%
Docker Compose
成本估算
CLORE.AI 市场的典型费率:
RTX 3090 24GB
~$0.06
7B 模型
RTX 4090 24GB
~$0.10
7B-14B 模型
A100 40GB
~$0.17
14B-32B 模型
A100 80GB
~$0.25
32B 模型、Coder-32B
2x A100 80GB
~$0.50
72B 模型
4x A100 80GB
~$1.00
72B 最大上下文
价格因提供商而异。查看 CLORE.AI 市场 以获取当前费率。
节省费用:
使用 竞价 适用于灵活工作负载的市场
使用 CLORE 代币支付
测试时先从较小的模型(7B)开始
故障排查
内存不足
生成缓慢
中文字符显示
未找到模型
Qwen2.5 与其他模型对比
上下文
128K
128K
128K
128K
多语言
优秀
优秀
好
优秀
代码
优秀
优秀
好
优秀
数学
优秀
优秀
好
优秀
中文
优秀
优秀
较差
好
许可证
Apache 2.0
Apache 2.0
Llama 3.1
专有
成本
免费
免费
免费
付费 API
在以下情况下使用 Qwen2.5:
需要中文支持
数学/代码任务优先
需要长上下文
希望使用 Apache 2.0 许可证
需要最佳开源代码模型(Coder-32B)
下一步
vLLM - 生产部署
Ollama - 易于本地部署
DeepSeek-V3 - 更大的推理模型
DeepSeek-R1 - 开源推理模型
微调 LLM - 定制训练
最后更新于
这有帮助吗?