For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen2.5

在 Clore.ai GPU 上运行阿里巴巴的 Qwen2.5 多语言 LLM

运行阿里巴巴的 Qwen2.5 系列模型——在 CLORE.AI GPU 上具备出色代码和数学能力的强大多语言 LLM。

为什么选择 Qwen2.5?

  • 多样化规格 - 0.5B 到 72B 参数

  • 多语言 - 包含中文在内的 29 种语言

  • 长上下文 - 最多 128K token

  • 专用变体 - Coder、Math 版本

  • 开源 - Apache 2.0 许可证

在 CLORE.AI 上快速部署

Docker 镜像:

vllm/vllm-openai:latest

端口:

22/tcp
8000/http

命令:

python -m vllm.entrypoints.openai.api_server \
    --model Qwen/Qwen2.5-7B-Instruct \
    --host 0.0.0.0 \\
    --port 8000

访问你的服务

部署后,找到你的 http_pub URL 在 我的订单:

  1. 前往 我的订单 页面

  2. 点击你的订单

  3. 找到 http_pub URL(例如, abc123.clorecloud.net)

使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。

验证是否正常工作

Qwen3 推理模式

Qwen3 新增: 部分 Qwen3 模型支持推理模式,会将模型的思考过程以 <think> 标签形式显示在最终答案之前。

通过 vLLM 使用 Qwen3 模型时,响应可能包含推理内容:

使用带推理的 Qwen3:

模型变体

基础模型

模型
参数
显存(FP16)
上下文
备注

Qwen2.5-0.5B

0.5B

2GB

32K

边缘端/测试

Qwen2.5-1.5B

1.5B

4GB

32K

极轻量

Qwen2.5-3B

3B

8GB

32K

预算

Qwen2.5-7B

7B

16GB

128K

均衡

Qwen2.5-14B

14B

32GB

128K

高质量

Qwen2.5-32B

32B

70GB

128K

非常高质量

Qwen2.5-72B

72B

150GB

128K

最佳质量

Qwen2.5-72B-Instruct

72B

150GB

128K

聊天/指令调优

专用变体

模型
重点
最适合
显存(FP16)

Qwen2.5-Coder-7B-Instruct

代码

编程、调试

16GB

Qwen2.5-Coder-14B-Instruct

代码

复杂代码任务

32GB

Qwen2.5-Coder-32B-Instruct

代码

最佳代码模型

70GB

Qwen2.5-Math-7B-Instruct

数学

计算、证明

16GB

Qwen2.5-Math-72B-Instruct

数学

研究级数学

150GB

Qwen2.5-Instruct

聊天

通用助手

因情况而异

硬件要求

模型
最低 GPU
推荐
显存(Q4)

0.5B-3B

RTX 3060 12GB

RTX 3080

2-6GB

7B

RTX 3090 24GB

RTX 4090

6GB

14B

A100 40GB

A100 80GB

12GB

32B

A100 80GB

2x A100 40GB

22GB

72B

2x A100 80GB

4x A100 80GB

48GB

Coder-32B

A100 80GB

2x A100 40GB

22GB

安装

使用 vLLM(推荐)

使用 Ollama

使用 Transformers

API 使用

OpenAI 兼容 API

流式输出

cURL

Qwen2.5-72B-Instruct

旗舰级 Qwen2.5 模型——该系列中规模最大、能力最强的模型。它在许多基准测试中可与 GPT-4 竞争,并且在 Apache 2.0 许可证下完全开源。

通过 vLLM 运行(多 GPU)

通过 Ollama 运行

Python 示例

Qwen2.5-Coder-32B-Instruct

当前可用的最佳开源代码模型。Qwen2.5-Coder-32B-Instruct 在许多编程基准上与 GPT-4o 持平甚至更强,支持 40+ 种编程语言。

通过 vLLM 运行

通过 Ollama 运行

代码生成示例

Qwen2.5-Coder

针对代码生成进行了优化:

Qwen2.5-Math

专为数学推理而设计:

多语言支持

Qwen2.5 支持 29 种语言:

长上下文(128K)

量化

Ollama 的 GGUF 格式

使用 vLLM 的 AWQ

使用 llama.cpp 的 GGUF

多 GPU 设置

张量并行

性能

吞吐量(tokens/秒)

模型
RTX 3090
RTX 4090
A100 40GB
A100 80GB

Qwen2.5-0.5B

250

320

380

400

Qwen2.5-3B

150

200

250

280

Qwen2.5-7B

75

100

130

150

Qwen2.5-7B Q4

110

140

180

200

Qwen2.5-14B

-

55

70

85

Qwen2.5-32B

-

-

35

50

Qwen2.5-72B

-

-

20 (2x)

40 (2x)

Qwen2.5-72B Q4

-

-

-

55 (2x)

Qwen2.5-Coder-32B

-

-

32

48

首个 token 时间(TTFT)

模型
RTX 4090
A100 40GB
A100 80GB

7B

60ms

40ms

35ms

14B

120ms

80ms

60ms

32B

-

200ms

140ms

72B

-

400ms (2x)

280ms (2x)

上下文长度 vs VRAM(7B)

上下文
FP16
Q8
Q4

8K

16GB

10GB

6GB

32K

24GB

16GB

10GB

64K

40GB

26GB

16GB

128K

72GB

48GB

28GB

基准

模型
MMLU
HumanEval
GSM8K
MATH
LiveCodeBench

Qwen2.5-7B

74.2%

75.6%

85.4%

55.2%

42.1%

Qwen2.5-14B

79.7%

81.1%

89.5%

65.8%

51.3%

Qwen2.5-32B

83.3%

84.2%

91.2%

72.1%

60.7%

Qwen2.5-72B

86.1%

86.2%

93.2%

79.5%

67.4%

Qwen2.5-Coder-7B

72.8%

88.4%

86.1%

58.4%

64.2%

Qwen2.5-Coder-32B

83.1%

92.7%

92.3%

76.8%

78.5%

Docker Compose

成本估算

CLORE.AI 市场的典型费率:

GPU
小时费率
最适合

RTX 3090 24GB

~$0.06

7B 模型

RTX 4090 24GB

~$0.10

7B-14B 模型

A100 40GB

~$0.17

14B-32B 模型

A100 80GB

~$0.25

32B 模型、Coder-32B

2x A100 80GB

~$0.50

72B 模型

4x A100 80GB

~$1.00

72B 最大上下文

价格因提供商而异。查看 CLORE.AI 市场 以获取当前费率。

节省费用:

  • 使用 竞价 适用于灵活工作负载的市场

  • 使用 CLORE 代币支付

  • 测试时先从较小的模型(7B)开始

故障排查

内存不足

生成缓慢

中文字符显示

未找到模型

Qwen2.5 与其他模型对比

功能
Qwen2.5-7B
Qwen2.5-72B
Llama 3.1 70B
GPT-4o

上下文

128K

128K

128K

128K

多语言

优秀

优秀

优秀

代码

优秀

优秀

优秀

数学

优秀

优秀

优秀

中文

优秀

优秀

较差

许可证

Apache 2.0

Apache 2.0

Llama 3.1

专有

成本

免费

免费

免费

付费 API

在以下情况下使用 Qwen2.5:

  • 需要中文支持

  • 数学/代码任务优先

  • 需要长上下文

  • 希望使用 Apache 2.0 许可证

  • 需要最佳开源代码模型(Coder-32B)

下一步

最后更新于

这有帮助吗?