For the complete documentation index, see llms.txt. This page is also available as Markdown.

Llama 3.3 70B

在 Clore.ai GPU 上运行 Meta 的 Llama 3.3 70B 模型

有更新版本可用! Meta 已发布 Llama 4 于 2025 年 4 月发布,采用 MoE 架构——Scout(17B 激活参数,可在 RTX 4090 上运行)在仅需极少显存的情况下提供相近的质量。建议升级。

Meta 在 CLORE.AI GPU 上最新且最高效的 70B 模型。

为什么选择 Llama 3.3?

  • 最佳 70B 模型 - 以极低成本匹配 Llama 3.1 405B 的性能

  • 多语言 - 原生支持 8 种语言

  • 128K 上下文 - 长文档处理

  • 开源权重 - 可免费用于商业用途

模型概览

规格
数值

参数

70B

上下文长度

128K 令牌

训练数据

15T+ 令牌

语言

EN, DE, FR, IT, PT, HI, ES, TH

许可证

Llama 3.3 社区许可协议

性能与其他模型对比

基准
Llama 3.3 70B
Llama 3.1 405B
GPT-4o

MMLU

86.0

87.3

88.7

HumanEval

88.4

89.0

90.2

MATH

77.0

73.8

76.6

多语言

91.1

91.6

-

GPU 要求

配置
显存
性能
成本

Q4 量化

40GB

A100 40GB(裸机)

Q8 量化

70GB

更好

A100 80GB(裸机)

FP16 全精度

140GB

最佳

2x A100 80GB (裸机)

推荐: 使用带 Q4 量化的 A100 40GB,以获得最佳性价比。

在 CLORE.AI 上快速部署

使用 Ollama(最简单)

Docker 镜像:

端口:

部署后:

使用 vLLM(生产环境)

Docker 镜像:

端口:

命令:

访问你的服务

部署后,找到你的 http_pub URL 在 我的订单:

  1. 前往 我的订单 页面

  2. 点击你的订单

  3. 找到 http_pub URL(例如, abc123.clorecloud.net)

使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。

安装方法

方法 1:Ollama(推荐用于测试)

API 用法:

方法 2:vLLM(生产环境)

API 用法(与 OpenAI 兼容):

方法 3:Transformers + bitsandbytes

方法 4:llama.cpp(CPU+GPU 混合)

基准

吞吐量(令牌/秒)

GPU
Q4
Q8
FP16

A100 40GB

25-30

-

-

A100 80GB

35-40

25-30

-

2x A100 80GB

50-60

40-45

30-35

H100 80GB

60-70

45-50

35-40

首个 token 时间(TTFT)

GPU
Q4
FP16

A100 40GB

0.8-1.2 秒

-

A100 80GB

0.6-0.9 秒

-

2x A100 80GB

0.4-0.6 秒

0.8-1.0 秒

上下文长度与显存占用

上下文
Q4 显存
Q8 显存

4K

38GB

72GB

8K

40GB

75GB

16K

44GB

80GB

32K

52GB

90GB

64K

68GB

110GB

128K

100GB

150GB

应用场景

代码生成

文档分析(长上下文)

多语言任务

推理与分析

优化提示

内存优化

速度优化

批量处理

与其他模型对比

功能
Llama 3.3 70B
Llama 3.1 70B
Qwen 2.5 72B
Mixtral 8x22B

MMLU

86.0

83.6

85.3

77.8

编程

88.4

80.5

85.4

75.5

数学

77.0

68.0

80.0

60.0

上下文

128K

128K

128K

64K

语言

8

8

29

8

许可证

打开

打开

打开

打开

结论: Llama 3.3 70B 在同类模型中提供了最佳的整体性能,尤其适合编程和推理任务。

故障排查

内存不足

首次响应较慢

  • 第一次请求会将模型加载到 GPU——需等待 30-60 秒

  • 使用 --enable-prefix-caching 用于后续更快的请求

  • 使用空请求预热

Hugging Face 访问

成本估算

配置
GPU
美元/小时
令牌/美元

预算

A100 40GB(Q4)

~$0.17

~530K

均衡

A100 80GB(Q4)

~$0.25

~500K

性能

2x A100 80GB

~$0.50

~360K

最大值

H100 80GB

~$0.50

~500K

下一步

最后更新于

这有帮助吗?