> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-zh/ru-men-zhi-nan/gpu-comparison.md).

# GPU 对比

Clore.ai 上 AI 工作负载的完整 GPU 对比指南

CLORE.AI 上适用于 AI 工作负载的 GPU 完整对比。

{% hint style="success" %}
在以下位置为你的任务找到合适的 GPU： [CLORE.AI 市场](https://clore.ai/marketplace).
{% endhint %}

## 快速推荐

| 你的任务         | 预算之选          | 最佳性价比         | 最高性能          |
| ------------ | ------------- | ------------- | ------------- |
| 与 AI 聊天（7B）  | RTX 3060 12GB | RTX 3090 24GB | RTX 5090 32GB |
| 与 AI 聊天（70B） | RTX 3090 24GB | RTX 5090 32GB | A100 80GB     |
| 图像生成（SD 1.5） | RTX 3060 12GB | RTX 3090 24GB | RTX 5090 32GB |
| 图像生成（SDXL）   | RTX 3090 24GB | RTX 4090 24GB | RTX 5090 32GB |
| 图像生成（FLUX）   | RTX 3090 24GB | RTX 5090 32GB | A100 80GB     |
| 视频生成         | RTX 4090 24GB | RTX 5090 32GB | A100 80GB     |
| 模型训练         | A100 40GB     | A100 80GB     | H100 80GB     |

## 消费级 GPU

### NVIDIA RTX 3060 12GB

**最适合：** 预算型 AI、SD 1.5、小型 LLM

| 规格          | 数值          |
| ----------- | ----------- |
| 显存          | 12GB GDDR6  |
| 显存带宽        | 360 GB/s    |
| FP16 性能     | 12.7 TFLOPS |
| Tensor Core | 112（第 3 代）  |
| TDP         | 170W        |
| \~每小时价格     | $0.02-0.04  |

**能力：**

* ✅ Ollama，支持 7B 模型（Q4）
* ✅ Stable Diffusion 1.5（512x512）
* ✅ SDXL（768x768，较慢）
* ⚠️ FLUX schnell（需 CPU 卸载）
* ❌ 大模型（>13B）
* ❌ 视频生成

***

### NVIDIA RTX 3070/3070 Ti 8GB

**最适合：** SD 1.5、轻量级任务

| 规格          | 数值           |
| ----------- | ------------ |
| 显存          | 8GB GDDR6X   |
| 显存带宽        | 448-608 GB/s |
| FP16 性能     | 20.3 TFLOPS  |
| Tensor Core | 184（第 3 代）   |
| TDP         | 220-290W     |
| \~每小时价格     | $0.02-0.04   |

**能力：**

* ✅ Ollama，支持 7B 模型（Q4）
* ✅ Stable Diffusion 1.5（512x512）
* ⚠️ SDXL（仅低分辨率）
* ❌ FLUX（显存不足）
* ❌ 超过 7B 的模型
* ❌ 视频生成

***

### NVIDIA RTX 3080/3080 Ti 10-12GB

**最适合：** 通用 AI 任务，均衡性好

| 规格          | 数值               |
| ----------- | ---------------- |
| 显存          | 10-12GB GDDR6X   |
| 显存带宽        | 760-912 GB/s     |
| FP16 性能     | 29.8-34.1 TFLOPS |
| Tensor Core | 272-320（第 3 代）   |
| TDP         | 320-350W         |
| \~每小时价格     | $0.04-0.06       |

**能力：**

* ✅ Ollama，支持 13B 模型
* ✅ Stable Diffusion 1.5/2.1
* ✅ SDXL（1024x1024）
* ⚠️ FLUX schnell（需卸载）
* ❌ 大模型（>13B）
* ❌ 视频生成

***

### NVIDIA RTX 3090/3090 Ti 24GB

**最适合：** SDXL、13B-30B LLM、ControlNet

| 规格          | 数值          |
| ----------- | ----------- |
| 显存          | 24GB GDDR6X |
| 显存带宽        | 936 GB/s    |
| FP16 性能     | 35.6 TFLOPS |
| Tensor Core | 328（第 3 代）  |
| TDP         | 350-450W    |
| \~每小时价格     | $0.05-0.08  |

**能力：**

* ✅ Ollama，支持 30B 模型
* ✅ vLLM，支持 13B 模型
* ✅ 所有 Stable Diffusion 模型
* ✅ SDXL + ControlNet
* ✅ FLUX schnell（1024x1024）
* ⚠️ FLUX dev（需卸载）
* ⚠️ 视频（短片段）

***

### NVIDIA RTX 4070 Ti 12GB

**最适合：** 快速 SD 1.5，高效推理

| 规格          | 数值          |
| ----------- | ----------- |
| 显存          | 12GB GDDR6X |
| 显存带宽        | 504 GB/s    |
| FP16 性能     | 40.1 TFLOPS |
| Tensor Core | 184（第 4 代）  |
| TDP         | 285W        |
| \~每小时价格     | $0.04-0.06  |

**能力：**

* ✅ Ollama，支持 7B 模型（快速）
* ✅ Stable Diffusion 1.5（非常快）
* ✅ SDXL（768x768）
* ⚠️ FLUX schnell（分辨率受限）
* ❌ 大模型（>13B）
* ❌ 视频生成

***

### NVIDIA RTX 4080 16GB

**最适合：** SDXL 生产级、13B LLM

| 规格          | 数值          |
| ----------- | ----------- |
| 显存          | 16GB GDDR6X |
| 显存带宽        | 717 GB/s    |
| FP16 性能     | 48.7 TFLOPS |
| Tensor Core | 304（第 4 代）  |
| TDP         | 320W        |
| \~每小时价格     | $0.06-0.09  |

**能力：**

* ✅ Ollama，支持 13B 模型（快速）
* ✅ vLLM，支持 7B 模型
* ✅ 所有 Stable Diffusion 模型
* ✅ SDXL + ControlNet
* ✅ FLUX schnell（1024x1024）
* ⚠️ FLUX dev（受限）
* ⚠️ 短视频片段

***

### NVIDIA RTX 4090 24GB

**最适合：** 高端消费级性能、FLUX、视频

| 规格          | 数值          |
| ----------- | ----------- |
| 显存          | 24GB GDDR6X |
| 显存带宽        | 1008 GB/s   |
| FP16 性能     | 82.6 TFLOPS |
| Tensor Core | 512（第 4 代）  |
| TDP         | 450W        |
| \~每小时价格     | $0.08-0.12  |

**能力：**

* ✅ Ollama，支持 30B 模型（快速）
* ✅ vLLM，支持 13B 模型
* ✅ 所有图像生成模型
* ✅ FLUX dev（1024x1024）
* ✅ 视频生成（短）
* ✅ AnimateDiff
* ⚠️ 70B 模型（仅 Q4）

***

### NVIDIA RTX 5080 16GB *（新品 — 2025 年 2 月）*

**最适合：** 高速 SDXL/FLUX、13B-30B LLM、高性能中端

| 规格               | 数值          |
| ---------------- | ----------- |
| 显存               | 16GB GDDR7  |
| 显存带宽             | 960 GB/s    |
| FP16 性能          | \~80 TFLOPS |
| Tensor Core      | 336（第 5 代）  |
| TDP              | 360W        |
| \~Clore.ai 每小时价格 | $1.50-2.00  |

**能力：**

* ✅ Ollama，支持 13B 模型（快速）
* ✅ vLLM，支持 13B 模型
* ✅ 所有 Stable Diffusion 模型
* ✅ SDXL + ControlNet（非常快）
* ✅ FLUX schnell/dev（1024x1024）
* ✅ 短视频片段
* ⚠️ 30B 模型（仅 Q4）
* ❌ 70B 模型

***

### NVIDIA RTX 5090 32GB *（旗舰 — 2025 年 2 月）*

**最适合：** 消费级最高性能、70B 模型、高分辨率视频生成

| 规格               | 数值           |
| ---------------- | ------------ |
| 显存               | 32GB GDDR7   |
| 显存带宽             | 1792 GB/s    |
| FP16 性能          | \~120 TFLOPS |
| Tensor Core      | 680（第 5 代）   |
| TDP              | 575W         |
| \~Clore.ai 每小时价格 | $3.00-4.00   |

**能力：**

* ✅ Ollama，支持 70B 模型（Q4，快速）
* ✅ vLLM，支持 30B 模型
* ✅ 所有图像生成模型
* ✅ FLUX dev（1536x1536）
* ✅ 视频生成（较长片段）
* ✅ AnimateDiff + ControlNet
* ✅ 模型训练（LoRA、小规模微调）
* ✅ DeepSeek-R1 32B 蒸馏版（FP16）

## 专业级/数据中心 GPU

{% hint style="warning" %}
**Clore.ai 市场上未列出多 GPU 的 80GB 级机型。** 目前列出的最大配置是 4× RTX PRO 6000 Blackwell（每张 96GB，共 380GB）以及 8–11× RTX 5090（每张 32GB）。A100 / H200 / B200 容量可按 [裸机](https://clore.ai/bare-metal) 需求提供。部署前请查看 [GPU 价格与可用性](/guides/guides_v2-zh/ru-men-zhi-nan/pricing.md) 。
{% endhint %}

### NVIDIA A100 40GB

**最适合：** 生产级 LLM、训练、大模型

| 规格          | 数值           |
| ----------- | ------------ |
| 显存          | 40GB HBM2e   |
| 显存带宽        | 1555 GB/s    |
| FP16 性能     | 77.97 TFLOPS |
| Tensor Core | 432（第 3 代）   |
| TDP         | 400W         |
| \~每小时价格     | $0.15-0.20   |

**能力：**

* ✅ Ollama，支持 70B 模型（Q4）
* ✅ vLLM 生产服务
* ✅ 所有图像生成
* ✅ FLUX dev（高质量）
* ✅ 视频生成
* ✅ 模型微调
* ⚠️ 70B FP16（较紧张）

***

### NVIDIA A100 80GB

**最适合：** 70B+ 模型、视频、生产工作负载

| 规格          | 数值           |
| ----------- | ------------ |
| 显存          | 80GB HBM2e   |
| 显存带宽        | 2039 GB/s    |
| FP16 性能     | 77.97 TFLOPS |
| Tensor Core | 432（第 3 代）   |
| TDP         | 400W         |
| \~每小时价格     | $0.20-0.30   |

**能力：**

* ✅ 支持所有最高至 70B 的 LLM（FP16）
* ✅ vLLM 高吞吐服务
* ✅ 所有图像生成
* ✅ 长视频生成
* ✅ 模型训练
* ✅ DeepSeek-V3（部分）
* ⚠️ 100B+ 模型

***

### NVIDIA H100 80GB

**最适合：** 最高性能，最大模型

| 规格          | 数值         |
| ----------- | ---------- |
| 显存          | 80GB HBM3  |
| 显存带宽        | 3350 GB/s  |
| FP16 性能     | 267 TFLOPS |
| Tensor Core | 528（第 4 代） |
| TDP         | 700W       |
| \~每小时价格     | $0.40-0.60 |

**能力：**

* ✅ 所有模型都以最高速度运行
* ✅ 100B+ 参数模型
* ✅ 多模型服务
* ✅ 大规模训练
* ✅ 实时视频生成
* ✅ DeepSeek-V3（671B）

## 性能对比

### LLM 推理（tokens/秒）

| GPU           | Llama 3 8B | Llama 3 70B | Mixtral 8x7B | Clore.ai 美元/小时 |
| ------------- | ---------- | ----------- | ------------ | -------------- |
| RTX 3060 12GB | 25         | -           | -            | $0.02-0.04     |
| RTX 3090 24GB | 45         | 8\*         | 20\*         | $0.15-0.25     |
| RTX 4090 24GB | 80         | 15\*        | 35\*         | $0.35-0.55     |
| RTX 5080 16GB | 95         | -           | 40\*         | $1.50-2.00     |
| RTX 5090 32GB | 150        | 30\*        | 65\*         | $3.00-4.00     |
| A100 40GB     | 100        | 25          | 45           | $0.80-1.20     |
| A100 80GB     | 110        | 40          | 55           | $1.20-1.80     |
| H100 80GB     | 180        | 70          | 90           | $2.50-3.50     |

\*使用量化（Q4/Q8）

### 图像生成速度

| GPU           | SD 1.5（512） | SDXL（1024） | FLUX schnell | Clore.ai 美元/小时 |
| ------------- | ----------- | ---------- | ------------ | -------------- |
| RTX 3060 12GB | 4 秒         | 15 秒       | 25 秒\*       | $0.02-0.04     |
| RTX 3090 24GB | 2 秒         | 7 秒        | 12 秒         | $0.15-0.25     |
| RTX 4090 24GB | 1 秒         | 3 秒        | 5 秒          | $0.35-0.55     |
| RTX 5080 16GB | 0.8 秒       | 2.5 秒      | 4 秒          | $1.50-2.00     |
| RTX 5090 32GB | 0.6 秒       | 1.8 秒      | 3 秒          | $3.00-4.00     |
| A100 40GB     | 1.5 秒       | 4 秒        | 6 秒          | $0.80-1.20     |
| A100 80GB     | 1.5 秒       | 4 秒        | 5 秒          | $1.20-1.80     |

\*使用 CPU 卸载，分辨率较低

### 视频生成（5 秒片段）

| GPU           | SVD    | Wan2.1 | Hunyuan |
| ------------- | ------ | ------ | ------- |
| RTX 3090 24GB | 3 分钟   | 5 分钟\* | -       |
| RTX 4090 24GB | 1.5 分钟 | 3 分钟   | 8 分钟\*  |
| RTX 5090 32GB | 1 分钟   | 2 分钟   | 5 分钟    |
| A100 40GB     | 1 分钟   | 2 分钟   | 5 分钟    |
| A100 80GB     | 45 秒   | 1.5 分钟 | 3 分钟    |

\*分辨率受限

## 性价比

### 各任务最佳价值

**聊天/LLM（7B-13B 模型）：**

1. 🥇 RTX 3090 24GB - 最佳性价比
2. 🥈 RTX 3060 12GB - 最低成本
3. 🥉 RTX 4090 24GB - 最快

**图像生成（SDXL/FLUX）：**

1. 🥇 RTX 3090 24GB - 极佳平衡
2. 🥈 RTX 4090 24GB - 快 2 倍
3. 🥉 A100 40GB - 生产稳定性

**大模型（70B+）：**

1. 🥇 A100 40GB - 70B 的最佳性价比
2. 🥈 A100 80GB - 全精度
3. 🥉 RTX 4090 24GB - 预算选项（仅 Q4）

**视频生成：**

1. 🥇 A100 40GB - 均衡性好
2. 🥈 RTX 4090 24GB - 消费级选项
3. 🥉 A100 80GB - 最长片段

**模型训练：**

1. 🥇 A100 40GB - 标准选择
2. 🥈 A100 80GB - 大模型
3. 🥉 RTX 4090 24GB - 小模型/LoRA

## 多 GPU 配置

某些任务会受益于多 GPU：

| 配置           | 使用场景                   | 总显存   |
| ------------ | ---------------------- | ----- |
| 2x RTX 3090  | 70B 推理                 | 48GB  |
| 2x RTX 4090  | 快速 70B、训练              | 48GB  |
| 2× RTX 5090  | 70B FP16，快速训练          | 64GB  |
| 4× RTX 5090  | 100B+ 模型               | 128GB |
| 4× A100 40GB | 100B+ 模型               | 160GB |
| 8x A100 80GB | DeepSeek-V3、Llama 405B | 640GB |

## 选择你的 GPU

### 决策流程图

```
你的主要任务是什么？
│
├─ 聊天/LLM
│  ├─ 模型大小？
│  │  ├─ ≤7B → RTX 3060（$0.03–0.07/小时）
│  │  ├─ 7B-30B → RTX 3090（$0.07–0.21/小时）
│  │  ├─ 30B-70B → RTX 5090 32GB 或 2× RTX 4090
│  │  └─ 70B+ → RTX PRO 6000 96GB 或 2× RTX 5090
│
├─ 图像生成
│  ├─ 模型？
│  │  ├─ SD 1.5 → RTX 3060（$0.03–0.07/小时）
│  │  ├─ SDXL → RTX 3090（$0.07–0.21/小时）
│  │  └─ FLUX → RTX 4090（$0.14–0.42/小时）
│
├─ 视频生成
│  ├─ 时长？
│  │  ├─ 短（2-5 秒）→ RTX 4090（$0.14–0.42/小时）
│  │  └─ 更长 → 2× RTX 4090 或 RTX PRO 6000
│
└─ 训练
   ├─ LoRA/小型 → RTX 4090（$0.14–0.42/小时）
   └─ 全量微调 → 2× RTX 4090 或 RTX PRO 6000
```

## 省钱技巧

1. **使用抢占式订单** - 服务器的抢占式价格大约比按需价格低三分之一，中位数约便宜 13%
2. **先从小规模开始** - 先在更便宜的 GPU 上测试
3. **量化模型** - Q4/Q8 可让更大的模型占用更少显存
4. **批量处理** - 一次处理多个请求
5. **非高峰时段** - 可用性更好，有时价格更低

> 📚 另见： [2025 年 AI 训练最便宜的 10 款 GPU](https://blog.clore.ai/top-10-cheapest-gpus-for-ai-training/) | [AI 训练最佳 GPU——详细指南](https://blog.clore.ai/best-gpu-for-ai-training/)

## 下一步

* [模型兼容性矩阵](/guides/guides_v2-zh/ru-men-zhi-nan/model-compatibility.md) - 哪些模型可在哪些 GPU 上运行
* [Docker 镜像目录](/guides/guides_v2-zh/ru-men-zhi-nan/docker-images.md) - 即用型镜像
* [快速入门指南](/guides/guides_v2-zh/quickstart.md) - 5 分钟上手


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-zh/ru-men-zhi-nan/gpu-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
