For the complete documentation index, see llms.txt. This page is also available as Markdown.

Llama 3.2 Vision

在 Clore.ai 上运行 Meta 的 Llama 3.2 Vision 进行图像理解

在 CLORE.AI GPU 上运行 Meta 的多模态 Llama 3.2 Vision 模型进行图像理解。

为什么选择 Llama 3.2 Vision?

  • 多模态 - 同时理解文本和图像

  • 多种尺寸 - 11B 和 90B 参数版本

  • 多用途 - OCR、视觉问答、图像描述、文档分析

  • 开源权重 - Meta 完全开源

  • Llama 生态系统 - 兼容 Ollama、vLLM、transformers

模型变体

模型
参数
显存(FP16)
上下文
最适合

Llama-3.2-11B-Vision

11B

24GB

128K

通用用途,单 GPU

Llama-3.2-90B-Vision

90B

180GB

128K

最高质量

Llama-3.2-11B-Vision-Instruct

11B

24GB

128K

聊天/助手

Llama-3.2-90B-Vision-Instruct

90B

180GB

128K

生产环境

在 CLORE.AI 上快速部署

Docker 镜像:

端口:

命令:

访问你的服务

部署后,找到你的 http_pub URL 在 我的订单:

  1. 前往 我的订单 页面

  2. 点击你的订单

  3. 找到 http_pub URL(例如, abc123.clorecloud.net)

使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。

硬件要求

模型
最低 GPU
推荐
最佳

11B 视觉版

RTX 4090 24GB

A100 40GB

A100 80GB

90B 视觉版

4x A100 40GB

4x A100 80GB

8x H100

安装

使用 Ollama(最简单)

使用 vLLM

使用 Transformers

基础用法

图像理解

使用 Ollama

使用 vLLM API

应用场景

OCR / 文本提取

文档分析

视觉问答

图像描述

截图代码

多张图片

批量处理

Gradio 界面

性能

任务
模型
GPU
时间

单张图片描述

11B

RTX 4090

~3s

单张图片描述

11B

A100 40GB

~2s

OCR(1 页)

11B

RTX 4090

约 5 秒

文档分析

11B

A100 40GB

~8s

批量(10张图片)

11B

A100 40GB

~25 秒

量化

使用 bitsandbytes 的 4 位量化

Ollama 的 GGUF 格式

成本估算

CLORE.AI 市场的典型费率:

GPU
小时费率
最适合

RTX 4090 24GB

~$0.10

11B 模型

A100 40GB

~$0.17

具有长上下文的 11B

A100 80GB

~$0.25

11B 最优

4x A100 80GB

~$1.00

90B 模型

价格会有所不同。请查看 CLORE.AI 市场 以获取当前费率。

节省费用:

  • 使用 竞价 批处理顺序

  • 使用 CLORE 代币支付

  • 开发时使用量化模型(4 位)

故障排查

内存不足

生成缓慢

  • 确保正在使用 GPU(检查 nvidia-smi)

  • 使用 bfloat16 而不是 float32

  • 在处理前降低图片分辨率

  • 使用 vLLM 以获得更高吞吐量

图片未加载

需要 HuggingFace 令牌

Llama Vision 与其他模型对比

功能
Llama 3.2 Vision
LLaVA 1.6
GPT-4V

参数

11B / 90B

7B / 34B

未知

开源

OCR 质量

优秀

优秀

上下文

128K

32K

128K

多图像

有限

许可证

Llama 3.2

Apache 2.0

专有

在以下情况使用 Llama 3.2 Vision:

  • 需要开源多模态

  • OCR 和文档分析

  • 与 Llama 生态系统集成

  • 长上下文理解

下一步

最后更新于

这有帮助吗?