Llama 3.2 Vision
在 Clore.ai 上运行 Meta 的 Llama 3.2 Vision 进行图像理解
在 CLORE.AI GPU 上运行 Meta 的多模态 Llama 3.2 Vision 模型进行图像理解。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
为什么选择 Llama 3.2 Vision?
多模态 - 同时理解文本和图像
多种尺寸 - 11B 和 90B 参数版本
多用途 - OCR、视觉问答、图像描述、文档分析
开源权重 - Meta 完全开源
Llama 生态系统 - 兼容 Ollama、vLLM、transformers
模型变体
Llama-3.2-11B-Vision
11B
24GB
128K
通用用途,单 GPU
Llama-3.2-90B-Vision
90B
180GB
128K
最高质量
Llama-3.2-11B-Vision-Instruct
11B
24GB
128K
聊天/助手
Llama-3.2-90B-Vision-Instruct
90B
180GB
128K
生产环境
在 CLORE.AI 上快速部署
Docker 镜像:
端口:
命令:
访问你的服务
部署后,找到你的 http_pub URL 在 我的订单:
前往 我的订单 页面
点击你的订单
找到
http_pubURL(例如,abc123.clorecloud.net)
使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。
硬件要求
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
11B 视觉版
RTX 4090 24GB
A100 40GB
A100 80GB
90B 视觉版
4x A100 40GB
4x A100 80GB
8x H100
安装
使用 Ollama(最简单)
使用 vLLM
使用 Transformers
基础用法
图像理解
使用 Ollama
使用 vLLM API
应用场景
OCR / 文本提取
文档分析
视觉问答
图像描述
截图代码
多张图片
批量处理
Gradio 界面
性能
单张图片描述
11B
RTX 4090
~3s
单张图片描述
11B
A100 40GB
~2s
OCR(1 页)
11B
RTX 4090
约 5 秒
文档分析
11B
A100 40GB
~8s
批量(10张图片)
11B
A100 40GB
~25 秒
量化
使用 bitsandbytes 的 4 位量化
Ollama 的 GGUF 格式
成本估算
CLORE.AI 市场的典型费率:
RTX 4090 24GB
~$0.10
11B 模型
A100 40GB
~$0.17
具有长上下文的 11B
A100 80GB
~$0.25
11B 最优
4x A100 80GB
~$1.00
90B 模型
价格会有所不同。请查看 CLORE.AI 市场 以获取当前费率。
节省费用:
使用 竞价 批处理顺序
使用 CLORE 代币支付
开发时使用量化模型(4 位)
故障排查
内存不足
生成缓慢
确保正在使用 GPU(检查
nvidia-smi)使用 bfloat16 而不是 float32
在处理前降低图片分辨率
使用 vLLM 以获得更高吞吐量
图片未加载
需要 HuggingFace 令牌
Llama Vision 与其他模型对比
参数
11B / 90B
7B / 34B
未知
开源
是
是
否
OCR 质量
优秀
好
优秀
上下文
128K
32K
128K
多图像
是
有限
是
许可证
Llama 3.2
Apache 2.0
专有
在以下情况使用 Llama 3.2 Vision:
需要开源多模态
OCR 和文档分析
与 Llama 生态系统集成
长上下文理解
下一步
LLaVA - 替代视觉模型
Florence-2 - 微软的视觉模型
Ollama - 易于部署
vLLM - 生产环境服务
最后更新于
这有帮助吗?