For the complete documentation index, see llms.txt. This page is also available as Markdown.

Llama 3.2 Vision

Ejecuta Llama 3.2 Vision de Meta para comprensión de imágenes en Clore.ai

Ejecuta los modelos multimodales Llama 3.2 Vision de Meta para la comprensión de imágenes en GPUs de CLORE.AI.

¿Por qué Llama 3.2 Vision?

  • Multimodal - Entiende tanto texto como imágenes

  • Múltiples tamaños - Versiones de parámetros 11B y 90B

  • Versátil - OCR, QA visual, descripción de imágenes, análisis de documentos

  • Pesos abiertos - Completamente de código abierto de Meta

  • Ecosistema Llama - Compatible con Ollama, vLLM, transformers

Variantes del modelo

Modelo
Parámetros
VRAM (FP16)
Contexto
Ideal para

Llama-3.2-11B-Vision

11B

24GB

128K

Uso general, una sola GPU

Llama-3.2-90B-Vision

90B

180GB

128K

Máxima calidad

Llama-3.2-11B-Vision-Instruct

11B

24GB

128K

Chat/asistente

Llama-3.2-90B-Vision-Instruct

90B

180GB

128K

Producción

Despliegue rápido en CLORE.AI

Imagen de Docker:

Puertos:

Comando:

Accediendo a tu servicio

Después del despliegue, encuentra tu http_pub URL en Mis pedidos:

  1. Ve a Mis pedidos página

  2. Haz clic en tu pedido

  3. Encuentra la http_pub URL (p. ej., abc123.clorecloud.net)

Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.

Requisitos de hardware

Modelo
GPU mínima
Recomendado
Óptimo

11B Vision

RTX 4090 24GB

A100 40GB

A100 80GB

90B Vision

4x A100 40GB

4x A100 80GB

8x H100

Instalación

Usando Ollama (lo más fácil)

Usando vLLM

Usando Transformers

Uso básico

Comprensión de imágenes

Con Ollama

Con la API de vLLM

Casos de uso

OCR / Extracción de texto

Análisis de documentos

Respuesta a preguntas visuales

Generación de subtítulos de imagen

Código a partir de capturas de pantalla

Múltiples imágenes

Procesamiento por lotes

Interfaz de Gradio

Rendimiento

Tarea
Modelo
GPU
Tiempo

Descripción de una sola imagen

11B

RTX 4090

~3s

Descripción de una sola imagen

11B

A100 40GB

~2s

OCR (1 página)

11B

RTX 4090

~5 s

Análisis de documentos

11B

A100 40GB

~8s

Lote (10 imágenes)

11B

A100 40GB

~25 s

Cuantización

4 bits con bitsandbytes

GGUF con Ollama

Estimación de costos

Tarifas típicas del mercado de CLORE.AI:

GPU
Tarifa por hora
Ideal para

RTX 4090 24GB

~$0.10

modelo 11B

A100 40GB

~$0.17

11B con contexto largo

A100 80GB

~$0.25

11B óptimo

4x A100 80GB

~$1.00

modelo 90B

Los precios varían. Consulta Marketplace de CLORE.AI las tarifas actuales.

Ahorra dinero:

  • Usa Spot órdenes para procesamiento por lotes

  • Paga con CLORE tokens

  • Usa modelos cuantizados (4 bits) para desarrollo

Solución de problemas

Sin memoria

Generación lenta

  • Asegúrate de que se esté usando la GPU (comprueba nvidia-smi)

  • Usa bfloat16 en lugar de float32

  • Reduce la resolución de la imagen antes de procesarla

  • Usa vLLM para obtener un mejor rendimiento

La imagen no se carga

Se requiere token de HuggingFace

Llama Vision frente a otros

Función
Llama 3.2 Vision
LLaVA 1.6
GPT-4V

Parámetros

11B / 90B

7B / 34B

Desconocido

Código abierto

No

Calidad de OCR

Excelente

Bueno

Excelente

Contexto

128K

32K

128K

Múltiples imágenes

Limitado

Licencia

Llama 3.2

Apache 2.0

Propietario

Usa Llama 3.2 Vision cuando:

  • Necesitas multimodal de código abierto

  • OCR y análisis de documentos

  • Integración con el ecosistema Llama

  • Comprensión de contexto largo

Siguientes pasos

  • LLaVA - Modelo de visión alternativo

  • Florence-2 - Modelo de visión de Microsoft

  • Ollama - Despliegue fácil

  • vLLM - Servicio en producción

Última actualización

¿Te fue útil?