Llama 3.2 Vision
Ejecuta Llama 3.2 Vision de Meta para comprensión de imágenes en Clore.ai
Ejecuta los modelos multimodales Llama 3.2 Vision de Meta para la comprensión de imágenes en GPUs de CLORE.AI.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
¿Por qué Llama 3.2 Vision?
Multimodal - Entiende tanto texto como imágenes
Múltiples tamaños - Versiones de parámetros 11B y 90B
Versátil - OCR, QA visual, descripción de imágenes, análisis de documentos
Pesos abiertos - Completamente de código abierto de Meta
Ecosistema Llama - Compatible con Ollama, vLLM, transformers
Variantes del modelo
Llama-3.2-11B-Vision
11B
24GB
128K
Uso general, una sola GPU
Llama-3.2-90B-Vision
90B
180GB
128K
Máxima calidad
Llama-3.2-11B-Vision-Instruct
11B
24GB
128K
Chat/asistente
Llama-3.2-90B-Vision-Instruct
90B
180GB
128K
Producción
Despliegue rápido en CLORE.AI
Imagen de Docker:
Puertos:
Comando:
Accediendo a tu servicio
Después del despliegue, encuentra tu http_pub URL en Mis pedidos:
Ve a Mis pedidos página
Haz clic en tu pedido
Encuentra la
http_pubURL (p. ej.,abc123.clorecloud.net)
Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.
Requisitos de hardware
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
11B Vision
RTX 4090 24GB
A100 40GB
A100 80GB
90B Vision
4x A100 40GB
4x A100 80GB
8x H100
Instalación
Usando Ollama (lo más fácil)
Usando vLLM
Usando Transformers
Uso básico
Comprensión de imágenes
Con Ollama
Con la API de vLLM
Casos de uso
OCR / Extracción de texto
Análisis de documentos
Respuesta a preguntas visuales
Generación de subtítulos de imagen
Código a partir de capturas de pantalla
Múltiples imágenes
Procesamiento por lotes
Interfaz de Gradio
Rendimiento
Descripción de una sola imagen
11B
RTX 4090
~3s
Descripción de una sola imagen
11B
A100 40GB
~2s
OCR (1 página)
11B
RTX 4090
~5 s
Análisis de documentos
11B
A100 40GB
~8s
Lote (10 imágenes)
11B
A100 40GB
~25 s
Cuantización
4 bits con bitsandbytes
GGUF con Ollama
Estimación de costos
Tarifas típicas del mercado de CLORE.AI:
RTX 4090 24GB
~$0.10
modelo 11B
A100 40GB
~$0.17
11B con contexto largo
A100 80GB
~$0.25
11B óptimo
4x A100 80GB
~$1.00
modelo 90B
Los precios varían. Consulta Marketplace de CLORE.AI las tarifas actuales.
Ahorra dinero:
Usa Spot órdenes para procesamiento por lotes
Paga con CLORE tokens
Usa modelos cuantizados (4 bits) para desarrollo
Solución de problemas
Sin memoria
Generación lenta
Asegúrate de que se esté usando la GPU (comprueba
nvidia-smi)Usa bfloat16 en lugar de float32
Reduce la resolución de la imagen antes de procesarla
Usa vLLM para obtener un mejor rendimiento
La imagen no se carga
Se requiere token de HuggingFace
Llama Vision frente a otros
Parámetros
11B / 90B
7B / 34B
Desconocido
Código abierto
Sí
Sí
No
Calidad de OCR
Excelente
Bueno
Excelente
Contexto
128K
32K
128K
Múltiples imágenes
Sí
Limitado
Sí
Licencia
Llama 3.2
Apache 2.0
Propietario
Usa Llama 3.2 Vision cuando:
Necesitas multimodal de código abierto
OCR y análisis de documentos
Integración con el ecosistema Llama
Comprensión de contexto largo
Siguientes pasos
LLaVA - Modelo de visión alternativo
Florence-2 - Modelo de visión de Microsoft
Ollama - Despliegue fácil
vLLM - Servicio en producción
Última actualización
¿Te fue útil?