Modelo de lenguaje y visión Qwen2.5-VL
Ejecuta Qwen2.5-VL, el modelo abierto líder de visión-lenguaje, para comprensión de imágenes/video/documentos en las GPU de Clore.ai.
Características clave
Requisitos
Componente
3B
7B
72B
Inicio rápido
Opción A: Ollama (La más simple)
Opción B: Python / Transformers
Ejemplos de uso
Comprensión de imágenes con Transformers
Análisis de video
OCR y extracción de documentos
API de Ollama para procesamiento por lotes
Consejos para usuarios de Clore.ai
Solución de problemas
Problema
Solucionar
Última actualización
¿Te fue útil?