Florence-2
Microsoft Florence-2 para subtitulado, detección y segmentación
El potente modelo de visión de Microsoft para subtítulos, detección, segmentación y más.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Alquilar en CLORE.AI
Visita Marketplace de CLORE.AI
Filtra por tipo de GPU, VRAM y precio
Elige Bajo demanda (tarifa fija) o Spot (precio ofertado)
Configura tu pedido:
Selecciona la imagen de Docker
Configura los puertos (TCP para SSH, HTTP para interfaces web)
Añade variables de entorno si es necesario
Introduce el comando de inicio
Selecciona el método de pago: CLORE, BTC, o USDT/USDC
Crea el pedido y espera al despliegue
Accede a tu servidor
Encuentra los detalles de conexión en Mis pedidos
Interfaces web: Usa la URL del puerto HTTP
SSH:
ssh -p <port> root@<proxy-address>
¿Qué es Florence-2?
Florence-2 de Microsoft es un modelo fundacional de visión que maneja:
Generación de subtítulos de imagen (breves y detallados)
Detección y localización de objetos
Generación de subtítulos de regiones densas
Comprensión de expresiones de referencia
OCR y reconocimiento de texto
Respuesta a preguntas visuales
Recursos
HuggingFace: microsoft/Florence-2-large
Artículo: Documento de Florence-2
GitHub: microsoft/Florence-2
Demo: Espacio de Hugging Face
Hardware recomendado
GPU
RTX 3060 12GB
RTX 4080 16GB
RTX 4090 24GB
VRAM
8GB
12GB
16GB
CPU
4 núcleos
8 núcleos
16 núcleos
RAM
16GB
32GB
64GB
Almacenamiento
30GB SSD
50GB NVMe
100GB NVMe
Internet
100 Mbps
500 Mbps
1 Gbps
Despliegue rápido en CLORE.AI
Imagen de Docker:
Puertos:
Comando:
Accediendo a tu servicio
Después del despliegue, encuentra tu http_pub URL en Mis pedidos:
Ve a Mis pedidos página
Haz clic en tu pedido
Encuentra la
http_pubURL (p. ej.,abc123.clorecloud.net)
Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.
Instalación
Lo que puedes crear
Análisis de contenido
Generar automáticamente descripciones de imágenes
Extraer texto de imágenes (OCR)
Analizar contenido visual a escala
Anotación de datos
Etiquetar automáticamente conjuntos de datos con subtítulos
Generar cajas delimitadoras para objetos
Crear anotaciones densas
Accesibilidad
Generar texto alternativo para imágenes
Describir imágenes para personas con discapacidad visual
Crear descripciones de audio
Búsqueda y descubrimiento
Indexar imágenes por contenido
Crear sistemas de búsqueda visual
Moderación de contenido
Procesamiento de documentos
Extraer texto de documentos
Comprender gráficos y diagramas
Procesar materiales escaneados
Uso básico
Generación de subtítulos de imagen
Detección de objetos
OCR (reconocimiento de texto)
Generación de subtítulos de regiones densas
Comprensión de expresiones de referencia
Encuentra objetos basados en descripciones de texto:
Todas las tareas disponibles
Procesamiento por lotes
Interfaz de Gradio
Rendimiento
Subtítulo
768x768
RTX 3090
200 ms
Subtítulo
768x768
RTX 4090
120 ms
Detección de objetos
768x768
RTX 4090
150 ms
OCR
768x768
RTX 4090
180 ms
Subtítulo denso
768x768
A100
100 ms
Variantes del modelo
Florence-2-base
232 M
4GB
Rápido
Florence-2-large
771 M
8GB
Medio
Florence-2-base-ft
232 M
4GB
Rápido
Florence-2-large-ft
771 M
8GB
Medio
Problemas comunes y soluciones
Sin memoria
Problema: error de memoria CUDA OOM
Soluciones:
Inferencia lenta
Problema: El procesamiento tarda demasiado
Soluciones:
Usa Florence-2-base para una inferencia más rápida
Instala flash-attention para acelerar
Agrupa varias imágenes juntas
Usa una GPU A100 para producción
Resultados de OCR deficientes
Problema: El reconocimiento de texto es inexacto
Soluciones:
Asegúrate de que la imagen tenga alta resolución (al menos 768 px)
Usa
<OCR_WITH_REGION>para una mejor localizaciónPreprocesa: mejora el contraste, endereza la imagen
Recorta las regiones de texto antes del OCR
La detección omite objetos
Problema: Los objetos no se detectan
Soluciones:
Usa
<DENSE_REGION_CAPTION>para más regionesPrueba
<OPEN_VOCABULARY_DETECTION>con etiquetas específicasCombínalo con GroundingDINO para objetos específicos
Solución de problemas
La tarea no funciona
Comprueba la sintaxis exacta del nombre de la tarea
Algunas tareas necesitan un formato de entrada específico
Verifica que la versión del modelo coincida con la tarea
Formato de salida inesperado
Las distintas tareas devuelven formatos diferentes
Analiza la salida según el tipo de tarea
Consulta la documentación para ver las salidas de la tarea
Problemas de memoria CUDA
Florence-2-large necesita ~8 GB de VRAM
Usa Florence-2-base para menos memoria
Activa el checkpointing de gradiente
Procesamiento lento
Usa inferencia por lotes cuando sea posible
Habilita el modo FP16
Considera la optimización con TensorRT
Estimación de costos
Tarifas típicas del marketplace de CLORE.AI (a partir de 2024):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
Los precios varían según el proveedor y la demanda. Consulta Marketplace de CLORE.AI las tarifas actuales.
Ahorra dinero:
Usa el Spot mercado para trabajo interrumpible — alrededor de un tercio de los servidores fija el precio spot por debajo del precio bajo demanda (mediana de ~13% de descuento), el resto lo iguala
Paga con CLORE tokens
Compara precios entre distintos proveedores
Siguientes pasos
LLaVA - Chat visual y preguntas y respuestas
GroundingDINO - Detección sin ejemplos previos
SAM2 - Segmentar objetos detectados
Última actualización
¿Te fue útil?