For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence-2

Microsoft Florence-2 para subtitulado, detección y segmentación

El potente modelo de visión de Microsoft para subtítulos, detección, segmentación y más.

Todos los ejemplos de esta guía se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI mercado.

Alquilar en CLORE.AI

  1. Filtra por tipo de GPU, VRAM y precio

  2. Elige Bajo demanda (tarifa fija) o Spot (precio ofertado)

  3. Configura tu pedido:

    • Selecciona la imagen de Docker

    • Configura los puertos (TCP para SSH, HTTP para interfaces web)

    • Añade variables de entorno si es necesario

    • Introduce el comando de inicio

  4. Selecciona el método de pago: CLORE, BTC, o USDT/USDC

  5. Crea el pedido y espera al despliegue

Accede a tu servidor

  • Encuentra los detalles de conexión en Mis pedidos

  • Interfaces web: Usa la URL del puerto HTTP

  • SSH: ssh -p <port> root@<proxy-address>

¿Qué es Florence-2?

Florence-2 de Microsoft es un modelo fundacional de visión que maneja:

  • Generación de subtítulos de imagen (breves y detallados)

  • Detección y localización de objetos

  • Generación de subtítulos de regiones densas

  • Comprensión de expresiones de referencia

  • OCR y reconocimiento de texto

  • Respuesta a preguntas visuales

Recursos

Hardware recomendado

Componente
Mínimo
Recomendado
Óptimo

GPU

RTX 3060 12GB

RTX 4080 16GB

RTX 4090 24GB

VRAM

8GB

12GB

16GB

CPU

4 núcleos

8 núcleos

16 núcleos

RAM

16GB

32GB

64GB

Almacenamiento

30GB SSD

50GB NVMe

100GB NVMe

Internet

100 Mbps

500 Mbps

1 Gbps

Despliegue rápido en CLORE.AI

Imagen de Docker:

Puertos:

Comando:

Accediendo a tu servicio

Después del despliegue, encuentra tu http_pub URL en Mis pedidos:

  1. Ve a Mis pedidos página

  2. Haz clic en tu pedido

  3. Encuentra la http_pub URL (p. ej., abc123.clorecloud.net)

Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.

Instalación

Lo que puedes crear

Análisis de contenido

  • Generar automáticamente descripciones de imágenes

  • Extraer texto de imágenes (OCR)

  • Analizar contenido visual a escala

Anotación de datos

  • Etiquetar automáticamente conjuntos de datos con subtítulos

  • Generar cajas delimitadoras para objetos

  • Crear anotaciones densas

Accesibilidad

  • Generar texto alternativo para imágenes

  • Describir imágenes para personas con discapacidad visual

  • Crear descripciones de audio

Búsqueda y descubrimiento

  • Indexar imágenes por contenido

  • Crear sistemas de búsqueda visual

  • Moderación de contenido

Procesamiento de documentos

  • Extraer texto de documentos

  • Comprender gráficos y diagramas

  • Procesar materiales escaneados

Uso básico

Generación de subtítulos de imagen

Detección de objetos

OCR (reconocimiento de texto)

Generación de subtítulos de regiones densas

Comprensión de expresiones de referencia

Encuentra objetos basados en descripciones de texto:

Todas las tareas disponibles

Procesamiento por lotes

Interfaz de Gradio

Rendimiento

Tarea
Resolución
GPU
Velocidad

Subtítulo

768x768

RTX 3090

200 ms

Subtítulo

768x768

RTX 4090

120 ms

Detección de objetos

768x768

RTX 4090

150 ms

OCR

768x768

RTX 4090

180 ms

Subtítulo denso

768x768

A100

100 ms

Variantes del modelo

Modelo
Parámetros
VRAM
Velocidad

Florence-2-base

232 M

4GB

Rápido

Florence-2-large

771 M

8GB

Medio

Florence-2-base-ft

232 M

4GB

Rápido

Florence-2-large-ft

771 M

8GB

Medio

Problemas comunes y soluciones

Sin memoria

Problema: error de memoria CUDA OOM

Soluciones:

Inferencia lenta

Problema: El procesamiento tarda demasiado

Soluciones:

  • Usa Florence-2-base para una inferencia más rápida

  • Instala flash-attention para acelerar

  • Agrupa varias imágenes juntas

  • Usa una GPU A100 para producción

Resultados de OCR deficientes

Problema: El reconocimiento de texto es inexacto

Soluciones:

  • Asegúrate de que la imagen tenga alta resolución (al menos 768 px)

  • Usa <OCR_WITH_REGION> para una mejor localización

  • Preprocesa: mejora el contraste, endereza la imagen

  • Recorta las regiones de texto antes del OCR

La detección omite objetos

Problema: Los objetos no se detectan

Soluciones:

  • Usa <DENSE_REGION_CAPTION> para más regiones

  • Prueba <OPEN_VOCABULARY_DETECTION> con etiquetas específicas

  • Combínalo con GroundingDINO para objetos específicos

Solución de problemas

La tarea no funciona

  • Comprueba la sintaxis exacta del nombre de la tarea

  • Algunas tareas necesitan un formato de entrada específico

  • Verifica que la versión del modelo coincida con la tarea

Formato de salida inesperado

  • Las distintas tareas devuelven formatos diferentes

  • Analiza la salida según el tipo de tarea

  • Consulta la documentación para ver las salidas de la tarea

Problemas de memoria CUDA

  • Florence-2-large necesita ~8 GB de VRAM

  • Usa Florence-2-base para menos memoria

  • Activa el checkpointing de gradiente

Procesamiento lento

  • Usa inferencia por lotes cuando sea posible

  • Habilita el modo FP16

  • Considera la optimización con TensorRT

Estimación de costos

Tarifas típicas del marketplace de CLORE.AI (a partir de 2024):

GPU
Tarifa por hora
Tarifa diaria
Sesión de 4 horas

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

Los precios varían según el proveedor y la demanda. Consulta Marketplace de CLORE.AI las tarifas actuales.

Ahorra dinero:

  • Usa el Spot mercado para trabajo interrumpible — alrededor de un tercio de los servidores fija el precio spot por debajo del precio bajo demanda (mediana de ~13% de descuento), el resto lo iguala

  • Paga con CLORE tokens

  • Compara precios entre distintos proveedores

Siguientes pasos

  • LLaVA - Chat visual y preguntas y respuestas

  • GroundingDINO - Detección sin ejemplos previos

  • SAM2 - Segmentar objetos detectados

Última actualización

¿Te fue útil?