For the complete documentation index, see llms.txt. This page is also available as Markdown.

GroundingDINO

Detecta cualquier objeto usando descripciones de texto con GroundingDINO

Detecta cualquier objeto usando descripciones de texto con GroundingDINO.

Todos los ejemplos de esta guía se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI mercado.

Alquilar en CLORE.AI

  1. Filtra por tipo de GPU, VRAM y precio

  2. Elige Bajo demanda (tarifa fija) o Spot (precio ofertado)

  3. Configura tu pedido:

    • Selecciona la imagen de Docker

    • Configura los puertos (TCP para SSH, HTTP para interfaces web)

    • Añade variables de entorno si es necesario

    • Introduce el comando de inicio

  4. Selecciona el método de pago: CLORE, BTC, o USDT/USDC

  5. Crea el pedido y espera al despliegue

Accede a tu servidor

  • Encuentra los detalles de conexión en Mis pedidos

  • Interfaces web: Usa la URL del puerto HTTP

  • SSH: ssh -p <port> root@<proxy-address>

¿Qué es GroundingDINO?

GroundingDINO de IDEA-Research permite:

  • Detección de objetos zero-shot con indicaciones de texto

  • Detecta cualquier objeto sin entrenamiento

  • Localización precisa de cajas delimitadoras de alta exactitud

  • Combínalo con SAM para segmentación automática

Recursos

Hardware recomendado

Componente
Mínimo
Recomendado
Óptimo

GPU

RTX 3060 12GB

RTX 4080 16GB

RTX 4090 24GB

VRAM

6GB

12GB

16GB

CPU

4 núcleos

8 núcleos

16 núcleos

RAM

16GB

32GB

64GB

Almacenamiento

SSD de 20 GB

50GB NVMe

100GB NVMe

Internet

100 Mbps

500 Mbps

1 Gbps

Despliegue rápido en CLORE.AI

Imagen de Docker:

Puertos:

Comando:

Accediendo a tu servicio

Después del despliegue, encuentra tu http_pub URL en Mis pedidos:

  1. Ve a Mis pedidos página

  2. Haz clic en tu pedido

  3. Encuentra la http_pub URL (p. ej., abc123.clorecloud.net)

Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.

Instalación

Lo que puedes crear

Etiquetado automatizado

  • Anota automáticamente conjuntos de datos para entrenamiento de ML

  • Genera cajas delimitadoras a partir de descripciones

  • Acelera los flujos de etiquetado de datos

Búsqueda visual

  • Encuentra objetos específicos en bases de datos de imágenes

  • Sistemas de moderación de contenido

  • Reconocimiento de productos en el comercio minorista

Robótica y automatización

  • Localización de objetos para brazos robóticos

  • Sistemas de gestión de inventario

  • Inspección de control de calidad

Aplicaciones creativas

  • Recorta automáticamente los sujetos de las fotos

  • Genera máscaras de objetos con SAM

  • Edición de imágenes consciente del contenido

Analítica

  • Cuenta objetos en imágenes

  • Rastrea el inventario a partir de fotos

  • Monitoreo de fauna silvestre

Uso básico

GroundingDINO + SAM (Grounded-SAM)

Combina la detección con la segmentación:

Procesamiento por lotes

Flujo de detección personalizado

Interfaz de Gradio

Rendimiento

Tarea
Resolución
GPU
Velocidad

Imagen única

800x600

RTX 3090

120 ms

Imagen única

800x600

RTX 4090

80ms

Imagen única

1920x1080

RTX 4090

150 ms

Lote (10 imágenes)

800x600

RTX 4090

600ms

Problemas comunes y soluciones

Baja precisión de detección

Problema: Los objetos no se detectan

Soluciones:

  • Reduce box_threshold a 0.2-0.3

  • Reduce text_threshold a 0.15-0.2

  • Usa descripciones de objetos más específicas

  • Separa los objetos con " . " y no con comas

Sin memoria

Problema: Error de memoria CUDA OOM en imágenes grandes

Soluciones:

Inferencia lenta

Problema: La detección tarda demasiado

Soluciones:

  • Usa imágenes de entrada más pequeñas

  • Procesa varias imágenes por lotes

  • Usa inferencia FP16

  • Alquila una GPU más rápida (RTX 4090, A100)

Falsos positivos

Problema: Detectando objetos incorrectos

Soluciones:

  • Aumenta box_threshold a 0.4-0.5

  • Sé más específico en las indicaciones

  • Usa indicaciones negativas (filtra los resultados después de la detección)

Solución de problemas

Los objetos no se detectan

  • Usa descripciones de texto más específicas

  • Prueba distintas formulaciones

  • Reduce el umbral de confianza

Cajas delimitadoras incorrectas

  • Sé más específico en la indicación de texto

  • Usa "." para separar varios objetos

  • Comprueba la calidad de las imágenes

  • Reduce la resolución de la imagen

  • Procesa las imágenes de una en una

  • Usa una variante de modelo más pequeña

Inferencia lenta

  • Usa TensorRT para acelerar

  • Procesa por lotes imágenes de tamaño similar

  • Habilita la inferencia FP16

Estimación de costos

Tarifas típicas del marketplace de CLORE.AI (a partir de 2024):

GPU
Tarifa por hora
Tarifa diaria
Sesión de 4 horas

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

Los precios varían según el proveedor y la demanda. Consulta Marketplace de CLORE.AI las tarifas actuales.

Ahorra dinero:

  • Usa el Spot mercado para trabajo interrumpible — alrededor de un tercio de los servidores fija el precio spot por debajo del precio bajo demanda (mediana de ~13% de descuento), el resto lo iguala

  • Paga con CLORE tokens

  • Compara precios entre distintos proveedores

Siguientes pasos

  • SAM2 - Segmentar objetos detectados

  • Florence-2 - Más tareas de visión

  • YOLO - Detección más rápida para clases conocidas

Última actualización

¿Te fue útil?