GroundingDINO
Detecta cualquier objeto usando descripciones de texto con GroundingDINO
Detecta cualquier objeto usando descripciones de texto con GroundingDINO.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Alquilar en CLORE.AI
Visita Marketplace de CLORE.AI
Filtra por tipo de GPU, VRAM y precio
Elige Bajo demanda (tarifa fija) o Spot (precio ofertado)
Configura tu pedido:
Selecciona la imagen de Docker
Configura los puertos (TCP para SSH, HTTP para interfaces web)
Añade variables de entorno si es necesario
Introduce el comando de inicio
Selecciona el método de pago: CLORE, BTC, o USDT/USDC
Crea el pedido y espera al despliegue
Accede a tu servidor
Encuentra los detalles de conexión en Mis pedidos
Interfaces web: Usa la URL del puerto HTTP
SSH:
ssh -p <port> root@<proxy-address>
¿Qué es GroundingDINO?
GroundingDINO de IDEA-Research permite:
Detección de objetos zero-shot con indicaciones de texto
Detecta cualquier objeto sin entrenamiento
Localización precisa de cajas delimitadoras de alta exactitud
Combínalo con SAM para segmentación automática
Recursos
GitHub: IDEA-Research/GroundingDINO
Artículo: Documento técnico de GroundingDINO
HuggingFace: IDEA-Research/grounding-dino
Demo: Espacio de Hugging Face
Hardware recomendado
GPU
RTX 3060 12GB
RTX 4080 16GB
RTX 4090 24GB
VRAM
6GB
12GB
16GB
CPU
4 núcleos
8 núcleos
16 núcleos
RAM
16GB
32GB
64GB
Almacenamiento
SSD de 20 GB
50GB NVMe
100GB NVMe
Internet
100 Mbps
500 Mbps
1 Gbps
Despliegue rápido en CLORE.AI
Imagen de Docker:
Puertos:
Comando:
Accediendo a tu servicio
Después del despliegue, encuentra tu http_pub URL en Mis pedidos:
Ve a Mis pedidos página
Haz clic en tu pedido
Encuentra la
http_pubURL (p. ej.,abc123.clorecloud.net)
Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.
Instalación
Lo que puedes crear
Etiquetado automatizado
Anota automáticamente conjuntos de datos para entrenamiento de ML
Genera cajas delimitadoras a partir de descripciones
Acelera los flujos de etiquetado de datos
Búsqueda visual
Encuentra objetos específicos en bases de datos de imágenes
Sistemas de moderación de contenido
Reconocimiento de productos en el comercio minorista
Robótica y automatización
Localización de objetos para brazos robóticos
Sistemas de gestión de inventario
Inspección de control de calidad
Aplicaciones creativas
Recorta automáticamente los sujetos de las fotos
Genera máscaras de objetos con SAM
Edición de imágenes consciente del contenido
Analítica
Cuenta objetos en imágenes
Rastrea el inventario a partir de fotos
Monitoreo de fauna silvestre
Uso básico
GroundingDINO + SAM (Grounded-SAM)
Combina la detección con la segmentación:
Procesamiento por lotes
Flujo de detección personalizado
Interfaz de Gradio
Rendimiento
Imagen única
800x600
RTX 3090
120 ms
Imagen única
800x600
RTX 4090
80ms
Imagen única
1920x1080
RTX 4090
150 ms
Lote (10 imágenes)
800x600
RTX 4090
600ms
Problemas comunes y soluciones
Baja precisión de detección
Problema: Los objetos no se detectan
Soluciones:
Reduce
box_thresholda 0.2-0.3Reduce
text_thresholda 0.15-0.2Usa descripciones de objetos más específicas
Separa los objetos con " . " y no con comas
Sin memoria
Problema: Error de memoria CUDA OOM en imágenes grandes
Soluciones:
Inferencia lenta
Problema: La detección tarda demasiado
Soluciones:
Usa imágenes de entrada más pequeñas
Procesa varias imágenes por lotes
Usa inferencia FP16
Alquila una GPU más rápida (RTX 4090, A100)
Falsos positivos
Problema: Detectando objetos incorrectos
Soluciones:
Aumenta
box_thresholda 0.4-0.5Sé más específico en las indicaciones
Usa indicaciones negativas (filtra los resultados después de la detección)
Solución de problemas
Los objetos no se detectan
Usa descripciones de texto más específicas
Prueba distintas formulaciones
Reduce el umbral de confianza
Cajas delimitadoras incorrectas
Sé más específico en la indicación de texto
Usa "." para separar varios objetos
Comprueba la calidad de las imágenes
Sin memoria
Reduce la resolución de la imagen
Procesa las imágenes de una en una
Usa una variante de modelo más pequeña
Inferencia lenta
Usa TensorRT para acelerar
Procesa por lotes imágenes de tamaño similar
Habilita la inferencia FP16
Estimación de costos
Tarifas típicas del marketplace de CLORE.AI (a partir de 2024):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
Los precios varían según el proveedor y la demanda. Consulta Marketplace de CLORE.AI las tarifas actuales.
Ahorra dinero:
Usa el Spot mercado para trabajo interrumpible — alrededor de un tercio de los servidores fija el precio spot por debajo del precio bajo demanda (mediana de ~13% de descuento), el resto lo iguala
Paga con CLORE tokens
Compara precios entre distintos proveedores
Siguientes pasos
SAM2 - Segmentar objetos detectados
Florence-2 - Más tareas de visión
YOLO - Detección más rápida para clases conocidas
Última actualización
¿Te fue útil?