ChromaDB
Despliega la base de datos vectorial de código abierto ChromaDB para aplicaciones de IA en las GPU de Clore.ai
ChromaDB es la la base de datos vectorial de código abierto líder diseñada específicamente para aplicaciones de IA. Proporciona una API simple e intuitiva para almacenar, consultar y gestionar embeddings de alta dimensión — la base de los sistemas RAG modernos, la búsqueda semántica, los motores de recomendación y la memoria de LLM.
ChromaDB abstrae la complejidad de la búsqueda por similitud vectorial, permitiéndote centrarte en crear aplicaciones de IA. Admite tanto el modo en memoria para desarrollo como un modo de servidor persistente para despliegues en producción, con soporte de Docker para una implementación sencilla en servidores GPU de Clore.ai.
Características principales:
🚀 API simple de Python/JavaScript — comienza en minutos
💾 Almacenamiento persistente — los datos sobreviven a los reinicios del contenedor
🔍 Múltiples métricas de distancia — coseno, L2, producto interno
📦 Embeddings integrados — soporte integrado para OpenAI, Cohere, sentence-transformers
🏗️ Multiinquilino — colecciones para organizar diferentes conjuntos de datos
🔌 API REST — interfaz HTTP agnóstica del lenguaje
⚡ Rápido — índice HNSW para búsqueda aproximada de vecinos más cercanos
🔗 Nativo de LangChain/LlamaIndex — integración de primera clase
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Requisitos del servidor
GPU
Cualquier GPU NVIDIA (opcional)
NVIDIA RTX 3080+ (para embeddings)
VRAM
No es necesario para ChromaDB
8–16 GB (para modelos locales de embeddings)
RAM
4 GB
16–32 GB
CPU
2 núcleos
8 núcleos
Disco
10 GB
50–200 GB (para grandes conjuntos de datos)
SO
Ubuntu 20.04+
Ubuntu 22.04
Docker
Requerido
Docker + Docker Compose
Puertos
22, 8000
22, 8000
Despliegue rápido en CLORE.AI
1. Encuentra un servidor adecuado
Ve a Marketplace de CLORE.AI y elige:
Solo CPU para el servidor ChromaDB + API (almacenar embeddings precomputados)
servidor GPU si también quieres generar embeddings localmente
2. Configura tu despliegue
Imagen de Docker:
Mapeos de puertos:
Variables de entorno:
Comando de inicio:
3. Probar el despliegue
Configuración paso a paso
Paso 1: conéctate por SSH a tu servidor
Paso 2: Crear el directorio de datos
Paso 3: Ejecutar el contenedor ChromaDB
Paso 4: Verificar que esté en ejecución
Paso 5: Instalar el cliente de Python
Paso 6: Probar la conectividad desde Python
Paso 7: (Opcional) Habilitar autenticación
Ejemplos de uso
Ejemplo 1: Operaciones básicas del almacén vectorial
Ejemplo 2: Búsqueda semántica
Ejemplo 3: Canal RAG con ChromaDB + OpenAI
Ejemplo 4: Gestión de documentos con múltiples colecciones
Ejemplo 5: Filtrado y consultas de metadatos
Configuración
Docker Compose (Producción)
Referencia de variables de entorno
IS_PERSISTENT
FALSE
Habilitar almacenamiento persistente
ANONYMIZED_TELEMETRY
TRUE
Deshabilitar seguimiento de uso
CHROMA_SERVER_LOG_LEVEL
INFO
Nivel de verbosidad del registro
CHROMA_MEMORY_LIMIT_BYTES
Ninguno
Máximo de memoria para la caché de segmentos
ALLOW_RESET
FALSE
Permitir restablecer todos los datos mediante la API
CHROMA_SERVER_AUTH_PROVIDER
Ninguno
Clase del proveedor de autenticación
Consejos de rendimiento
1. Elegir el modelo de embeddings adecuado
all-MiniLM-L6-v2
384
Rápido
Bueno
No
all-mpnet-base-v2
768
Medio
Mejor
Opcional
text-embedding-3-small
1536
Rápido
Excelente
Solo API
BAAI/bge-large-en-v1.5
1024
Medio
Mejor
Sí
2. Upserts por lotes para mayor velocidad
3. Ajuste del índice HNSW
4. Cliente persistente para uso local
Solución de problemas
Problema: No se puede conectar a ChromaDB
Problema: Se pierden los datos al reiniciar el contenedor
Problema: Errores de falta de memoria
Problema: Generación de embeddings lenta
Problema: No se encontró la colección después del reinicio
Enlaces
Documentación oficial: https://docs.trychroma.com
Docker Hub: https://hub.docker.com/r/chromadb/chroma
Discord: https://discord.gg/MMeYNTmh3x
Marketplace de CLORE.AI: https://clore.ai/marketplace
Recomendaciones de GPU para Clore.ai
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
RAG de producción
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Embeddings de alto rendimiento
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?