Plataforma de flujos de trabajo Dify.ai
Despliega Dify.ai en Clore.ai: crea flujos de trabajo de IA listos para producción, canalizaciones RAG y aplicaciones de agentes con una interfaz visual a precios de nube GPU.
Descripción general
Dify.ai es una plataforma de desarrollo de aplicaciones LLM de código abierto con más de 114 mil estrellas en GitHub. Combina un constructor visual de flujos de trabajo, canalización de generación aumentada por recuperación (RAG), orquestación de agentes, gestión de modelos y una capa de despliegue de API con un clic en una sola pila autohospedable.
En Clore.ai puedes ejecutar toda la pila de Dify —incluida su base de datos Postgres, la caché Redis, el almacén vectorial Weaviate, el proxy inverso Nginx, los workers de la API y el frontend web— en un servidor GPU alquilado por tan solo $0.07–0.21/h (RTX 3090/4090). La GPU es opcional para Dify en sí, pero se vuelve esencial cuando integras inferencia de modelos locales a través de los backends de Ollama o vLLM.
Capacidades clave:
🔄 Constructor visual de flujos de trabajo — canalizaciones LLM de arrastrar y soltar con ramificaciones, bucles y lógica condicional
📚 Canalización RAG — sube PDFs, URL, páginas de Notion; fragmentación + embeddings + recuperación, todo gestionado en la interfaz
🤖 Modo agente — agentes ReAct y de llamada a funciones con uso de herramientas (búsqueda web, intérprete de código, API personalizadas)
🚀 API-first — cada app genera al instante un endpoint REST y fragmentos de SDK
🔌 Más de 100 integraciones de modelos — OpenAI, Anthropic, Mistral, Cohere, además de modelos locales vía Ollama/vLLM
🏢 Multiinquilino — equipos, espacios de trabajo, RBAC, cuotas de uso
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Dify se ejecuta como una pila de Docker Compose con varios contenedores. El servidor mínimo viable para desarrollo es una instancia solo CPU; para producción con inferencia de modelos locales querrás un nodo GPU.
Mínima (solo claves de API)
Ninguno / CPU
—
8 GB
30 GB
~$0.05/h (CPU)
Estándar
RTX 3080
10 GB
16 GB
50 GB
$0,05–0,19/h
Recomendado
RTX 3090 / 4090
24 GB
32 GB
80 GB
$0.07–0.21/h
Alto rendimiento
H100 SXM
80 GB
128 GB
500 GB
~$1.04/h
Consejo: Si solo usas proveedores de API en la nube (OpenAI, Anthropic, etc.), cualquier instancia de CPU de 2 núcleos con 8 GB de RAM funciona. Una GPU solo importa cuando ejecutas modelos locales vía Ollama o vLLM — ver Aceleración GPU a continuación.
Nota sobre el disco
Los datos de Weaviate y Postgres crecen rápidamente con las cargas de documentos. Provisiona al menos 50 GB y monta almacenamiento persistente mediante las opciones de volumen de Clore.ai.
Inicio rápido
1. Alquila un servidor de Clore.ai
Ve a clore.aiy filtra por la GPU que desees; luego despliega un servidor con:
Docker preinstalado (todas las imágenes de Clore lo incluyen)
Puertos expuestos 80 y 443 (añade puertos personalizados en la configuración de la oferta si es necesario)
Acceso SSH habilitado
2. Conecta y prepara el servidor
3. Clona Dify e inicia
4. Verifica que todos los servicios estén saludables
5. Accede a la interfaz web
Abre tu navegador y navega a:
En el primer inicio, Dify te redirigirá al asistente de configuración para crear la cuenta de administrador. Completa el asistente y luego inicia sesión.
Configuración
Toda la configuración está en dify/docker/.env. Aquí están los ajustes más importantes:
Variables de entorno esenciales
Cambiar el puerto expuesto
De forma predeterminada, Nginx escucha en el puerto 80. Para cambiarlo:
Volúmenes de datos persistentes
El archivo Compose de Dify monta estos volúmenes de forma predeterminada:
Para hacer una copia de seguridad:
Aceleración GPU
La plataforma central de Dify se basa en CPU, pero desbloqueas la inferencia local de modelos al integrar Ollama o vLLM como proveedores de modelos — ambos se benefician enormemente de una GPU.
Opción A: sidecar de Ollama (la más fácil)
Ejecuta Ollama junto a Dify en el mismo servidor de Clore:
Luego en la interfaz de Dify → Configuración → Proveedores de modelos → Ollama:
URL base:
http://localhost:11434Selecciona tu modelo y guarda
Para una guía completa de Ollama, consulta language-models/ollama.md.
Opción B: sidecar de vLLM (alto rendimiento)
Luego en la interfaz de Dify → Configuración → Proveedores de modelos → Compatible con OpenAI:
URL base:
http://localhost:8000/v1Clave de API:
dummyNombre del modelo:
mistralai/Mistral-7B-Instruct-v0.2
Para la configuración completa de vLLM, consulta language-models/vllm.md.
Recomendaciones de memoria GPU para modelos locales
Llama 3 8B (Q4)
6 GB
RTX 3060
Llama 3 8B (FP16)
16 GB
RTX 3090 / 4090
Mistral 7B (Q4)
5 GB
RTX 3060
Llama 3 70B (Q4)
40 GB
A100 40GB
Llama 3 70B (FP16)
140 GB
2× H100
Consejos y buenas prácticas
Optimización de costos en Clore.ai
Habilita HTTPS con Caddy (recomendado para producción)
Escala los workers para cargas de trabajo pesadas
Monitorea el uso de recursos
Ajuste del rendimiento de RAG
Establece tamaño del fragmento a 512–1024 tokens para la mayoría de tipos de documentos
Habilita recuperación padre-hijo para documentos largos en la configuración del conjunto de datos
Usa búsqueda híbrida (palabra clave + vector) para mejor recuperación en contenido técnico
Indexa los documentos durante las horas de menor actividad para evitar límites de tasa de la API
Solución de problemas
Los servicios siguen reiniciándose
"La migración falló" al iniciar
No se puede conectar a Ollama desde Dify
Sin espacio en disco
Errores del almacén vectorial Weaviate
El puerto 80 ya está en uso
Lecturas adicionales
Última actualización
¿Te fue útil?