For the complete documentation index, see llms.txt. This page is also available as Markdown.

Plataforma de flujos de trabajo Dify.ai

Despliega Dify.ai en Clore.ai: crea flujos de trabajo de IA listos para producción, canalizaciones RAG y aplicaciones de agentes con una interfaz visual a precios de nube GPU.

Descripción general

Dify.ai es una plataforma de desarrollo de aplicaciones LLM de código abierto con más de 114 mil estrellas en GitHub. Combina un constructor visual de flujos de trabajo, canalización de generación aumentada por recuperación (RAG), orquestación de agentes, gestión de modelos y una capa de despliegue de API con un clic en una sola pila autohospedable.

En Clore.ai puedes ejecutar toda la pila de Dify —incluida su base de datos Postgres, la caché Redis, el almacén vectorial Weaviate, el proxy inverso Nginx, los workers de la API y el frontend web— en un servidor GPU alquilado por tan solo $0.07–0.21/h (RTX 3090/4090). La GPU es opcional para Dify en sí, pero se vuelve esencial cuando integras inferencia de modelos locales a través de los backends de Ollama o vLLM.

Capacidades clave:

  • 🔄 Constructor visual de flujos de trabajo — canalizaciones LLM de arrastrar y soltar con ramificaciones, bucles y lógica condicional

  • 📚 Canalización RAG — sube PDFs, URL, páginas de Notion; fragmentación + embeddings + recuperación, todo gestionado en la interfaz

  • 🤖 Modo agente — agentes ReAct y de llamada a funciones con uso de herramientas (búsqueda web, intérprete de código, API personalizadas)

  • 🚀 API-first — cada app genera al instante un endpoint REST y fragmentos de SDK

  • 🔌 Más de 100 integraciones de modelos — OpenAI, Anthropic, Mistral, Cohere, además de modelos locales vía Ollama/vLLM

  • 🏢 Multiinquilino — equipos, espacios de trabajo, RBAC, cuotas de uso


Requisitos

Dify se ejecuta como una pila de Docker Compose con varios contenedores. El servidor mínimo viable para desarrollo es una instancia solo CPU; para producción con inferencia de modelos locales querrás un nodo GPU.

Configuración
GPU
VRAM
RAM del sistema
Disco
Precio de Clore.ai

Mínima (solo claves de API)

Ninguno / CPU

8 GB

30 GB

~$0.05/h (CPU)

Estándar

RTX 3080

10 GB

16 GB

50 GB

$0,05–0,19/h

Recomendado

RTX 3090 / 4090

24 GB

32 GB

80 GB

$0.07–0.21/h

Producción + LLM local

A100 80 GB

80 GB

64 GB

200 GB

Alto rendimiento

H100 SXM

80 GB

128 GB

500 GB

~$1.04/h

Consejo: Si solo usas proveedores de API en la nube (OpenAI, Anthropic, etc.), cualquier instancia de CPU de 2 núcleos con 8 GB de RAM funciona. Una GPU solo importa cuando ejecutas modelos locales vía Ollama o vLLM — ver Aceleración GPU a continuación.

Nota sobre el disco

Los datos de Weaviate y Postgres crecen rápidamente con las cargas de documentos. Provisiona al menos 50 GB y monta almacenamiento persistente mediante las opciones de volumen de Clore.ai.


Inicio rápido

1. Alquila un servidor de Clore.ai

Ve a clore.aiy filtra por la GPU que desees; luego despliega un servidor con:

  • Docker preinstalado (todas las imágenes de Clore lo incluyen)

  • Puertos expuestos 80 y 443 (añade puertos personalizados en la configuración de la oferta si es necesario)

  • Acceso SSH habilitado

2. Conecta y prepara el servidor

3. Clona Dify e inicia

4. Verifica que todos los servicios estén saludables

5. Accede a la interfaz web

Abre tu navegador y navega a:

En el primer inicio, Dify te redirigirá al asistente de configuración para crear la cuenta de administrador. Completa el asistente y luego inicia sesión.


Configuración

Toda la configuración está en dify/docker/.env. Aquí están los ajustes más importantes:

Variables de entorno esenciales

Cambiar el puerto expuesto

De forma predeterminada, Nginx escucha en el puerto 80. Para cambiarlo:

Volúmenes de datos persistentes

El archivo Compose de Dify monta estos volúmenes de forma predeterminada:

Para hacer una copia de seguridad:


Aceleración GPU

La plataforma central de Dify se basa en CPU, pero desbloqueas la inferencia local de modelos al integrar Ollama o vLLM como proveedores de modelos — ambos se benefician enormemente de una GPU.

Opción A: sidecar de Ollama (la más fácil)

Ejecuta Ollama junto a Dify en el mismo servidor de Clore:

Luego en la interfaz de Dify → Configuración → Proveedores de modelos → Ollama:

  • URL base: http://localhost:11434

  • Selecciona tu modelo y guarda

Para una guía completa de Ollama, consulta language-models/ollama.md.

Opción B: sidecar de vLLM (alto rendimiento)

Luego en la interfaz de Dify → Configuración → Proveedores de modelos → Compatible con OpenAI:

  • URL base: http://localhost:8000/v1

  • Clave de API: dummy

  • Nombre del modelo: mistralai/Mistral-7B-Instruct-v0.2

Para la configuración completa de vLLM, consulta language-models/vllm.md.

Recomendaciones de memoria GPU para modelos locales

Modelo
VRAM requerida
GPU de Clore recomendada

Llama 3 8B (Q4)

6 GB

RTX 3060

Llama 3 8B (FP16)

16 GB

RTX 3090 / 4090

Mistral 7B (Q4)

5 GB

RTX 3060

Llama 3 70B (Q4)

40 GB

A100 40GB

Llama 3 70B (FP16)

140 GB

2× H100


Consejos y buenas prácticas

Optimización de costos en Clore.ai

Habilita HTTPS con Caddy (recomendado para producción)

Escala los workers para cargas de trabajo pesadas

Monitorea el uso de recursos

Ajuste del rendimiento de RAG

  • Establece tamaño del fragmento a 512–1024 tokens para la mayoría de tipos de documentos

  • Habilita recuperación padre-hijo para documentos largos en la configuración del conjunto de datos

  • Usa búsqueda híbrida (palabra clave + vector) para mejor recuperación en contenido técnico

  • Indexa los documentos durante las horas de menor actividad para evitar límites de tasa de la API


Solución de problemas

Los servicios siguen reiniciándose

"La migración falló" al iniciar

No se puede conectar a Ollama desde Dify

Sin espacio en disco

Errores del almacén vectorial Weaviate

El puerto 80 ya está en uso


Lecturas adicionales

Última actualización

¿Te fue útil?