Plataforma RAG AnythingLLM
Despliega AnythingLLM en Clore.ai: una plataforma todo en uno para aplicaciones RAG y agentes de IA con chat de documentos integrado, creador de agentes sin código y soporte MCP ejecutándose en servidores de nube GPU rentables.
Descripción general
AnythingLLM es un espacio de trabajo de IA de código abierto y completo con más de 40K estrellas en GitHub. Combina RAG basado en documentos (Generación Aumentada por Recuperación), agentes de IA y un constructor de agentes sin código en una sola aplicación autohospedada — todo gestionado mediante una UI limpia e intuitiva que no requiere programar nada para configurarse.
¿Por qué ejecutar AnythingLLM en Clore.ai?
Canalización RAG completa lista para usar — Sube PDFs, documentos de Word, sitios web y transcripciones de YouTube. AnythingLLM automáticamente los fragmenta, los incrusta y los almacena para búsqueda semántica.
No se requiere GPU para la aplicación — AnythingLLM usa incrustación basada en CPU de forma predeterminada. Combínalo con un servidor GPU de Clore.ai que ejecute Ollama o vLLM para inferencia local.
Agentes de IA con herramientas reales — Los agentes integrados pueden navegar por la web, escribir y ejecutar código, administrar archivos y llamar a APIs externas — todo orquestado a través de una GUI.
Compatibilidad con MCP — Se integra con el ecosistema del Protocolo de Contexto del Modelo para ampliar la conectividad de herramientas.
Aislamiento de espacios de trabajo — Crea espacios de trabajo separados con diferentes bases de conocimientos y configuraciones de LLM para distintos proyectos o equipos.
Resumen de la arquitectura
┌─────────────────────────────────────────────┐
│ AnythingLLM (Puerto 3001) │
│ │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ RAG/Docs │ │ Agentes │ │ Usuarios │ │
│ └────┬─────┘ └────┬─────┘ └──────────┘ │
│ │ │ │
│ ┌────▼─────────────▼───────┐ │
│ │ Enrutador del proveedor │ │
│ │ de LLM │ │
└─────────────────┼───────────────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
OpenAI Anthropic Ollama (local)
Claude Gemini vLLM (local)Requisitos
Especificaciones del servidor
GPU
No se requiere
RTX 3090 (si se usan LLM locales)
Solo para el backend de Ollama/vLLM
VRAM
—
24 GB
Para la inferencia de modelos locales
CPU
2 vCPU
4 vCPU
El embedding se ejecuta en CPU
RAM
4 GB
8 GB
Más = índice de documentos más grande en memoria
Almacenamiento
10 GB
50+ GB
Almacenamiento de documentos, BD vectorial, caché del modelo
Referencia de precios de Clore.ai
Instancia CPU (4 vCPU, 8 GB de RAM)
~$0.05–0.10/h
AnythingLLM + proveedores externos de API
RTX 3090 (24 GB de VRAM)
$0.07–0.21/h
AnythingLLM + LLM locales de Ollama
RTX 4090 (24 GB de VRAM)
$0.14–0.42/h
AnythingLLM + inferencia local más rápida
💡 Consejo: El embedding integrado de AnythingLLM (LanceDB + incrustador local de CPU) funciona sin GPU. Para el backend LLM, puedes usar proveedores de API gratuitos como OpenRouter o Groq para mantener los costos al mínimo.
Requisitos previos
Servidor de Clore.ai con acceso SSH
Docker (preinstalado en los servidores de Clore.ai)
Al menos una clave API de LLM o backend local de Ollama/vLLM
Inicio rápido
Método 1: Contenedor Docker único (recomendado)
La implementación oficial en un solo contenedor incluye todo: la interfaz web, el almacén vectorial LanceDB y el procesador de documentos.
Paso 1: Conéctate a tu servidor de Clore.ai
Paso 2: Configura el directorio de almacenamiento
Paso 3: Ejecuta AnythingLLM
Por qué
--cap-add SYS_ADMIN? AnythingLLM usa Chromium para el scraping de páginas web y la renderización de PDF, lo que requiere capacidades elevadas del contenedor.
Paso 4: Verifica el inicio
Paso 5: Completa el asistente de configuración
Abre en el navegador:
El asistente de configuración inicial te guía a través de:
Crear cuenta de administrador
Elegir proveedor de LLM
Elegir modelo de embedding
Configurar tu primer espacio de trabajo
Método 2: Docker Compose (multiservicio)
Para implementaciones de producción con servicios separados y gestión más sencilla:
Paso 1: Crea el directorio del proyecto
Paso 2: Crear docker-compose.yml
Paso 3: Crear .env archivo
Paso 4: Iniciar
Método 3: Con variables de entorno preconfiguradas
Para una implementación automatizada sin el asistente de configuración:
Configuración
Opciones de proveedor de LLM
AnythingLLM admite una amplia gama de backends de LLM. Configúralo en la interfaz en Configuración → Preferencia de LLM, o mediante variables de entorno:
OpenAI:
Anthropic Claude:
Google Gemini:
Ollama (local):
OpenRouter (acceso a más de 100 modelos):
Configuración de embedding
native
CPU (integrado)
No
Bueno
openai
API de OpenAI
No
Excelente
ollama
Ollama local
Opcional
Bueno-Excelente
localai
LocalAI
Opcional
Variable
Opciones de base de datos vectorial
lancedb
Integrado, sin configuración
Predeterminado, conjuntos de datos pequeños y medianos
chroma
ChromaDB (externa)
Conjuntos de datos medianos, flexibilidad
pinecone
nube de Pinecone
Grandes conjuntos de datos, producción
weaviate
Weaviate (autohospedado)
Casos de uso avanzados
Configuración del espacio de trabajo
Los espacios de trabajo de AnythingLLM son entornos aislados con sus propios:
Base de conocimientos documental
Configuración de LLM (puede anular la global)
Historial de chat
Configuraciones de agentes
Crea espacios de trabajo a través de la UI o la API:
Ingesta de documentos
Sube documentos vía UI o API:
Aceleración GPU
AnythingLLM en sí se ejecuta en CPU. La aceleración por GPU se aplica al backend de inferencia del LLM.
Ejecutar Ollama en el mismo servidor de Clore.ai
Rendimiento de modelos GPU en Clore.ai
Llama 3.2 3B
RTX 3090
2 GB
Rápido
60–80 tok/s
~$0.20
Llama 3.1 8B
RTX 3090
6 GB
Rápido
40–60 tok/s
~$0.20
Mistral 7B
RTX 3090
5 GB
Rápido
45–65 tok/s
~$0.20
Llama 3.1 70B
A100 80GB
40 GB
Medio
20–35 tok/s
~$1.10
Consejos y mejores prácticas
Mejores prácticas para la ingesta de documentos
Preprocesa PDF grandes — Los escaneos con mucho OCR ralentizan la ingesta. Usa
pdftotexto Adobe OCR antes.Organiza por espacio de trabajo — Crea espacios de trabajo separados por proyecto/dominio para una mejor precisión de recuperación.
Usa consultas específicas — RAG funciona mejor con preguntas específicas, no con solicitudes amplias.
Gestión de costes en Clore.ai
Dado que las instancias de Clore.ai son efímeras, haz siempre una copia de seguridad del directorio de almacenamiento. Contiene:
Incrustaciones vectoriales (LanceDB)
Documentos subidos
Historial de chat
Configuraciones de agentes
Configuración multiusuario
Configuración del agente de IA
Los agentes de AnythingLLM pueden realizar tareas del mundo real. Activa las herramientas en Configuración → Agentes:
Navegación web — Obtiene y lee páginas web
Búsqueda de Google — Busca en Google (requiere clave de API)
Intérprete de código — Ejecuta Python en un entorno aislado
GitHub — Lee repositorios
Conector SQL — Consulta bases de datos
Ajuste del rendimiento
Actualizando AnythingLLM
Solución de problemas
El contenedor se inicia pero la UI no es accesible
La carga de documentos falla
Las respuestas RAG son de mala calidad / alucinatorias
Causas comunes y soluciones:
La conexión a Ollama falla desde AnythingLLM
Sin memoria / fallo del contenedor
Lecturas adicionales
Documentación de AnythingLLM — configuración completa y referencia de API
AnythingLLM GitHub — código fuente, incidencias, hoja de ruta
AnythingLLM Docker Hub — etiquetas de imagen
Ejecutar Ollama en Clore.ai — backend local de LLM para AnythingLLM
Ejecutar vLLM en Clore.ai — inferencia de alto rendimiento
Guía de comparación de GPU — seleccionar el plan adecuado de Clore.ai
Documentación de MCP — Protocolo de contexto de modelo para ampliar agentes
Referencia de la API de AnythingLLM — API REST para automatización
Última actualización
¿Te fue útil?