For the complete documentation index, see llms.txt. This page is also available as Markdown.

Plataforma RAG AnythingLLM

Despliega AnythingLLM en Clore.ai: una plataforma todo en uno para aplicaciones RAG y agentes de IA con chat de documentos integrado, creador de agentes sin código y soporte MCP ejecutándose en servidores de nube GPU rentables.

Descripción general

AnythingLLM es un espacio de trabajo de IA de código abierto y completo con más de 40K estrellas en GitHub. Combina RAG basado en documentos (Generación Aumentada por Recuperación), agentes de IA y un constructor de agentes sin código en una sola aplicación autohospedada — todo gestionado mediante una UI limpia e intuitiva que no requiere programar nada para configurarse.

¿Por qué ejecutar AnythingLLM en Clore.ai?

  • Canalización RAG completa lista para usar — Sube PDFs, documentos de Word, sitios web y transcripciones de YouTube. AnythingLLM automáticamente los fragmenta, los incrusta y los almacena para búsqueda semántica.

  • No se requiere GPU para la aplicación — AnythingLLM usa incrustación basada en CPU de forma predeterminada. Combínalo con un servidor GPU de Clore.ai que ejecute Ollama o vLLM para inferencia local.

  • Agentes de IA con herramientas reales — Los agentes integrados pueden navegar por la web, escribir y ejecutar código, administrar archivos y llamar a APIs externas — todo orquestado a través de una GUI.

  • Compatibilidad con MCP — Se integra con el ecosistema del Protocolo de Contexto del Modelo para ampliar la conectividad de herramientas.

  • Aislamiento de espacios de trabajo — Crea espacios de trabajo separados con diferentes bases de conocimientos y configuraciones de LLM para distintos proyectos o equipos.

Resumen de la arquitectura

┌─────────────────────────────────────────────┐
│            AnythingLLM (Puerto 3001)        │
│                                             │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐  │
│  │ RAG/Docs │  │ Agentes  │  │ Usuarios │  │
│  └────┬─────┘  └────┬─────┘  └──────────┘  │
│       │             │                       │
│  ┌────▼─────────────▼───────┐               │
│  │ Enrutador del proveedor  │               │
│  │         de LLM           │               │
└─────────────────┼───────────────────────────┘

     ┌────────────┼────────────┐
     ▼            ▼            ▼
  OpenAI       Anthropic    Ollama (local)
  Claude        Gemini      vLLM (local)

Requisitos

Especificaciones del servidor

Componente
Mínimo
Recomendado
Notas

GPU

No se requiere

RTX 3090 (si se usan LLM locales)

Solo para el backend de Ollama/vLLM

VRAM

24 GB

Para la inferencia de modelos locales

CPU

2 vCPU

4 vCPU

El embedding se ejecuta en CPU

RAM

4 GB

8 GB

Más = índice de documentos más grande en memoria

Almacenamiento

10 GB

50+ GB

Almacenamiento de documentos, BD vectorial, caché del modelo

Referencia de precios de Clore.ai

Tipo de servidor
Costo aprox.
Caso de uso

Instancia CPU (4 vCPU, 8 GB de RAM)

~$0.05–0.10/h

AnythingLLM + proveedores externos de API

RTX 3090 (24 GB de VRAM)

$0.07–0.21/h

AnythingLLM + LLM locales de Ollama

RTX 4090 (24 GB de VRAM)

$0.14–0.42/h

AnythingLLM + inferencia local más rápida

A100 80 GB

AnythingLLM + modelos grandes de 70B+

💡 Consejo: El embedding integrado de AnythingLLM (LanceDB + incrustador local de CPU) funciona sin GPU. Para el backend LLM, puedes usar proveedores de API gratuitos como OpenRouter o Groq para mantener los costos al mínimo.

Requisitos previos

  • Servidor de Clore.ai con acceso SSH

  • Docker (preinstalado en los servidores de Clore.ai)

  • Al menos una clave API de LLM o backend local de Ollama/vLLM


Inicio rápido

Método 1: Contenedor Docker único (recomendado)

La implementación oficial en un solo contenedor incluye todo: la interfaz web, el almacén vectorial LanceDB y el procesador de documentos.

Paso 1: Conéctate a tu servidor de Clore.ai

Paso 2: Configura el directorio de almacenamiento

Paso 3: Ejecuta AnythingLLM

Por qué --cap-add SYS_ADMIN? AnythingLLM usa Chromium para el scraping de páginas web y la renderización de PDF, lo que requiere capacidades elevadas del contenedor.

Paso 4: Verifica el inicio

Paso 5: Completa el asistente de configuración

Abre en el navegador:

El asistente de configuración inicial te guía a través de:

  1. Crear cuenta de administrador

  2. Elegir proveedor de LLM

  3. Elegir modelo de embedding

  4. Configurar tu primer espacio de trabajo


Método 2: Docker Compose (multiservicio)

Para implementaciones de producción con servicios separados y gestión más sencilla:

Paso 1: Crea el directorio del proyecto

Paso 2: Crear docker-compose.yml

Paso 3: Crear .env archivo

Paso 4: Iniciar


Método 3: Con variables de entorno preconfiguradas

Para una implementación automatizada sin el asistente de configuración:


Configuración

Opciones de proveedor de LLM

AnythingLLM admite una amplia gama de backends de LLM. Configúralo en la interfaz en Configuración → Preferencia de LLM, o mediante variables de entorno:

OpenAI:

Anthropic Claude:

Google Gemini:

Ollama (local):

OpenRouter (acceso a más de 100 modelos):

Configuración de embedding

Motor
Backend
Se necesita GPU
Calidad

native

CPU (integrado)

No

Bueno

openai

API de OpenAI

No

Excelente

ollama

Ollama local

Opcional

Bueno-Excelente

localai

LocalAI

Opcional

Variable

Opciones de base de datos vectorial

BD
Descripción
Ideal para

lancedb

Integrado, sin configuración

Predeterminado, conjuntos de datos pequeños y medianos

chroma

ChromaDB (externa)

Conjuntos de datos medianos, flexibilidad

pinecone

nube de Pinecone

Grandes conjuntos de datos, producción

weaviate

Weaviate (autohospedado)

Casos de uso avanzados

Configuración del espacio de trabajo

Los espacios de trabajo de AnythingLLM son entornos aislados con sus propios:

  • Base de conocimientos documental

  • Configuración de LLM (puede anular la global)

  • Historial de chat

  • Configuraciones de agentes

Crea espacios de trabajo a través de la UI o la API:

Ingesta de documentos

Sube documentos vía UI o API:


Aceleración GPU

AnythingLLM en sí se ejecuta en CPU. La aceleración por GPU se aplica al backend de inferencia del LLM.

Ejecutar Ollama en el mismo servidor de Clore.ai

Rendimiento de modelos GPU en Clore.ai

Modelo
GPU
VRAM
Velocidad de embedding
Velocidad de inferencia
Coste/hora

Llama 3.2 3B

RTX 3090

2 GB

Rápido

60–80 tok/s

~$0.20

Llama 3.1 8B

RTX 3090

6 GB

Rápido

40–60 tok/s

~$0.20

Mistral 7B

RTX 3090

5 GB

Rápido

45–65 tok/s

~$0.20

Llama 3.1 70B

A100 80GB

40 GB

Medio

20–35 tok/s

~$1.10


Consejos y mejores prácticas

Mejores prácticas para la ingesta de documentos

  • Preprocesa PDF grandes — Los escaneos con mucho OCR ralentizan la ingesta. Usa pdftotext o Adobe OCR antes.

  • Organiza por espacio de trabajo — Crea espacios de trabajo separados por proyecto/dominio para una mejor precisión de recuperación.

  • Usa consultas específicas — RAG funciona mejor con preguntas específicas, no con solicitudes amplias.

Gestión de costes en Clore.ai

Dado que las instancias de Clore.ai son efímeras, haz siempre una copia de seguridad del directorio de almacenamiento. Contiene:

  • Incrustaciones vectoriales (LanceDB)

  • Documentos subidos

  • Historial de chat

  • Configuraciones de agentes

Configuración multiusuario

Configuración del agente de IA

Los agentes de AnythingLLM pueden realizar tareas del mundo real. Activa las herramientas en Configuración → Agentes:

  • Navegación web — Obtiene y lee páginas web

  • Búsqueda de Google — Busca en Google (requiere clave de API)

  • Intérprete de código — Ejecuta Python en un entorno aislado

  • GitHub — Lee repositorios

  • Conector SQL — Consulta bases de datos

Ajuste del rendimiento

Actualizando AnythingLLM


Solución de problemas

El contenedor se inicia pero la UI no es accesible

La carga de documentos falla

Las respuestas RAG son de mala calidad / alucinatorias

Causas comunes y soluciones:

La conexión a Ollama falla desde AnythingLLM

Sin memoria / fallo del contenedor


Lecturas adicionales

Última actualización

¿Te fue útil?