For the complete documentation index, see llms.txt. This page is also available as Markdown.

LlamaIndex

Crea canalizaciones de datos a LLM y aplicaciones RAG de LlamaIndex en las GPU de Clore.ai

LlamaIndex (anteriormente GPT Index) es un marco de datos para aplicaciones LLM con más de 37.000 estrellas en GitHub. Mientras LangChain se centra en encadenar llamadas LLM, LlamaIndex destaca en ingesta de datos, indexación y consultas estructuradas — lo que lo convierte en la opción ideal cuando tu aplicación necesita razonar sobre grandes colecciones heterogéneas de documentos.

LlamaIndex ofrece soporte de primera clase para estructuras de datos complejas (bases de datos, APIs, PDFs, páginas de Notion, repositorios de GitHub) y estrategias de recuperación sofisticadas. Ejecutarlo en servidores GPU de Clore.ai con LLM locales elimina los costos de API y mantiene tus datos privados.

Fortalezas clave:

  • 📊 Conectores de datos — más de 160 integraciones (PDF, SQL, Notion, Slack, GitHub, etc.)

  • 🗂️ Múltiples tipos de índice — vectorial, árbol, lista, palabra clave, grafo de conocimiento

  • 🔍 Recuperación avanzada — descomposición de subpreguntas, recuperación recursiva, búsqueda híbrida

  • 🤖 Motores de consulta — SQL, estructurado y lenguaje natural sobre cualquier fuente de datos

  • 🧩 Multimodal — imágenes, audio y video junto con texto

  • 💾 Persistencia — soporte integrado para ChromaDB, Pinecone, Weaviate, etc.

  • Asincronía como prioridad — diseñado para rendimiento de producción

  • 🔗 Compatible con LangChain — usa ambos marcos juntos


Requisitos del servidor

Parámetro
Mínimo
Recomendado

GPU

NVIDIA RTX 3080 (10 GB)

NVIDIA RTX 4090 (24 GB)

VRAM

8 GB (modelo de 7B)

24 GB (modelos de 13B–34B)

RAM

16 GB

32–64 GB

CPU

4 núcleos

16 núcleos

Disco

30 GB

100+ GB (modelos locales + datos)

SO

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.8+

12.1+

Python

3.9+

3.11

Puertos

22, 8000

22, 8000, 11434 (Ollama)

LlamaIndex es una biblioteca de Python — los recursos GPU los consume el LLM subyacente y el modelo de embeddings. Para despliegues en producción, combina LlamaIndex con Ollama (para inferencia local) y ChromaDB (para almacenamiento vectorial), ambos ejecutándose en tu servidor GPU de Clore.ai.


Despliegue rápido en CLORE.AI

1. Encuentra un servidor adecuado

Ve a Marketplace de CLORE.AI y elige según el tamaño de tu LLM:

Caso de uso
GPU
Notas

Desarrollo / Pruebas

RTX 3080 (10 GB)

modelos de 7B, conjuntos de documentos pequeños

Producción (pequeña)

RTX 4090 (24 GB)

modelos de 13B, conjuntos de datos medianos

Producción (grande)

A100 40G / 80G

modelos de 34B–70B, conjuntos de datos grandes

Empresa

H100 (80 GB)

Máximo rendimiento

2. Configura tu despliegue

Imagen Docker (base):

Mapeos de puertos:

Script de inicio:

3. Accede a la API


Configuración paso a paso

Paso 1: conéctate por SSH a tu servidor

Paso 2: instala Ollama

Paso 3: configura el entorno Python

Paso 4: instala los paquetes de LlamaIndex

Paso 5: configura los ajustes globales

Paso 6: crea tu primer índice

Paso 7: consulta el índice


Ejemplos de uso

Ejemplo 1: preguntas y respuestas básicas sobre documentos


Ejemplo 2: RAG multdocumento con ChromaDB


Ejemplo 3: descomposición de subpreguntas


Ejemplo 4: índice de grafo de conocimiento


Ejemplo 5: motor de consultas SQL sobre una base de datos


Configuración

Docker Compose (Pila completa de LlamaIndex)

Variables de configuración clave

Ajuste
Valor predeterminado
Descripción

Settings.llm

OpenAI GPT-3.5

LLM para generación

Settings.embed_model

OpenAI Ada

Modelo de embeddings

Settings.chunk_size

1024

Tamaño del fragmento de texto en tokens

Settings.chunk_overlap

200

Superposición entre fragmentos

Settings.num_output

256

Máx. tokens en la respuesta del LLM

Settings.context_window

4096

Tamaño de la ventana de contexto del LLM


Consejos de rendimiento

1. Consultas asíncronas para mayor rendimiento

2. Búsqueda híbrida (palabras clave + semántica)

3. Re-ranking para calidad

4. Streaming para interfaces de usuario receptivas


Solución de problemas

Problema: el modelo de embeddings no se conecta a Ollama

Problema: la creación del índice es lenta

Problema: ModuleNotFoundError para integraciones

Problema: se superó la ventana de contexto

Problema: las consultas devuelven resultados irrelevantes


Enlaces


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

RAG de producción

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Embeddings de alto rendimiento

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?