For the complete documentation index, see llms.txt. This page is also available as Markdown.

LlamaIndex

在 Clore.ai 的 GPU 上构建 LlamaIndex 数据到 LLM 的流水线和 RAG 应用

LlamaIndex(前称 GPT Index)是一个 面向 LLM 应用的数据框架 ,拥有超过 37,000 个 GitHub stars。而 LangChain 专注于串联 LLM 调用,LlamaIndex 擅长 数据摄取、索引和结构化查询 ——当你的应用需要对大型、异构文档集合进行推理时,它是首选。

LlamaIndex 对复杂数据结构(数据库、API、PDF、Notion 页面、GitHub 仓库)和高级检索策略提供一流支持。在 Clore.ai GPU 服务器上结合本地 LLM 运行,可消除 API 成本并保持数据私密。

主要优势:

  • 📊 数据连接器 — 160+ 集成(PDF、SQL、Notion、Slack、GitHub 等)

  • 🗂️ 多种索引类型 — 向量、树、列表、关键词、知识图谱

  • 🔍 高级检索 — 子问题分解、递归检索、混合搜索

  • 🤖 查询引擎 — 针对任何数据源进行 SQL、结构化和自然语言查询

  • 🧩 多模态 — 图像、音频和视频与文本并存

  • 💾 持久化 — 内置支持 ChromaDB、Pinecone、Weaviate 等

  • 异步优先 — 专为生产吞吐量而构建

  • 🔗 兼容 LangChain — 可将两个框架一起使用


服务器要求

参数
最低
推荐

GPU

NVIDIA RTX 3080(10 GB)

NVIDIA RTX 4090(24 GB)

显存

8 GB(7B 模型)

24 GB(13B–34B 模型)

内存

16 GB

32–64 GB

CPU

4 核

16 核

磁盘

30 GB

100+ GB(本地模型 + 数据)

操作系统

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.8+

12.1+

Python

3.9+

3.11

端口

22, 8000

22、8000、11434(Ollama)

LlamaIndex 是一个 Python 库——GPU 资源由底层 LLM 和嵌入模型消耗。对于生产部署,建议将 LlamaIndex 与 Ollama(用于本地推理)和 ChromaDB(用于向量存储)配对使用,两者都运行在你的 Clore.ai GPU 服务器上。


在 CLORE.AI 上快速部署

1. 找到合适的服务器

前往 CLORE.AI 市场 并根据你的 LLM 规模选择:

使用场景
GPU
备注

开发 / 测试

RTX 3080(10 GB)

7B 模型,小型文档集

生产(小型)

RTX 4090(24 GB)

13B 模型,中型数据集

生产(大型)

A100 40G / 80G

34B–70B 模型,大型数据集

企业级

H100(80 GB)

最高吞吐量

2. 配置你的部署

Docker 镜像(基础):

端口映射:

启动脚本:

3. 访问 API


逐步设置

步骤 1:通过 SSH 登录你的服务器

步骤 2:安装 Ollama

步骤 3:设置 Python 环境

步骤 4:安装 LlamaIndex 包

步骤 5:配置全局设置

步骤 6:构建你的第一个索引

步骤 7:查询索引


使用示例

示例 1:基础文档问答


示例 2:使用 ChromaDB 的多文档 RAG


示例 3:子问题分解


示例 4:知识图谱索引


示例 5:数据库上的 SQL 查询引擎


配置

Docker Compose(完整 LlamaIndex 技术栈)

关键配置变量

设置
默认值
描述

Settings.llm

OpenAI GPT-3.5

用于生成的 LLM

Settings.embed_model

OpenAI Ada

嵌入模型

Settings.chunk_size

1024

文本分块大小(以 token 计)

Settings.chunk_overlap

200

分块之间的重叠

Settings.num_output

256

LLM 响应中的最大 token 数

Settings.context_window

4096

LLM 上下文窗口大小


性能提示

1. 用于提升吞吐量的异步查询

2. 混合搜索(关键词 + 语义)

3. 重排序以提升质量

4. 用于响应式 UI 的流式输出


故障排查

问题:嵌入模型未连接到 Ollama

问题:索引构建速度很慢

问题:集成出现 ModuleNotFoundError

问题:上下文窗口已超出

问题:查询返回无关结果


链接


Clore.ai GPU 推荐

使用场景
推荐 GPU
Clore.ai 预计成本

开发/测试

RTX 3090(24GB)

$0.07–0.21/gpu/hr

生产级 RAG

RTX 3090(24GB)

$0.07–0.21/gpu/hr

高吞吐量嵌入

RTX 4090(24GB)

$0.14–0.42/gpu/hr

💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。

最后更新于

这有帮助吗?