For the complete documentation index, see llms.txt. This page is also available as Markdown.

AnythingLLM RAG 平台

在 Clore.ai 上部署 AnythingLLM——一个集成式 RAG 应用和 AI 智能体平台,内置文档聊天、无代码智能体构建器和 MCP 支持,运行在高性价比的 GPU 云服务器上。

概览

AnythingLLM 是一个功能齐全、开源的 AI 工作区,拥有 4 万+ GitHub stars。它将基于文档的 RAG(检索增强生成)、AI 智能体以及无代码智能体构建器整合到一个自托管应用中——ทั้งหมด通过简洁直观的 UI 管理,搭建时无需任何编码。

为什么要在 Clore.ai 上运行 AnythingLLM?

  • 开箱即用的完整 RAG 流水线 — 上传 PDF、Word 文档、网站和 YouTube 转录文本。AnythingLLM 会自动分块、嵌入并存储它们,以便进行语义搜索。

  • 应用无需 GPU — AnythingLLM 默认使用基于 CPU 的嵌入。将其与运行 Ollama 或 vLLM 的 Clore.ai GPU 服务器配合,可实现本地推理。

  • 带有真实工具的 AI 智能体 — 内置智能体可以浏览网页、编写并执行代码、管理文件以及调用外部 API——全部通过 GUI 协调。

  • MCP 兼容性 — 与 Model Context Protocol 生态系统集成,提供扩展的工具连接能力。

  • 工作区隔离 — 为不同项目或团队创建独立工作区,并使用不同的知识库和 LLM 设置。

架构概览

┌─────────────────────────────────────────────┐
│            AnythingLLM(端口 3001)         │
│                                             │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐  │
│  │ RAG/文档 │  │  智能体  │  │  用户    │  │
│  └────┬─────┘  └────┬─────┘  └──────────┘  │
│       │             │                       │
│  ┌────▼─────────────▼───────┐               │
│  │    LLM 提供方路由器      │               │
│  └──────────────┬───────────┘               │
└─────────────────┼───────────────────────────┘

     ┌────────────┼────────────┐
     ▼            ▼            ▼
  OpenAI       Anthropic    Ollama(本地)
  Claude        Gemini      vLLM(本地)

需求

服务器规格

组件
最低
推荐
备注

GPU

无需

RTX 3090(如果使用本地 LLM)

仅适用于 Ollama/vLLM 后端

显存

24 GB

用于本地模型推理

CPU

2 vCPU

4 vCPU

嵌入在 CPU 上运行

内存

4 GB

8 GB

越多 = 内存中的文档索引越大

存储

10 GB

50+ GB

文档存储、向量数据库、模型缓存

Clore.ai 价格参考

服务器类型
大致费用
使用场景

CPU 实例(4 vCPU,8 GB RAM)

约 $0.05–0.10/小时

AnythingLLM + 外部 API 提供方

RTX 3090(24 GB 显存)

$0.07–0.21/小时

AnythingLLM + Ollama 本地 LLM

RTX 4090(24 GB 显存)

$0.14–0.42/小时

AnythingLLM + 更快的本地推理

A100 80 GB

AnythingLLM + 大型 70B+ 模型

💡 专业提示: AnythingLLM 内置的嵌入(LanceDB + 本地 CPU 嵌入器)无需 GPU 即可运行。对于 LLM 后端,你可以使用 OpenRouter 或 Groq 等免费层 API 提供方,将成本降到最低。

前提条件

  • 带 SSH 访问的 Clore.ai 服务器

  • Docker(Clore.ai 服务器上已预装)

  • 至少一个 LLM API 密钥 本地 Ollama/vLLM 后端


快速开始

方法 1:单 Docker 容器(推荐)

官方的单容器部署包含了一切:Web UI、LanceDB 向量存储和文档处理器。

步骤 1:连接到你的 Clore.ai 服务器

步骤 2:设置存储目录

步骤 3:运行 AnythingLLM

原因 --cap-add SYS_ADMIN? AnythingLLM 使用 Chromium 进行网页抓取和 PDF 渲染,因此需要更高的容器权限。

步骤 4:验证启动

步骤 5:完成设置向导

在浏览器中打开:

首次设置向导会引导你完成:

  1. 创建管理员账户

  2. 选择 LLM 提供方

  3. 选择嵌入模型

  4. 配置你的第一个工作区


方法 2:Docker Compose(多服务)

适用于使用独立服务、便于管理的生产部署:

步骤 1:创建项目目录

步骤 2:创建 docker-compose.yml

步骤 3:创建 .env 文件

步骤 4:启动


方法 3:使用预配置的环境变量

适用于无需设置向导的自动化部署:


配置

LLM 提供方选项

AnythingLLM 支持广泛的 LLM 后端。在 UI 中设置: 设置 → LLM 偏好,或者通过环境变量:

OpenAI:

Anthropic Claude:

Google Gemini:

Ollama(本地):

OpenRouter(可访问 100+ 模型):

嵌入配置

引擎
后端
需要 GPU
质量

native

CPU(内置)

openai

OpenAI API

优秀

ollama

本地 Ollama

可选

良好-优秀

localai

LocalAI

可选

变量

向量数据库选项

数据库
描述
最适合

lancedb

内置,无需配置

默认,适用于小到中型数据集

chroma

ChromaDB(外部)

中型数据集,灵活性高

pinecone

Pinecone 云端

大型数据集,生产环境

weaviate

Weaviate(自托管)

高级用例

工作区配置

AnythingLLM 工作区是彼此隔离的环境,拥有各自的:

  • 文档知识库

  • LLM 设置(可覆盖全局设置)

  • 聊天历史

  • 智能体配置

通过 UI 或 API 创建工作区:

文档导入

通过 UI 或 API 上传文档:


GPU 加速

AnythingLLM 本身运行在 CPU 上。GPU 加速适用于 LLM 推理后端。

在同一台 Clore.ai 服务器上运行 Ollama

Clore.ai 上的 GPU 模型性能

模型
GPU
显存
嵌入速度
推理速度
每小时成本

Llama 3.2 3B

RTX 3090

2 GB

60–80 tok/s

~$0.20

Llama 3.1 8B

RTX 3090

6 GB

40–60 tok/s

~$0.20

Mistral 7B

RTX 3090

5 GB

45–65 tok/s

~$0.20

Llama 3.1 70B

A100 80GB

40 GB

中等

20–35 tok/s

~$1.10


提示与最佳实践

文档导入最佳实践

  • 预处理大型 PDF — OCR 密集型扫描会减慢导入速度。请先使用 pdftotext 或 Adobe OCR。

  • 按工作区组织 — 为每个项目/领域创建独立工作区,以提高检索精度。

  • 使用具体查询 — RAG 最适合处理具体问题,而不是宽泛请求。

Clore.ai 上的成本管理

由于 Clore.ai 实例是临时性的,请务必备份存储目录。它包含:

  • 向量嵌入(LanceDB)

  • 已上传的文档

  • 聊天历史

  • 智能体配置

多用户设置

AI 智能体配置

AnythingLLM 智能体可以执行现实世界任务。在以下位置启用工具: 设置 → 智能体:

  • 网页浏览 — 获取并读取网页

  • Google 搜索 — 搜索 Google(需要 API 密钥)

  • 代码解释器 — 在沙箱中执行 Python

  • GitHub — 读取仓库

  • SQL 连接器 — 查询数据库

性能调优

更新 AnythingLLM


故障排查

容器已启动,但 UI 无法访问

文档上传失败

RAG 响应质量差 / 幻觉

常见原因和修复:

AnythingLLM 无法连接 Ollama

内存不足 / 容器崩溃


延伸阅读

最后更新于

这有帮助吗?