AnythingLLM RAG 平台
在 Clore.ai 上部署 AnythingLLM——一个集成式 RAG 应用和 AI 智能体平台,内置文档聊天、无代码智能体构建器和 MCP 支持,运行在高性价比的 GPU 云服务器上。
概览
AnythingLLM 是一个功能齐全、开源的 AI 工作区,拥有 4 万+ GitHub stars。它将基于文档的 RAG(检索增强生成)、AI 智能体以及无代码智能体构建器整合到一个自托管应用中——ทั้งหมด通过简洁直观的 UI 管理,搭建时无需任何编码。
为什么要在 Clore.ai 上运行 AnythingLLM?
开箱即用的完整 RAG 流水线 — 上传 PDF、Word 文档、网站和 YouTube 转录文本。AnythingLLM 会自动分块、嵌入并存储它们,以便进行语义搜索。
应用无需 GPU — AnythingLLM 默认使用基于 CPU 的嵌入。将其与运行 Ollama 或 vLLM 的 Clore.ai GPU 服务器配合,可实现本地推理。
带有真实工具的 AI 智能体 — 内置智能体可以浏览网页、编写并执行代码、管理文件以及调用外部 API——全部通过 GUI 协调。
MCP 兼容性 — 与 Model Context Protocol 生态系统集成,提供扩展的工具连接能力。
工作区隔离 — 为不同项目或团队创建独立工作区,并使用不同的知识库和 LLM 设置。
架构概览
┌─────────────────────────────────────────────┐
│ AnythingLLM(端口 3001) │
│ │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ RAG/文档 │ │ 智能体 │ │ 用户 │ │
│ └────┬─────┘ └────┬─────┘ └──────────┘ │
│ │ │ │
│ ┌────▼─────────────▼───────┐ │
│ │ LLM 提供方路由器 │ │
│ └──────────────┬───────────┘ │
└─────────────────┼───────────────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
OpenAI Anthropic Ollama(本地)
Claude Gemini vLLM(本地)需求
服务器规格
GPU
无需
RTX 3090(如果使用本地 LLM)
仅适用于 Ollama/vLLM 后端
显存
—
24 GB
用于本地模型推理
CPU
2 vCPU
4 vCPU
嵌入在 CPU 上运行
内存
4 GB
8 GB
越多 = 内存中的文档索引越大
存储
10 GB
50+ GB
文档存储、向量数据库、模型缓存
Clore.ai 价格参考
CPU 实例(4 vCPU,8 GB RAM)
约 $0.05–0.10/小时
AnythingLLM + 外部 API 提供方
RTX 3090(24 GB 显存)
$0.07–0.21/小时
AnythingLLM + Ollama 本地 LLM
RTX 4090(24 GB 显存)
$0.14–0.42/小时
AnythingLLM + 更快的本地推理
💡 专业提示: AnythingLLM 内置的嵌入(LanceDB + 本地 CPU 嵌入器)无需 GPU 即可运行。对于 LLM 后端,你可以使用 OpenRouter 或 Groq 等免费层 API 提供方,将成本降到最低。
前提条件
带 SSH 访问的 Clore.ai 服务器
Docker(Clore.ai 服务器上已预装)
至少一个 LLM API 密钥 或 本地 Ollama/vLLM 后端
快速开始
方法 1:单 Docker 容器(推荐)
官方的单容器部署包含了一切:Web UI、LanceDB 向量存储和文档处理器。
步骤 1:连接到你的 Clore.ai 服务器
步骤 2:设置存储目录
步骤 3:运行 AnythingLLM
原因
--cap-add SYS_ADMIN? AnythingLLM 使用 Chromium 进行网页抓取和 PDF 渲染,因此需要更高的容器权限。
步骤 4:验证启动
步骤 5:完成设置向导
在浏览器中打开:
首次设置向导会引导你完成:
创建管理员账户
选择 LLM 提供方
选择嵌入模型
配置你的第一个工作区
方法 2:Docker Compose(多服务)
适用于使用独立服务、便于管理的生产部署:
步骤 1:创建项目目录
步骤 2:创建 docker-compose.yml
步骤 3:创建 .env 文件
步骤 4:启动
方法 3:使用预配置的环境变量
适用于无需设置向导的自动化部署:
配置
LLM 提供方选项
AnythingLLM 支持广泛的 LLM 后端。在 UI 中设置: 设置 → LLM 偏好,或者通过环境变量:
OpenAI:
Anthropic Claude:
Google Gemini:
Ollama(本地):
OpenRouter(可访问 100+ 模型):
嵌入配置
native
CPU(内置)
否
好
openai
OpenAI API
否
优秀
ollama
本地 Ollama
可选
良好-优秀
localai
LocalAI
可选
变量
向量数据库选项
lancedb
内置,无需配置
默认,适用于小到中型数据集
chroma
ChromaDB(外部)
中型数据集,灵活性高
pinecone
Pinecone 云端
大型数据集,生产环境
weaviate
Weaviate(自托管)
高级用例
工作区配置
AnythingLLM 工作区是彼此隔离的环境,拥有各自的:
文档知识库
LLM 设置(可覆盖全局设置)
聊天历史
智能体配置
通过 UI 或 API 创建工作区:
文档导入
通过 UI 或 API 上传文档:
GPU 加速
AnythingLLM 本身运行在 CPU 上。GPU 加速适用于 LLM 推理后端。
在同一台 Clore.ai 服务器上运行 Ollama
Clore.ai 上的 GPU 模型性能
Llama 3.2 3B
RTX 3090
2 GB
快
60–80 tok/s
~$0.20
Llama 3.1 8B
RTX 3090
6 GB
快
40–60 tok/s
~$0.20
Mistral 7B
RTX 3090
5 GB
快
45–65 tok/s
~$0.20
Llama 3.1 70B
A100 80GB
40 GB
中等
20–35 tok/s
~$1.10
提示与最佳实践
文档导入最佳实践
预处理大型 PDF — OCR 密集型扫描会减慢导入速度。请先使用
pdftotext或 Adobe OCR。按工作区组织 — 为每个项目/领域创建独立工作区,以提高检索精度。
使用具体查询 — RAG 最适合处理具体问题,而不是宽泛请求。
Clore.ai 上的成本管理
由于 Clore.ai 实例是临时性的,请务必备份存储目录。它包含:
向量嵌入(LanceDB)
已上传的文档
聊天历史
智能体配置
多用户设置
AI 智能体配置
AnythingLLM 智能体可以执行现实世界任务。在以下位置启用工具: 设置 → 智能体:
网页浏览 — 获取并读取网页
Google 搜索 — 搜索 Google(需要 API 密钥)
代码解释器 — 在沙箱中执行 Python
GitHub — 读取仓库
SQL 连接器 — 查询数据库
性能调优
更新 AnythingLLM
故障排查
容器已启动,但 UI 无法访问
文档上传失败
RAG 响应质量差 / 幻觉
常见原因和修复:
AnythingLLM 无法连接 Ollama
内存不足 / 容器崩溃
延伸阅读
AnythingLLM 文档 — 完整设置和 API 参考
AnythingLLM GitHub — 源代码、问题和路线图
AnythingLLM Docker Hub — 镜像标签
在 Clore.ai 上运行 Ollama — AnythingLLM 的本地 LLM 后端
在 Clore.ai 上运行 vLLM — 高性能推理
GPU 比较指南 — 选择合适的 Clore.ai 套餐
MCP 文档 — 用于扩展代理的模型上下文协议
AnythingLLM API 参考 — 用于自动化的 REST API
最后更新于
这有帮助吗?