GPT4All 本地 LLM
在 Clore.ai 上部署 GPT4All——使用兼容 OpenAI 的 API 服务器通过 Docker 运行隐私优先的本地 LLM,支持 GGUF 模型,并可选择启用 CUDA 加速以获得最高性能。
概览
GPT4All 由 Nomic AI 开发,是最受欢迎的开源本地 LLM 项目之一,拥有超过 72,000 个 GitHub 星标. 它让你可以完全离线在自己的硬件上运行大型语言模型——无需互联网连接,也不会向第三方发送数据。
GPT4All 最为人熟知的是其精美的桌面应用程序,但它也包含一个 Python 库 (gpt4all 包)以及内置的 兼容 OpenAI 的 API 服务器 运行在端口 4891. 在 Clore.ai 上,你可以在租用的 GPU 上通过 Docker 容器部署 GPT4All,通过 HTTP 提供服务,并将任何兼容 OpenAI 的客户端连接到它。
Docker 注意: GPT4All 并未为服务器组件发布官方 Docker 镜像。本指南使用自定义 Docker 设置,并结合
gpt4allPython 包。若要使用更适合生产环境的 Docker 替代方案来运行 相同的 GGUF 模型文件,请参见 LocalAI 替代方案部分 ——LocalAI 以 Docker 为先,并支持相同的模型格式。
主要特性:
🔒 100% 离线——所有推理都在本地运行
🤖 兼容 OpenAI 的 REST API(端口 4891)
📚 LocalDocs——对自己的文档进行 RAG
🧩 支持所有流行的 GGUF 模型格式
🐍 完整的 Python API,使用
pip install gpt4all💬 漂亮的桌面 UI(与服务器无关,但适合本地测试)
需求
硬件要求
仅 CPU
无
—
16 GB
50 GB SSD
约 $0.02/小时(CPU 服务器)
入门级 GPU
RTX 3060 12GB
12 GB
16 GB
50 GB SSD
$0.03–0.07/小时
推荐
RTX 3090
24 GB
32 GB
100 GB SSD
$0.07–0.21/小时
高端
RTX 4090
24 GB
64 GB
200 GB SSD
$0.14–0.42/小时
注意: GPT4All 的 GPU 支持底层通过 llama.cpp 使用 CUDA。与 vLLM 不同,它并不 不 要求特定的 CUDA 计算能力——RTX 10xx 及更新的显卡通常都可以。
模型显存需求(GGUF Q4_K_M)
Phi-3 Mini 3.8B
~2.4 GB
~3 GB
RTX 3060
Mistral 7B Instruct
~4.1 GB
~5 GB
RTX 3060
Llama 3.1 8B Instruct
~4.7 GB
~6 GB
RTX 3060
Llama 3 70B Instruct
约 40 GB
~45 GB
A100 80GB
Mixtral 8x7B
~26 GB
~30 GB
2× RTX 3090
快速开始
步骤 1——在 Clore.ai 上租用 GPU 服务器
登录到 clore.ai
筛选: 已启用 Docker, GPU:RTX 3090(适用于 7B–13B 模型)
使用以下镜像部署:
nvidia/cuda:12.8.1-runtime-ubuntu22.04开放端口: 4891 (GPT4All API), 22 (SSH)
至少分配 50 GB 的磁盘空间
步骤 2 — 通过 SSH 连接
步骤 3——构建 GPT4All Docker 镜像
由于没有官方 GPT4All Docker 镜像,我们将自行构建一个:
步骤 4——创建 API 服务器脚本
步骤 5——构建并运行
步骤 6——测试 API
替代方案:LocalAI Docker 镜像
对于更稳健、适合生产环境的 Docker 部署,用于运行 相同的 GGUF 模型 与 GPT4All 相同的模型,LocalAI 是推荐选择。它拥有官方 Docker 镜像、CUDA 支持,并且维护活跃:
配置
GPT4All 服务器环境变量
MODEL_NAME
mistral-7b-instruct...
模型文件名或 GPT4All hub 名称
MODEL_PATH
/models
包含模型文件的目录
DEVICE
gpu
gpu, cpu,或 metal (macOS)
N_CTX
4096
上下文窗口大小(tokens)
API_HOST
0.0.0.0
绑定地址
API_PORT
4891
API 服务器端口
Docker Compose 设置
GPU 加速
验证 GPU 使用情况
GPT4All Python 库使用 llama.cpp 底层使用带 CUDA 支持的:
选择 GPU 层
该 gpu_layers (或 n_gpu_layers)参数控制模型在 GPU 与 CPU 上运行的比例:
CPU 回退模式
如果没有可用的 GPU(例如,仅 CPU 的 Clore.ai 测试服务器):
⚠️ CPU 推理是 慢 10–50 倍 比 GPU。对于仅 CPU 的服务器,请使用小模型(Phi-3 Mini、TinyLlama),并预期每秒 2–5 个 token。
提示与最佳实践
📥 预先下载模型
不要依赖启动时自动下载,预先下载模型以便更快重启:
🔌 在 Python 应用中使用
💰 在 Clore.ai 上优化成本
故障排查
模型加载失败——未找到文件
CUDA 错误:此架构没有可用的内核映像
API 返回 503——模型未加载
端口 4891 无法从外部访问
延伸阅读
GPT4All GitHub — 主仓库
GPT4All Python 文档 — Python API 参考
GPT4All 模型浏览器 — 浏览可用模型
LocalAI 文档 — 对 Docker 友好的替代方案
Clore.ai 上的 Ollama — 更容易的 Docker LLM 部署
Clore.ai 上的 vLLM — 生产级推理服务器
GPU 比较指南 — 选择合适的 Clore.ai GPU
HuggingFace 上的 TheBloke — 数千种 GGUF 量化模型
GGUF 格式说明 — 模型格式文档
💡 推荐: 如果你想要最简单的本地 LLM Docker 部署,请考虑 Ollama 改用它——它有官方 Docker 镜像,内置 GPU 支持,并且专为服务器端部署而设计。GPT4All 的优势在于其精美的桌面 UI 和 LocalDocs(RAG)功能,而这些在服务器模式下不可用。
最后更新于
这有帮助吗?