For the complete documentation index, see llms.txt. This page is also available as Markdown.

GPT4All 本地 LLM

在 Clore.ai 上部署 GPT4All——使用兼容 OpenAI 的 API 服务器通过 Docker 运行隐私优先的本地 LLM,支持 GGUF 模型,并可选择启用 CUDA 加速以获得最高性能。

概览

GPT4All 由 Nomic AI 开发,是最受欢迎的开源本地 LLM 项目之一,拥有超过 72,000 个 GitHub 星标. 它让你可以完全离线在自己的硬件上运行大型语言模型——无需互联网连接,也不会向第三方发送数据。

GPT4All 最为人熟知的是其精美的桌面应用程序,但它也包含一个 Python 库 (gpt4all 包)以及内置的 兼容 OpenAI 的 API 服务器 运行在端口 4891. 在 Clore.ai 上,你可以在租用的 GPU 上通过 Docker 容器部署 GPT4All,通过 HTTP 提供服务,并将任何兼容 OpenAI 的客户端连接到它。

Docker 注意: GPT4All 并未为服务器组件发布官方 Docker 镜像。本指南使用自定义 Docker 设置,并结合 gpt4all Python 包。若要使用更适合生产环境的 Docker 替代方案来运行 相同的 GGUF 模型文件,请参见 LocalAI 替代方案部分 ——LocalAI 以 Docker 为先,并支持相同的模型格式。

主要特性:

  • 🔒 100% 离线——所有推理都在本地运行

  • 🤖 兼容 OpenAI 的 REST API(端口 4891)

  • 📚 LocalDocs——对自己的文档进行 RAG

  • 🧩 支持所有流行的 GGUF 模型格式

  • 🐍 完整的 Python API,使用 pip install gpt4all

  • 💬 漂亮的桌面 UI(与服务器无关,但适合本地测试)


需求

硬件要求

层级
GPU
显存
内存
存储
Clore.ai 价格

仅 CPU

16 GB

50 GB SSD

约 $0.02/小时(CPU 服务器)

入门级 GPU

RTX 3060 12GB

12 GB

16 GB

50 GB SSD

$0.03–0.07/小时

推荐

RTX 3090

24 GB

32 GB

100 GB SSD

$0.07–0.21/小时

高端

RTX 4090

24 GB

64 GB

200 GB SSD

$0.14–0.42/小时

注意: GPT4All 的 GPU 支持底层通过 llama.cpp 使用 CUDA。与 vLLM 不同,它并不 要求特定的 CUDA 计算能力——RTX 10xx 及更新的显卡通常都可以。

模型显存需求(GGUF Q4_K_M)

模型
磁盘占用
显存
最低 GPU

Phi-3 Mini 3.8B

~2.4 GB

~3 GB

RTX 3060

Mistral 7B Instruct

~4.1 GB

~5 GB

RTX 3060

Llama 3.1 8B Instruct

~4.7 GB

~6 GB

RTX 3060

Llama 3 70B Instruct

约 40 GB

~45 GB

A100 80GB

Mixtral 8x7B

~26 GB

~30 GB

2× RTX 3090


快速开始

步骤 1——在 Clore.ai 上租用 GPU 服务器

  1. 登录到 clore.ai

  2. 筛选: 已启用 Docker, GPU:RTX 3090(适用于 7B–13B 模型)

  3. 使用以下镜像部署: nvidia/cuda:12.8.1-runtime-ubuntu22.04

  4. 开放端口: 4891 (GPT4All API), 22 (SSH)

  5. 至少分配 50 GB 的磁盘空间

步骤 2 — 通过 SSH 连接

步骤 3——构建 GPT4All Docker 镜像

由于没有官方 GPT4All Docker 镜像,我们将自行构建一个:

步骤 4——创建 API 服务器脚本

步骤 5——构建并运行

步骤 6——测试 API


替代方案:LocalAI Docker 镜像

对于更稳健、适合生产环境的 Docker 部署,用于运行 相同的 GGUF 模型 与 GPT4All 相同的模型,LocalAI 是推荐选择。它拥有官方 Docker 镜像、CUDA 支持,并且维护活跃:


配置

GPT4All 服务器环境变量

变量
默认值
描述

MODEL_NAME

mistral-7b-instruct...

模型文件名或 GPT4All hub 名称

MODEL_PATH

/models

包含模型文件的目录

DEVICE

gpu

gpu, cpu,或 metal (macOS)

N_CTX

4096

上下文窗口大小(tokens)

API_HOST

0.0.0.0

绑定地址

API_PORT

4891

API 服务器端口

Docker Compose 设置


GPU 加速

验证 GPU 使用情况

GPT4All Python 库使用 llama.cpp 底层使用带 CUDA 支持的:

选择 GPU 层

gpu_layers (或 n_gpu_layers)参数控制模型在 GPU 与 CPU 上运行的比例:

CPU 回退模式

如果没有可用的 GPU(例如,仅 CPU 的 Clore.ai 测试服务器):

⚠️ CPU 推理是 慢 10–50 倍 比 GPU。对于仅 CPU 的服务器,请使用小模型(Phi-3 Mini、TinyLlama),并预期每秒 2–5 个 token。


提示与最佳实践

📥 预先下载模型

不要依赖启动时自动下载,预先下载模型以便更快重启:

🔌 在 Python 应用中使用

💰 在 Clore.ai 上优化成本


故障排查

模型加载失败——未找到文件

CUDA 错误:此架构没有可用的内核映像

API 返回 503——模型未加载

端口 4891 无法从外部访问


延伸阅读

💡 推荐: 如果你想要最简单的本地 LLM Docker 部署,请考虑 Ollama 改用它——它有官方 Docker 镜像,内置 GPU 支持,并且专为服务器端部署而设计。GPT4All 的优势在于其精美的桌面 UI 和 LocalDocs(RAG)功能,而这些在服务器模式下不可用。

最后更新于

这有帮助吗?