For the complete documentation index, see llms.txt. This page is also available as Markdown.

Jan.ai 离线助手

在 Clore.ai 上部署 Jan.ai Server——一个完全离线、兼容 OpenAI 的 LLM 服务器,具有模型中心、对话管理和由 Cortex 引擎驱动的 GPU 加速推理。

概览

Jan.ai 是一个开源、隐私优先的 ChatGPT 替代方案,GitHub 星标超过 40,000。Jan 最出名的是桌面应用,但其服务器组件—— Jan Server ——提供了一个完全兼容 OpenAI 的 REST API,可部署在 Clore.ai 之类的云 GPU 基础设施上。

Jan Server 基于 Cortex.cpp 推理引擎构建,这是一个支持 llama.cpp, TensorRT-LLM和 ONNX 后端的高性能运行时。在 Clore.ai 上,你最低只需 $0.20/小时,就能通过 Docker Compose 运行 Jan Server,加载任意 GGUF 或 GPTQ 模型,并通过兼容 OpenAI 的 API 提供服务——所有数据都不会离开机器。

主要特性:

  • 🔒 100% 离线——没有任何数据会离开你的服务器

  • 🤖 兼容 OpenAI 的 API(/v1/chat/completions, /v1/models等)

  • 📦 模型中心,支持一键下载模型

  • 🚀 通过 CUDA 加速(llama.cpp + TensorRT-LLM 后端)

  • 💬 内置对话管理和线程历史记录

  • 🔌 可直接替换现有应用中的 OpenAI


需求

硬件要求

层级
GPU
显存
内存
存储
Clore.ai 价格

最低

RTX 3060 12GB

12 GB

16 GB

50 GB SSD

$0.03–0.07/小时

推荐

RTX 3090

24 GB

32 GB

100 GB SSD

$0.07–0.21/小时

高端

RTX 4090

24 GB

64 GB

200 GB SSD

$0.14–0.42/小时

大型模型

A100 80GB

80 GB

128 GB

500 GB SSD

模型 VRAM 参考

模型
所需显存
推荐 GPU

Llama 3.1 8B(Q4)

~5 GB

RTX 3060

Llama 3.1 8B(FP16)

约 16 GB

RTX 3090

Llama 3.3 70B(Q4)

约 40 GB

A100 40GB

Llama 3.1 405B(Q4)

约 220 GB

4× A100 80GB

Mistral 7B(Q4)

约 4 GB

RTX 3060

Qwen2.5 72B(Q4)

约 45 GB

A100 80GB

软件前置条件

  • 已充值钱包的 Clore.ai 账户

  • 基础 Docker 知识

  • (可选)用于端口转发的 OpenSSH 客户端


快速开始

第 1 步——在 Clore.ai 上租用 GPU 服务器

  1. 浏览到 clore.ai 并登录

  2. 筛选服务器: GPU 类型 → RTX 3090 或更高, Docker → 已启用

  3. 选择一台服务器并选择 Docker 部署选项

  4. 使用官方 nvidia/cuda:12.8.1-devel-ubuntu22.04 基础镜像或任意 CUDA 镜像

  5. 开放端口: 1337 (Jan Server API), 39281 (Cortex API), 22 (SSH)

第 2 步——连接到你的服务器

第 3 步——安装 Docker Compose(如果尚未安装)

第 4 步——使用 Docker Compose 部署 Jan Server

如果上游 compose 文件不可用,或者你想要完全控制,可以手动创建:

第 5 步——验证服务器是否正在运行

第 6 步——拉取你的第一个模型

第 7 步——启动模型并聊天


配置

环境变量

变量
默认值
描述

JAN_API_HOST

0.0.0.0

绑定 API 服务器的主机

JAN_API_PORT

1337

Jan Server API 端口

CORTEX_API_PORT

39281

内部 Cortex 引擎端口

CUDA_VISIBLE_DEVICES

all

要暴露哪些 GPU(逗号分隔的索引)

JAN_DATA_FOLDER

/root/jan

Jan 数据文件夹路径

CORTEX_MODELS_PATH

/root/cortex/models

模型存储路径

多 GPU 配置

对于有多块 GPU 的服务器(例如 Clore.ai 上的 2× RTX 3090):

或者要专门指定某些 GPU:

自定义模型配置

使用令牌保护 API

Jan Server 默认不包含身份验证。请使用 Nginx 作为反向代理:


GPU 加速

验证 CUDA 加速

Jan Server 的 Cortex 引擎会自动检测 CUDA。验证它是否正在使用 GPU:

切换推理后端

Cortex 支持多个后端:

上下文窗口与批大小调优

参数
描述
建议

ngl

GPU 层数(越高 = 使用更多 GPU)

设置为 99 以将 GPU 用满

ctx_len

上下文窗口大小

根据 VRAM 而定,4096–32768

n_batch

用于提示词处理的批大小

RTX 3090 设为 512,更小的显卡设为 256

n_parallel

并发请求槽位

API 服务器使用时为 4–8


提示与最佳实践

🎯 Clore.ai 预算的模型选择

💾 持久化模型存储

由于 Clore.ai 实例是临时的,建议挂载外部存储:

🔗 将 Jan Server 作为 OpenAI 直替

📊 监控资源使用情况


故障排查

容器启动失败——未找到 GPU

模型下载卡住或失败

VRAM 不足(CUDA 内存不足)

无法从容器外连接到 API

推理缓慢(CPU 回退)


延伸阅读

💡 成本提示: Clore.ai 上的一块 RTX 3090($0.07–0.21/小时)可以以 约 50 tokens/秒 运行 Llama 3.1 8B——足够个人使用或低流量 API。对于生产工作负载,考虑使用 vLLM(见 vLLM 指南)部署在 A100 上。

最后更新于

这有帮助吗?