Jan.ai 离线助手
在 Clore.ai 上部署 Jan.ai Server——一个完全离线、兼容 OpenAI 的 LLM 服务器,具有模型中心、对话管理和由 Cortex 引擎驱动的 GPU 加速推理。
概览
Jan.ai 是一个开源、隐私优先的 ChatGPT 替代方案,GitHub 星标超过 40,000。Jan 最出名的是桌面应用,但其服务器组件—— Jan Server ——提供了一个完全兼容 OpenAI 的 REST API,可部署在 Clore.ai 之类的云 GPU 基础设施上。
Jan Server 基于 Cortex.cpp 推理引擎构建,这是一个支持 llama.cpp, TensorRT-LLM和 ONNX 后端的高性能运行时。在 Clore.ai 上,你最低只需 $0.20/小时,就能通过 Docker Compose 运行 Jan Server,加载任意 GGUF 或 GPTQ 模型,并通过兼容 OpenAI 的 API 提供服务——所有数据都不会离开机器。
主要特性:
🔒 100% 离线——没有任何数据会离开你的服务器
🤖 兼容 OpenAI 的 API(
/v1/chat/completions,/v1/models等)📦 模型中心,支持一键下载模型
🚀 通过 CUDA 加速(llama.cpp + TensorRT-LLM 后端)
💬 内置对话管理和线程历史记录
🔌 可直接替换现有应用中的 OpenAI
需求
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
硬件要求
最低
RTX 3060 12GB
12 GB
16 GB
50 GB SSD
$0.03–0.07/小时
推荐
RTX 3090
24 GB
32 GB
100 GB SSD
$0.07–0.21/小时
高端
RTX 4090
24 GB
64 GB
200 GB SSD
$0.14–0.42/小时
模型 VRAM 参考
Llama 3.1 8B(Q4)
~5 GB
RTX 3060
Llama 3.1 8B(FP16)
约 16 GB
RTX 3090
Llama 3.3 70B(Q4)
约 40 GB
A100 40GB
Llama 3.1 405B(Q4)
约 220 GB
4× A100 80GB
Mistral 7B(Q4)
约 4 GB
RTX 3060
Qwen2.5 72B(Q4)
约 45 GB
A100 80GB
软件前置条件
已充值钱包的 Clore.ai 账户
基础 Docker 知识
(可选)用于端口转发的 OpenSSH 客户端
快速开始
第 1 步——在 Clore.ai 上租用 GPU 服务器
浏览到 clore.ai 并登录
筛选服务器: GPU 类型 → RTX 3090 或更高, Docker → 已启用
选择一台服务器并选择 Docker 部署选项
使用官方
nvidia/cuda:12.8.1-devel-ubuntu22.04基础镜像或任意 CUDA 镜像开放端口: 1337 (Jan Server API), 39281 (Cortex API), 22 (SSH)
第 2 步——连接到你的服务器
第 3 步——安装 Docker Compose(如果尚未安装)
第 4 步——使用 Docker Compose 部署 Jan Server
如果上游 compose 文件不可用,或者你想要完全控制,可以手动创建:
第 5 步——验证服务器是否正在运行
第 6 步——拉取你的第一个模型
第 7 步——启动模型并聊天
配置
环境变量
JAN_API_HOST
0.0.0.0
绑定 API 服务器的主机
JAN_API_PORT
1337
Jan Server API 端口
CORTEX_API_PORT
39281
内部 Cortex 引擎端口
CUDA_VISIBLE_DEVICES
all
要暴露哪些 GPU(逗号分隔的索引)
JAN_DATA_FOLDER
/root/jan
Jan 数据文件夹路径
CORTEX_MODELS_PATH
/root/cortex/models
模型存储路径
多 GPU 配置
对于有多块 GPU 的服务器(例如 Clore.ai 上的 2× RTX 3090):
或者要专门指定某些 GPU:
自定义模型配置
使用令牌保护 API
Jan Server 默认不包含身份验证。请使用 Nginx 作为反向代理:
GPU 加速
验证 CUDA 加速
Jan Server 的 Cortex 引擎会自动检测 CUDA。验证它是否正在使用 GPU:
切换推理后端
Cortex 支持多个后端:
上下文窗口与批大小调优
ngl
GPU 层数(越高 = 使用更多 GPU)
设置为 99 以将 GPU 用满
ctx_len
上下文窗口大小
根据 VRAM 而定,4096–32768
n_batch
用于提示词处理的批大小
RTX 3090 设为 512,更小的显卡设为 256
n_parallel
并发请求槽位
API 服务器使用时为 4–8
提示与最佳实践
🎯 Clore.ai 预算的模型选择
💾 持久化模型存储
由于 Clore.ai 实例是临时的,建议挂载外部存储:
🔗 将 Jan Server 作为 OpenAI 直替
📊 监控资源使用情况
故障排查
容器启动失败——未找到 GPU
模型下载卡住或失败
VRAM 不足(CUDA 内存不足)
无法从容器外连接到 API
推理缓慢(CPU 回退)
延伸阅读
Jan.ai 官方文档 — 完整平台文档
Jan GitHub 仓库 — 源代码与问题
Jan Server / Jan API — 服务器相关文档
Cortex.cpp 引擎 — 底层推理引擎
Clore.ai 入门指南 — 平台基础
GPU 比较指南 — 选择合适的 GPU
在 Clore.ai 上运行 Ollama — 替代 LLM 服务器
在 Clore.ai 上运行 vLLM — 高吞吐推理服务器
Hugging Face 模型中心 — 查找 GGUF 模型
💡 成本提示: Clore.ai 上的一块 RTX 3090($0.07–0.21/小时)可以以 约 50 tokens/秒 运行 Llama 3.1 8B——足够个人使用或低流量 API。对于生产工作负载,考虑使用 vLLM(见 vLLM 指南)部署在 A100 上。
最后更新于
这有帮助吗?