Open WebUI
在 Clore.ai GPU 上运行 LLM 的 ChatGPT 式界面
用于在 CLORE.AI GPU 上运行大型语言模型的类似 ChatGPT 的精美界面。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行: CLORE.AI 市场.
为什么选择 Open WebUI?
类似 ChatGPT 的界面 - 熟悉且精致的界面
多模型 - 轻松在模型之间切换
内置 RAG - 上传文档以提供上下文
用户管理 - 支持多用户
历史记录 - 会话持久化
Ollama 集成 - 开箱即用
在 CLORE.AI 上快速部署
Docker 镜像:
ghcr.io/open-webui/open-webui:cuda端口:
22/tcp
8080/http命令:
访问您的服务
部署后,在以下位置查找您的 http_pub URL: 我的订单:
前往 我的订单 页面
单击您的订单
查找
http_pubURL(例如,abc123.clorecloud.net)
使用 https://YOUR_HTTP_PUB_URL 而不是 localhost 在下面的示例中。
验证是否正常运行
响应:
如果收到 HTTP 502,请等待 1-2 分钟——服务仍在启动中。
安装
使用 Ollama(推荐)
一体化(捆绑 Ollama)
首次设置
打开
http://your-server:8080创建管理员账户(第一个用户将成为管理员)
前往 设置 → 模型 → 拉取模型
开始聊天!
功能
聊天界面
Markdown 渲染
代码高亮
图像生成(与兼容模型)
语音输入/输出
文件附件
模型管理
可直接从 UI 拉取模型
创建自定义模型
设置默认模型
模型专属设置
RAG(文档聊天)
在聊天中点击 "+"
上传 PDF、TXT 或其他文档
就内容提问
用户管理
多用户
基于角色的访问控制
API 密钥管理
使用情况跟踪
配置
使用环境变量进行 SSH 和 Jupyter 访问:
关键设置
OLLAMA_BASE_URL
Ollama API URL
http://localhost:11434
WEBUI_AUTH
启用认证
True
WEBUI_NAME
实例名称
打开 WebUI
DEFAULT_MODELS
默认模型
-
ENABLE_RAG_WEB_SEARCH
RAG 中的网页搜索
False
连接到远程 Ollama
Docker Compose
API 参考
Open WebUI 提供多个 API 端点:
/health
GET
健康检查
/api/version
GET
获取 Open WebUI 版本
/api/config
GET
获取配置
/ollama/api/tags
GET
列出 Ollama 模型(代理)
/ollama/api/chat
POST
与 Ollama 聊天(代理)
检查健康状态
响应: true
获取版本
响应:
列出模型(通过 Ollama 代理)
提示
更快的响应
使用量化模型(Q4_K_M)
在设置中启用流式传输
如有需要,减少上下文长度
更好的质量
使用更大的模型(13B 及以上)
使用 Q8 量化
在模型设置中调整温度
节省资源
设置
OLLAMA_KEEP_ALIVE=5m卸载未使用的模型
测试时使用更小的模型
GPU 要求
相同于 Ollama.
Open WebUI 本身使用的资源很少(约 500MB 内存)。
# 使用固定种子以获得一致结果
无法连接到 Ollama
模型未显示
在设置中检查 Ollama 连接
刷新模型列表
通过 CLI 拉取模型:
ollama pull modelname
性能缓慢
检查是否使用了 GPU:
nvidia-smi尝试更小/量化的模型
减少并发用户数
下载所有所需的检查点
基础(7B)
按小时费率
~$0.03
标准(13B)
速度
~$0.06
高级(34B)
512x512
~$0.10
企业(70B)
2s
~$0.17
使用以下方式支付
Ollama - CLI 使用
LocalAI - 更多后端
RAG + LangChain - 高级 RAG
最后更新于
这有帮助吗?