Text Generation WebUI
在 Clore.ai GPU 上运行 text-generation-webui 进行 LLM 推理
运行支持所有模型格式的最受欢迎的 LLM 界面。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
在 CLORE.AI 上租用
访问 CLORE.AI 市场
按 GPU 类型、VRAM 和价格筛选
选择 按需 (固定费率)或 竞价 (出价)
配置你的订单:
选择 Docker 镜像
设置端口(SSH 用 TCP,Web UI 用 HTTP)
如有需要,添加环境变量
输入启动命令
选择支付方式: CLORE, BTC,或 USDT/USDC
创建订单并等待部署
访问你的服务器
在以下位置查找连接信息 我的订单
Web 界面:使用 HTTP 端口 URL
SSH:
ssh -p <port> root@<proxy-address>
为什么选择 Text Generation WebUI?
支持 GGUF、GPTQ、AWQ、EXL2、HF 格式
内置聊天、笔记本和 API 模式
扩展:语音、角色、多模态
支持微调
可随时切换模型
需求
7B(Q4)
6GB
RTX 3060
13B(Q4)
10GB
RTX 3080
30B(Q4)
20GB
RTX 4090
70B(Q4)
40GB
A100
快速部署
Docker 镜像:
端口:
环境变量:
手动安装
镜像:
端口:
命令:
访问你的服务
部署后,找到你的 http_pub URL 在 我的订单:
前往 我的订单 页面
点击你的订单
找到
http_pubURL(例如,abc123.clorecloud.net)
使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。
访问 WebUI
等待部署完成
在以下位置找到 7860 端口映射: 我的订单
打开:
http://<proxy>:<port>
下载模型
从 HuggingFace(在 WebUI 中)
前往 模型 标签页
输入模型名称:
bartowski/Meta-Llama-3.1-8B-Instruct-GGUF点击 下载
通过命令行
推荐模型
用于聊天:
用于编程:
用于角色扮演:
加载模型
GGUF(推荐给大多数用户)
模型 标签页 → 选择模型文件夹
模型加载器: llama.cpp
设置 n-gpu-layers:
RTX 3090:35-40
RTX 4090:45-50
A100:80+
点击 加载
GPTQ(快速,量化)
下载 GPTQ 模型
模型加载器: ExLlama_HF 或 AutoGPTQ
加载模型
EXL2(最快)
下载 EXL2 模型
模型加载器: ExLlamav2_HF
加载
聊天配置
角色设置
前往 参数 → 角色
创建或加载角色卡
设置:
名称
上下文/人设
示例对话
指令模式
适用于指令微调模型:
参数 → 指令模板
选择与您的模型匹配的模板:
Llama-2-chat
Mistral
ChatML
Alpaca
API 使用
启用 API
先从 --api 参数(默认端口 5000)
兼容 OpenAI 的 API
原生 API
扩展
安装扩展
启用扩展
会话 标签页 → 扩展
勾选需要的扩展
点击 应用并重启
热门扩展
silero_tts
语音输出
whisper_stt
语音输入
superbooga
文档问答
sd_api_pictures
图像生成
multimodal
图像理解
性能调优
GGUF 设置
内存优化
对于显存有限的情况:
速度优化
微调(LoRA)
训练标签页
前往 训练 标签页
加载基础模型
上传数据集(JSON 格式)
配置:
LoRA rank:8-32
学习率:1e-4
训练轮数:3-5
开始训练
数据集格式
保存你的工作
故障排查
模型无法加载
检查显存使用情况:
nvidia-smi减少
n_gpu_layers使用更小的量化(Q4_K_M → Q4_K_S)
生成缓慢
增大
n_gpu_layers使用 EXL2 而不是 GGUF
启用
--no-mmap
内存不足
生成过程中 - 减少 `n_ctx`(上下文长度) - CPU 仅模式使用 `--n-gpu-layers 0` - 尝试更小的模型
成本估算
CLORE.AI 市场常见费率(截至 2024 年):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
价格因提供商和需求而异。请查看 CLORE.AI 市场 以获取当前费率。
节省费用:
使用 竞价 可中断工作市场——约三分之一的服务器将现货价格定得低于按需价格(中位数约优惠 13%),其余则与按需价格持平
使用 CLORE 代币支付
比较不同提供商的价格
最后更新于
这有帮助吗?