Kohya 训练
在 Clore.ai 上使用 Kohya 训练 Stable Diffusion 的 LoRA 和 DreamBooth
使用 Kohya 的训练器训练 Stable Diffusion 的 LoRA、Dreambooth 和完整微调。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
在 CLORE.AI 上租用
访问 CLORE.AI 市场
按 GPU 类型、VRAM 和价格筛选
选择 按需 (固定费率)或 竞价 (出价)
配置你的订单:
选择 Docker 镜像
设置端口(SSH 用 TCP,Web UI 用 HTTP)
如有需要,添加环境变量
输入启动命令
选择支付方式: CLORE, BTC,或 USDT/USDC
创建订单并等待部署
访问你的服务器
在以下位置查找连接信息 我的订单
Web 界面:使用 HTTP 端口 URL
SSH:
ssh -p <port> root@<proxy-address>
什么是 Kohya?
Kohya_ss 是一个训练工具包,适用于:
LoRA - 轻量级适配器(最受欢迎)
Dreambooth - 主体/风格训练
完整微调 - 完整模型训练
LyCORIS - 高级 LoRA 变体
需求
LoRA SD 1.5
6GB
RTX 3060
LoRA SDXL
12GB
RTX 3090
Dreambooth SD 1.5
12GB
RTX 3090
Dreambooth SDXL
24GB
RTX 4090
快速部署
Docker 镜像:
端口:
命令:
访问你的服务
部署后,找到你的 http_pub URL 在 我的订单:
前往 我的订单 页面
点击你的订单
找到
http_pubURL(例如,abc123.clorecloud.net)
使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。
使用 Web UI
访问地址:
http://<proxy>:<port>选择训练类型(LoRA、Dreambooth 等)
配置设置
开始训练
数据集准备
文件夹结构
图像要求
分辨率: 512x512(SD 1.5)或 1024x1024(SDXL)
格式: PNG 或 JPG
数量: LoRA 需要 10-50 张图像
质量: 清晰、光线充足、角度多样
标注文件
创建 .txt 与图像同名的文件:
myimage.txt:
自动标注
使用 BLIP 自动生成标注:
LoRA 训练(SD 1.5)
配置
在 Kohya UI 中:
模型
runwayml/stable-diffusion-v1-5
网络秩
32-128
网络 Alpha
16-64
学习率
1e-4
批大小
1-4
轮数
10-20
优化器
AdamW8bit
命令行训练
LoRA 训练(SDXL)
Dreambooth 训练
主体训练
风格训练
训练技巧
最佳设置
网络秩
64-128
32-64
32
网络 Alpha
32-64
16-32
16
学习率
1e-4
5e-5
1e-4
轮数
15-25
10-15
10-15
避免过拟合
使用正则化图像
降低学习率
减少轮次
提高网络 alpha
避免欠拟合
更多训练图像
更高学习率
更多轮次
降低网络 alpha
监控训练
TensorBoard
关键指标
loss - 应该下降然后稳定
lr - 学习率调度
轮次 - 训练进度
测试你的 LoRA
使用 Automatic1111
将 LoRA 复制到:
在提示词中使用:
使用 ComfyUI
加载 LoRA 节点并连接到模型。
使用 Diffusers
高级训练
LyCORIS(LoHa、LoKR)
文本反演
保存与导出
下载训练好的模型
转换格式
成本估算
CLORE.AI 市场常见费率(截至 2024 年):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
价格因提供商和需求而异。请查看 CLORE.AI 市场 以获取当前费率。
节省费用:
使用 竞价 可中断工作市场——约三分之一的服务器将现货价格定得低于按需价格(中位数约优惠 13%),其余则与按需价格持平
使用 CLORE 代币支付
比较不同提供商的价格
FLUX LoRA 训练
为 FLUX.1-dev 和 FLUX.1-schnell 训练 LoRA 适配器——新一代扩散 Transformer 模型,质量更高。
显存要求
FLUX.1-schnell
16GB
RTX 4080 / 3090
FLUX.1-dev
24GB
RTX 4090
FLUX.1-dev (bf16)
40GB+
A100 40GB
注意: FLUX 使用 DiT(Diffusion Transformer)架构——其训练动态与 SD 1.5 / SDXL 有显著不同。
FLUX 安装
安装支持 CUDA 12.8 的 PyTorch:
FLUX LoRA 配置(flux_lora.toml)
FLUX LoRA 训练命令
FLUX 与 SDXL:主要区别
学习率
1e-3 到 1e-4
1e-4 到 5e-5
精度
fp16 或 bf16
必须使用 bf16
网络模块
networks.lora
networks.lora_flux
网络维度
32–128
8–64(更小)
优化器
AdamW8bit
Adafactor
最低显存
12GB
16–24GB
架构
U-Net
DiT(Transformer)
FLUX 学习率指南
提示: FLUX 对学习率比 SDXL 更敏感。起始值设为
1e-4并降低到5e-5如果你看到质量问题。对于 SDXL,1e-3很常见——FLUX 请避免使用。
测试 FLUX LoRA
故障排查
显存溢出错误
将批次大小降为 1
启用梯度检查点
使用 8 位优化器
降低分辨率
结果不佳
更多/更好的训练图像
调整学习率
检查标注是否与图像匹配
尝试不同的网络秩
训练崩溃
检查 CUDA 版本
更新 xformers
减小批量大小
检查磁盘空间
FLUX 特定问题
“不支持 bf16” — 使用 A 系列(Ampere 及以上)或 RTX 30/40 系列 GPU
FLUX.1-dev 上出现 OOM — 切换到 FLUX.1-schnell(需要 16GB)或启用
cache_text_encoder_outputs模糊结果 — 增加
network_dim到 32–64,将学习率降低到5e-5NaN 损失 — 禁用
full_bf16,检查你的数据集中是否有损坏的图像
最后更新于
这有帮助吗?