For the complete documentation index, see llms.txt. This page is also available as Markdown.

Kohya 训练

在 Clore.ai 上使用 Kohya 训练 Stable Diffusion 的 LoRA 和 DreamBooth

使用 Kohya 的训练器训练 Stable Diffusion 的 LoRA、Dreambooth 和完整微调。

在 CLORE.AI 上租用

  1. 按 GPU 类型、VRAM 和价格筛选

  2. 选择 按需 (固定费率)或 竞价 (出价)

  3. 配置你的订单:

    • 选择 Docker 镜像

    • 设置端口(SSH 用 TCP,Web UI 用 HTTP)

    • 如有需要,添加环境变量

    • 输入启动命令

  4. 选择支付方式: CLORE, BTC,或 USDT/USDC

  5. 创建订单并等待部署

访问你的服务器

  • 在以下位置查找连接信息 我的订单

  • Web 界面:使用 HTTP 端口 URL

  • SSH: ssh -p <port> root@<proxy-address>

什么是 Kohya?

Kohya_ss 是一个训练工具包,适用于:

  • LoRA - 轻量级适配器(最受欢迎)

  • Dreambooth - 主体/风格训练

  • 完整微调 - 完整模型训练

  • LyCORIS - 高级 LoRA 变体

需求

训练类型
最低显存
推荐

LoRA SD 1.5

6GB

RTX 3060

LoRA SDXL

12GB

RTX 3090

Dreambooth SD 1.5

12GB

RTX 3090

Dreambooth SDXL

24GB

RTX 4090

快速部署

Docker 镜像:

端口:

命令:

访问你的服务

部署后,找到你的 http_pub URL 在 我的订单:

  1. 前往 我的订单 页面

  2. 点击你的订单

  3. 找到 http_pub URL(例如, abc123.clorecloud.net)

使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。

使用 Web UI

  1. 访问地址: http://<proxy>:<port>

  2. 选择训练类型(LoRA、Dreambooth 等)

  3. 配置设置

  4. 开始训练

数据集准备

文件夹结构

图像要求

  • 分辨率: 512x512(SD 1.5)或 1024x1024(SDXL)

  • 格式: PNG 或 JPG

  • 数量: LoRA 需要 10-50 张图像

  • 质量: 清晰、光线充足、角度多样

标注文件

创建 .txt 与图像同名的文件:

myimage.txt:

自动标注

使用 BLIP 自动生成标注:

LoRA 训练(SD 1.5)

配置

在 Kohya UI 中:

设置
数值

模型

runwayml/stable-diffusion-v1-5

网络秩

32-128

网络 Alpha

16-64

学习率

1e-4

批大小

1-4

轮数

10-20

优化器

AdamW8bit

命令行训练

LoRA 训练(SDXL)

Dreambooth 训练

主体训练

风格训练

训练技巧

最佳设置

参数
人物/角色
风格
物体

网络秩

64-128

32-64

32

网络 Alpha

32-64

16-32

16

学习率

1e-4

5e-5

1e-4

轮数

15-25

10-15

10-15

避免过拟合

  • 使用正则化图像

  • 降低学习率

  • 减少轮次

  • 提高网络 alpha

避免欠拟合

  • 更多训练图像

  • 更高学习率

  • 更多轮次

  • 降低网络 alpha

监控训练

TensorBoard

关键指标

  • loss - 应该下降然后稳定

  • lr - 学习率调度

  • 轮次 - 训练进度

测试你的 LoRA

使用 Automatic1111

将 LoRA 复制到:

在提示词中使用:

使用 ComfyUI

加载 LoRA 节点并连接到模型。

使用 Diffusers

高级训练

LyCORIS(LoHa、LoKR)

文本反演

保存与导出

下载训练好的模型

转换格式

成本估算

CLORE.AI 市场常见费率(截至 2024 年):

GPU
小时费率
日费率
4 小时会话

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

价格因提供商和需求而异。请查看 CLORE.AI 市场 以获取当前费率。

节省费用:

  • 使用 竞价 可中断工作市场——约三分之一的服务器将现货价格定得低于按需价格(中位数约优惠 13%),其余则与按需价格持平

  • 使用 CLORE 代币支付

  • 比较不同提供商的价格

FLUX LoRA 训练

为 FLUX.1-dev 和 FLUX.1-schnell 训练 LoRA 适配器——新一代扩散 Transformer 模型,质量更高。

显存要求

模型
最低显存
推荐 GPU

FLUX.1-schnell

16GB

RTX 4080 / 3090

FLUX.1-dev

24GB

RTX 4090

FLUX.1-dev (bf16)

40GB+

A100 40GB

注意: FLUX 使用 DiT(Diffusion Transformer)架构——其训练动态与 SD 1.5 / SDXL 有显著不同。

FLUX 安装

安装支持 CUDA 12.8 的 PyTorch:

FLUX LoRA 配置(flux_lora.toml)

FLUX LoRA 训练命令

FLUX 与 SDXL:主要区别

参数
SDXL
FLUX.1

学习率

1e-3 到 1e-4

1e-4 到 5e-5

精度

fp16 或 bf16

必须使用 bf16

网络模块

networks.lora

networks.lora_flux

网络维度

32–128

8–64(更小)

优化器

AdamW8bit

Adafactor

最低显存

12GB

16–24GB

架构

U-Net

DiT(Transformer)

FLUX 学习率指南

提示: FLUX 对学习率比 SDXL 更敏感。起始值设为 1e-4 并降低到 5e-5 如果你看到质量问题。对于 SDXL, 1e-3 很常见——FLUX 请避免使用。

测试 FLUX LoRA


故障排查

显存溢出错误

  • 将批次大小降为 1

  • 启用梯度检查点

  • 使用 8 位优化器

  • 降低分辨率

结果不佳

  • 更多/更好的训练图像

  • 调整学习率

  • 检查标注是否与图像匹配

  • 尝试不同的网络秩

训练崩溃

  • 检查 CUDA 版本

  • 更新 xformers

  • 减小批量大小

  • 检查磁盘空间

FLUX 特定问题

  • “不支持 bf16” — 使用 A 系列(Ampere 及以上)或 RTX 30/40 系列 GPU

  • FLUX.1-dev 上出现 OOM — 切换到 FLUX.1-schnell(需要 16GB)或启用 cache_text_encoder_outputs

  • 模糊结果 — 增加 network_dim 到 32–64,将学习率降低到 5e-5

  • NaN 损失 — 禁用 full_bf16,检查你的数据集中是否有损坏的图像

最后更新于

这有帮助吗?