For the complete documentation index, see llms.txt. This page is also available as Markdown.

Fish Speech

在 Clore.ai 的 GPU 上运行 Fish Speech 多语言 TTS 和零样本声音克隆

Fish Speech 是一款最先进的多语言文本转语音(TTS)系统,具有零样本语音克隆能力。它在 GitHub 上拥有超过 15,000 个星标,支持英语、中文、日语、韩语、法语、德语、阿拉伯语、西班牙语等多种语言——全部来自同一个模型。只需 10–15 秒的参考音频,Fish Speech 就能以惊人的保真度克隆任何声音,十分适用于有声书制作、配音、虚拟助手和大规模内容创作。

Fish Speech 使用基于 Transformer 的架构和 VQGAN 声码器,在标准 TTS 基准上达到接近人类的自然度评分。其 WebUI(Gradio)使用户无需编写任何代码即可使用,而 REST API 则可实现与生产流水线的无缝集成。


服务器要求

参数
最低要求
推荐配置

GPU

NVIDIA RTX 3080(10 GB)

NVIDIA RTX 4090(24 GB)

显存(VRAM)

8 GB

16–24 GB

内存(RAM)

16 GB

32 GB

CPU

4 个内核

8 个以上内核

磁盘

20 GB

40 GB

操作系统

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.8+

12.1+

端口

22, 7860

22, 7860

Fish Speech 能在中端 GPU(如 RTX 3080/3090)上高效运行。对于批量推理或为多个并发用户提供服务,建议使用 RTX 4090 或 A100。


在 CLORE.AI 上快速部署

运行 Fish Speech 的最快方式是直接从 Docker Hub 使用官方 Docker 镜像。

1. 找到合适的服务器

前往 CLORE.AI 市场 并按以下条件筛选:

  • 显存(VRAM): ≥ 8 GB

  • GPU: RTX 3080、3090、4080、4090、A100、H100

  • 磁盘:≥ 20 GB

2. 配置您的部署

在 CLORE.AI 订单表单中,设置如下:

Docker 镜像:

端口映射:

环境变量:

启动命令(可选 — 自动启动 WebUI):

3. 访问界面

部署完成后,打开浏览器并访问:

Gradio WebUI 将加载并显示完整的 Fish Speech 界面,准备就绪。


逐步设置

第一步:SSH 登录到您的服务器

步骤 2:拉取并运行 Docker 容器

步骤 3:验证 GPU 访问

你应该能看到列出的 GPU 及其可用显存。

步骤 4:检查模型下载

Fish Speech 会在首次运行时自动下载模型权重(约 3–5 GB)。监控下载进度:

等待直到你看到:

步骤 5:访问 WebUI

在你的浏览器中导航到 http://<server-ip>:7860

步骤 6:(可选)启用 API 服务器


使用示例

示例 1:通过 WebUI 的基础文本转语音

  1. 在 WebUI 打开地址 http://<server-ip>:7860

  2. 在以下位置输入文本 "Text" 字段:

  3. 选择语言: 英语

  4. 点击 "Generate"

  5. 下载生成的 .wav 文件


示例 2:零样本语音克隆

只需 10–15 秒参考音频即可克隆任意声音:

  1. 在 WebUI 中,导航到 "Voice Clone" 选项卡

  2. 上传你的参考音频文件(.wav.mp3, 10–30 秒)

  3. 输入参考音频的转录(可选,但能提高质量)

  4. 输入要合成的目标文本

  5. 点击 "Clone & Generate"

模型将分析声音特征并以该声音合成语音。


示例 3:基于 API 的 TTS(Python)


示例 4:多语言 TTS


示例 5:批量处理音频文件


invokeai.yaml 配置文件

Docker Compose(生产部署)

关键配置选项

选项
默认
描述

--listen

0.0.0.0

绑定服务器的接口

--port

7860

Gradio WebUI 的端口

--compile

false

启用 torch.compile 以加速推理

--device

cuda

要使用的设备(cuda, cpu, mps)

--half

true

使用 FP16 半精度(节省显存)

--num_samples

1

要生成的音频样本数量

--max_new_tokens

1024

生成的最大新令牌数

模型变体

模型
大小
语言
说明

fish-speech-1.4

~3 GB

8 种语言

最新稳定版本

fish-speech-1.2-sft

~2.5 GB

8 种语言

微调变体

fish-speech-1.2

~2.5 GB

8 种语言

基础模型


1. 使用 SDXL-Turbo 或 SDXL-Lightning 以实现快速生成

1. 启用 torch.compile 以加速推理

首次运行会较慢(编译需 2–5 分钟),但随后推理将快 20–40%。

2. 使用半精度(FP16)

FP16 可将显存使用量减少约 50%,且质量损失最小:

3. 预加载参考语音

将常用的参考语音存放在容器的 references 目录中以避免重复处理:

4. GPU 内存优化

5. 批量大小调整

对于批量 API 请求,建议的批量大小:

  • RTX 3080(10 GB): batch_size = 1–2

  • RTX 3090/4090(24 GB): batch_size = 4–8

  • A100(40/80 GB): batch_size = 16–32


故障排除

问题:容器无法启动 — 找不到 CUDA

问题:内存不足(OOM)错误

问题:端口 7860 无法访问

问题:模型下载失败 / 下载缓慢

问题:音频质量差

  • 确保参考音频干净(无背景噪声,采样率 >= 16kHz)

  • 将参考音频保持在 10–30 秒之间

  • 提供参考音频的转录以获得更好的对齐

  • 尝试增加 --num_samples 以生成多个选项并挑选最佳结果

问题:WebUI 加载但生成过程挂起


文档


Clore.ai 的 GPU 建议

在 Clore.ai 上的预估费用
开发/测试
RTX 3090(24GB)

~$0.12/每 GPU/每小时

生产

RTX 4090(24GB)

生产级 TTS

大规模

A100 80GB

高吞吐量推理

💡 本指南中的所有示例均可部署在

Clore.ai

GPU 服务器上。浏览可用 GPU 并按小时租用 — 无需承诺,提供完整的 root 访问权限。 Clore.ai GPU 服务器。浏览可用 GPU 并按小时租用 — 无需承诺,提供完整的 root 访问权限。

最后更新于

这有帮助吗?