For the complete documentation index, see llms.txt. This page is also available as Markdown.

Zonos TTS 声音克隆

在 Clore.ai GPU 上运行 Zyphra 的 Zonos TTS,用于带情感和音高控制的声音克隆。

由 Zonos 提供 Zyphra 是一个 0.4B 参数的开权重文本转语音模型,在 20 万小时以上的多语种语音上训练而成。它只需 2–30 秒的参考音频即可进行零样本声音克隆,并提供对情感、语速、音高变化和音频质量的细粒度控制。输出为高保真 44 kHz 音频。提供两种模型变体:Transformer(最佳质量)和 Hybrid/Mamba(更快推理)。

GitHub: Zyphra/Zonos HuggingFace: Zyphra/Zonos-v0.1-transformer 许可证: Apache 2.0

主要特性

  • 从 2–30 秒进行声音克隆 — 无需微调

  • 44 kHz 高保真输出 — 工作室级音频质量

  • 情感控制 — 通过 8D 向量控制快乐、悲伤、愤怒、恐惧、惊讶、厌恶

  • 语速与音高 — 独立的细粒度控制

  • 音频前缀输入 — 支持耳语及其他难以克隆的行为

  • 多语言 — 英语、日语、中文、法语、德语

  • 两种架构 — Transformer(质量)和 Hybrid/Mamba(速度,在 RTX 4090 上约 2× 实时)

  • Apache 2.0 — 可免费用于个人和商业用途

需求

组件
最低
推荐

GPU

RTX 3080 10 GB

RTX 4090 24 GB

显存

6 GB(Transformer)

10 GB+

内存

16 GB

32 GB

磁盘

10 GB

20 GB

Python

3.10+

3.11

CUDA

12.8+

12.8+

系统

espeak-ng

Clore.ai 推荐: RTX 3090($0.07–0.21/小时),具有舒适余量。RTX 4090($0.14–0.42/小时)适用于 Hybrid 模型和最快推理。

安装

快速开始

使用示例

情感控制

Zonos 接受一个 8 维情感向量: [快乐、悲伤、厌恶、恐惧、惊讶、愤怒、其他、中性].

语速和音高控制

Gradio Web 界面

开放端口 7860/http 在你的 Clore.ai 订单中,并打开 http_pub URL 以访问 UI。

给 Clore.ai 用户的建议

  • 模型选择 — Transformer 以获得最佳质量,Hybrid 以获得约 2× 更快的推理(需要 RTX 3000+ GPU)

  • 参考音频 — 10–30 秒清晰语音效果最佳;较短的片段(2–5 秒)也可用,但保真度较低

  • Docker 设置 — 使用 pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime,添加 apt-get install -y espeak-ng 到启动项

  • 端口映射 — 公开 7860/http 用于 Gradio UI, 8000/http 用于 API 服务器

  • 随机种子控制 ——将 torch.manual_seed() 在生成前设置,以获得可复现的输出

  • 音频质量参数 — 试试 audio_quality 条件字段,以获得更干净的输出

故障排查

问题
解决方案

未找到 espeak-ng

运行 apt-get install -y espeak-ng (音素化所需)

CUDA 内存不足

使用 Transformer 模型(比 Hybrid 更小);减少每次调用的文本长度

Hybrid 模型失败

需要 Ampere+ GPU(RTX 3000 系列或更新)以及 pip install -e ".[compile]"

克隆的声音听起来不对

使用更长的参考片段(15–30 秒),确保语音清晰并尽量减少背景噪音

生成缓慢

Transformer 属于正常现象(约 0.5× 实时);Hybrid 在 RTX 4090 上可达到约 2× 实时

ModuleNotFoundError: zonos

请确保你是从源代码安装的: cd Zonos && pip install -e .

最后更新于

这有帮助吗?