Zonos TTS 声音克隆
在 Clore.ai GPU 上运行 Zyphra 的 Zonos TTS,用于带情感和音高控制的声音克隆。
由 Zonos 提供 Zyphra 是一个 0.4B 参数的开权重文本转语音模型,在 20 万小时以上的多语种语音上训练而成。它只需 2–30 秒的参考音频即可进行零样本声音克隆,并提供对情感、语速、音高变化和音频质量的细粒度控制。输出为高保真 44 kHz 音频。提供两种模型变体:Transformer(最佳质量)和 Hybrid/Mamba(更快推理)。
GitHub: Zyphra/Zonos HuggingFace: Zyphra/Zonos-v0.1-transformer 许可证: Apache 2.0
主要特性
从 2–30 秒进行声音克隆 — 无需微调
44 kHz 高保真输出 — 工作室级音频质量
情感控制 — 通过 8D 向量控制快乐、悲伤、愤怒、恐惧、惊讶、厌恶
语速与音高 — 独立的细粒度控制
音频前缀输入 — 支持耳语及其他难以克隆的行为
多语言 — 英语、日语、中文、法语、德语
两种架构 — Transformer(质量)和 Hybrid/Mamba(速度,在 RTX 4090 上约 2× 实时)
Apache 2.0 — 可免费用于个人和商业用途
需求
GPU
RTX 3080 10 GB
RTX 4090 24 GB
显存
6 GB(Transformer)
10 GB+
内存
16 GB
32 GB
磁盘
10 GB
20 GB
Python
3.10+
3.11
CUDA
12.8+
12.8+
系统
espeak-ng
—
Clore.ai 推荐: RTX 3090($0.07–0.21/小时),具有舒适余量。RTX 4090($0.14–0.42/小时)适用于 Hybrid 模型和最快推理。
安装
快速开始
使用示例
情感控制
Zonos 接受一个 8 维情感向量: [快乐、悲伤、厌恶、恐惧、惊讶、愤怒、其他、中性].
语速和音高控制
Gradio Web 界面
开放端口 7860/http 在你的 Clore.ai 订单中,并打开 http_pub URL 以访问 UI。
给 Clore.ai 用户的建议
模型选择 — Transformer 以获得最佳质量,Hybrid 以获得约 2× 更快的推理(需要 RTX 3000+ GPU)
参考音频 — 10–30 秒清晰语音效果最佳;较短的片段(2–5 秒)也可用,但保真度较低
Docker 设置 — 使用
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime,添加apt-get install -y espeak-ng到启动项端口映射 — 公开
7860/http用于 Gradio UI,8000/http用于 API 服务器随机种子控制 ——将
torch.manual_seed()在生成前设置,以获得可复现的输出音频质量参数 — 试试
audio_quality条件字段,以获得更干净的输出
故障排查
未找到 espeak-ng
运行 apt-get install -y espeak-ng (音素化所需)
CUDA 内存不足
使用 Transformer 模型(比 Hybrid 更小);减少每次调用的文本长度
Hybrid 模型失败
需要 Ampere+ GPU(RTX 3000 系列或更新)以及 pip install -e ".[compile]"
克隆的声音听起来不对
使用更长的参考片段(15–30 秒),确保语音清晰并尽量减少背景噪音
生成缓慢
Transformer 属于正常现象(约 0.5× 实时);Hybrid 在 RTX 4090 上可达到约 2× 实时
ModuleNotFoundError: zonos
请确保你是从源代码安装的: cd Zonos && pip install -e .
最后更新于
这有帮助吗?