Kani-TTS-2 声音克隆
在 Clore.ai GPU 上运行 Kani-TTS-2——一款超高效的 4 亿参数文字转语音模型,支持声音克隆
nineninesix.ai 的 Kani-TTS-2(于 2026 年 2 月 15 日发布)是一个 4 亿参数的开源文本转语音模型,仅需 3GB 显存。它基于 LiquidAI 的 LFM2 架构并结合 NVIDIA NanoCodec,将音频视为一种语言——可通过一段简短的参考音频实现零样本声音克隆,生成自然的语音。其体积不到竞品模型的一半,计算开销也只是其中一小部分,因此 Kani-TTS-2 非常适合在低成本硬件上用于实时对话式 AI、有声书生成和声音克隆。
HuggingFace: nineninesix/kani-tts-2-en GitHub: nineninesix-ai/kani-tts-2 PyPI: kani-tts-2 许可证: Apache 2.0
主要特性
4 亿参数,3GB 显存 — 几乎可在任何现代 GPU 上运行,包括 RTX 3060
零样本声音克隆 — 可从 3–30 秒的参考音频样本克隆任意声音
说话人嵌入 — 基于 WavLM 的 128 维说话人表示,可实现精确的声音控制
最长可达 40 秒的连续音频 — 适合更长的段落和对话
实时或更快 — 在 RTX 5080 上 RTF 约为 0.2,即使在入门级 GPU 上也能实时运行
Apache 2.0 — 完全开放,可用于个人和商业用途
包含预训练框架 — 可从零开始在任意语言上训练你自己的 TTS 模型
与其他 TTS 模型的比较
Kani-TTS-2
4 亿
3GB
✅ 零样本
英语(可扩展)
Apache 2.0
Kokoro
8200 万
2GB
❌ 预设声音
英语、日语、中文
Apache 2.0
Zonos
4 亿
8GB
✅
多 GPU
Apache 2.0
ChatTTS
3 亿
4GB
❌ 随机种子
中文、英语
AGPL 3.0
Chatterbox
5 亿
6GB
✅
英语
Apache 2.0
XTTS(Coqui)
4.67 亿
6GB
✅
多 GPU
MPL 2.0
F5-TTS
335M
4GB
✅
多 GPU
CC-BY-NC 4.0
需求
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
GPU
任何配备 3GB 显存的设备
RTX 3060 或更高
显存
3GB
6GB
内存
8GB
16GB
磁盘
2GB
5GB
Python
3.9+
3.11+
CUDA
12.8+
12.8+
Clore.ai 推荐: RTX 3060($0.03–0.07/小时)绰绰有余。即使是 Clore.ai 上最便宜的 GPU 实例,也能轻松运行 Kani-TTS-2。对于批量处理(有声书、数据集),RTX 4090($0.14–0.42/小时)能提供出色的吞吐量。
安装
快速开始
三行即可生成语音:
使用示例
1. 基础文本转语音
2. 声音克隆
从一段简短的参考音频样本中克隆任意声音:
3. 有声书批量生成
高效生成多个章节:
4. 兼容 OpenAI 的流式 API
对于实时应用,请使用兼容 OpenAI 的服务器:
然后可将其与任何 OpenAI TTS 客户端一起使用:
给 Clore.ai 用户的建议
这是运行成本最低的模型 — 只需 3GB 显存,Kani-TTS-2 几乎可在 Clore.ai 上任何 GPU 实例上运行。对于生产级 TTS,RTX 3060($0.03–0.07/小时)已经绰绰有余。
与语言模型结合使用 — 租用一个 GPU 实例,同时运行一个小型 LLM(例如 Mistral 3 8B)和 Kani-TTS-2,即可构建完整的语音助手。它们会共享 GPU,而且还有余量。
预先计算说话人嵌入 — 只需提取一次说话人嵌入并保存起来。这样可以避免在每次请求时都加载 WavLM 嵌入模型。
使用兼容 OpenAI 的服务器 — 该
kani-tts-2-openai-server提供了可直接替换 OpenAI TTS API 的方案,便于与现有应用集成。在自定义语言上训练 — Kani-TTS-2 包含完整的预训练框架(kani-tts-2-pretrain)。在你自己的语言数据集上微调模型——只需 8 张 H100 运行约 6 小时。
故障排查
ImportError:无法导入 LFM2
安装正确的 transformers 版本: pip install -U "transformers==4.56.0"
音频质量差 / 机械感强
增大 temperature 设为 0.8–0.9;确保用于克隆的参考音频干净(没有背景噪声)
声音克隆与参考音频不像
使用 5–15 秒清晰、单一说话人的音频。避免参考音频中包含音乐或背景噪声
CUDA 内存不足
在 3GB 模型下不应该发生——检查是否有其他进程正在占用 GPU 内存(nvidia-smi)
音频在句中被截断
Kani-TTS-2 最长支持约 40 秒。将更长的文本拆分为句子并将输出拼接起来
在 CPU 上很慢
强烈建议使用 GPU 推理。即使是基础 GPU,也比 CPU 快 10–50 倍
延伸阅读
GitHub — kani-tts-2 — PyPI 包、使用文档、高级示例
HuggingFace — kani-tts-2-en — 英文模型权重
预训练框架 — 从零开始训练你自己的 TTS 模型
兼容 OpenAI 的服务器 — OpenAI TTS API 的直接替代方案
说话人嵌入模型 — 基于 WavLM 的声音嵌入器
MarkTechPost 概述 — 社区报道
最后更新于
这有帮助吗?