For the complete documentation index, see llms.txt. This page is also available as Markdown.

MOSS-TTS(仅 CPU,1 亿)

在 Clore.ai 上运行 MOSS-TTS——来自 OpenMOSS(MOSI.AI + 复旦 NLP)的超轻量级、CPU 优先的 1 亿参数多语言文字转语音模型。

MOSS-TTS 是一个开源语音生成系列,来自 OpenMOSS (上海创新机构,与 复旦 NLP 以及 MOSI.AI合作,由邱锡鹏教授领衔)。旗舰款 MOSS-TTS-Nano 仅有 1 亿参数,可在一台 4 核 CPU 且无需 GPU上实时运行,输出 48 kHz 立体声,并支持 20 种语言 的零样本声音克隆。整个系列可扩展到 80 亿参数,用于多说话人对话、声音设计和音效生成。

发布日期: 2026 年 4 月 10 日(Nano)· ONNX CPU 构建版 2026 年 4 月 17 日 · 许可证: Apache 2.0

如果 Kokoro 占据了 8200 万参数的西方英语细分市场,那么 MOSS-TTS-Nano 占据的是 以 CPU 为先的多语言 细分市场:同样的小模型理念,但支持立体声 48 kHz、20 种语言、声音克隆,以及无 PyTorch 的 ONNX/GGUF 路径。对于任何想要在不为 GPU 付费的情况下部署 TTS 的人来说——这就是那款模型。

MOSS-TTS 家族

模型
大小
显存
最适合

MOSS-TTS-Nano-100M

1 亿

0 GB(CPU,4 核)

实时、边缘、IVR、端侧

MOSS-TTS-Nano-100M-ONNX

1 亿

0 GB(CPU)

无 PyTorch 的生产级服务

MOSS-TTS-GGUF

1 亿(Q4_K_M)

0 GB(CPU)

llama.cpp 风格部署

MOSS-TTS-Local-Transformer

17 亿

4 GB

轻量级 GPU,较强的客观质量

MOSS-TTS-Realtime

17 亿

4 GB

多轮语音代理,180 ms 首字节时间

MOSS-VoiceGenerator

17 亿

4 GB

根据文本提示进行声音设计

MOSS-TTSD-v1.0

80 亿

8 GB

多说话人对话、长播客

MOSS-SoundEffect

80 亿

8 GB

可控时长的音效生成

关键规格

规格
数值

开发者

OpenMOSS 团队 · MOSI.AI · 复旦 NLP 实验室

架构

自回归(音频分词器 + LLM)

采样率

48 kHz,立体声

语言

20(zh、en、de、es、fr、ja、it、hu、ko、ru、fa、ar、pl、pt、cs、da、sv、el、tr、+1)

声音克隆

基于约 3 秒参考音频进行零样本

流式输出

是——在 CPU 上分块解码

许可证

Apache 2.0

HuggingFace

为什么选择 MOSS-TTS?

  • 零 GPU 部署 — Nano 可在 4 个 CPU 核心上运行,无 CUDA、无 Triton

  • 48 kHz 立体声输出 — 广播级音质,在 1 亿参数以下模型中很少见

  • 20 种语言 — 在相近规模下,覆盖范围比 Kokoro(约 5 种)更广

  • 零样本声音克隆 基于约 3 秒参考音频

  • 无 PyTorch 的 ONNX/GGUF 路径 — 可随 200 MB 二进制文件一起发布

  • 家族可扩展 — 从 Nano 到 80 亿参数 TTSD 使用同样的分词器/API

  • Apache 2.0 — 商业可用,无额外限制

  • 来自严肃研究 — 复旦 NLP + MOSI.AI,不是业余项目

需求

组件
最低配置(Nano,CPU)
推荐配置(Nano,CPU)
完整家族(GPU)

CPU

4 核(x86_64 / ARM64)

8 核

8 核

内存

4 GB

8 GB

16 GB

GPU

—(不需要)

—(可选)

RTX 3060 12 GB+

显存

0 GB

0 GB

4–8 GB

磁盘

1 GB

2 GB

10 GB(8B + 依赖)

Python

3.12

3.12

3.12

方案 A — Python 安装 + 快速推理

基于参考音频 + 目标文本进行推理:

或者通过 CLI 入口:

网页演示(Gradio):

方案 B — Docker(CPU 和 GPU)

仅 CPU (Nano,约 1 GB 镜像):

GPU 版本 (用于 Realtime / TTSD / SoundEffect):

方案 C — 零样本声音克隆(3 秒参考)

MOSS-TTS-Nano 可从一段简短的参考片段克隆声音,并通过自动分块处理长文本合成。

质量提示(移植自 XTTS 操作手册——同样的原则适用):

  • 使用 3–10 秒 干净的 参考音频(无背景音乐、无房间混响)

  • 尽可能使参考音频和目标文本的语言一致

  • 在输入前进行归一化并裁剪静音(librosa.effects.trim)

  • 为了保持长篇叙述的一致性,请在多次调用中重复使用同一个参考音频

方案 D — 在 llama.cpp-audio / 无 PyTorch ONNX 上使用 GGUF

对于边缘设备、移动端后端,或任何你不想使用 PyTorch 的场景:

这条路径可在与 llama.cpp 兼容的工具链上运行——非常适合 Raspberry Pi、Android,或 200 MB 二进制文件很重要的无服务器函数。

Clore.ai GPU 推荐

你不需要为 Nano 配备 GPU。 这正是重点。但如果你想批量生成,或者运行更大的兄弟模型:

GPU
显存
适用
Clore 价格(约)

仅 CPU 实例

Nano、Nano-ONNX、GGUF

起价 $0.01/小时

RTX 3060 12GB

12 GB

Nano + Local-Transformer + Realtime

起价 $0.03–0.07/小时

RTX 3090 24GB

24 GB

完整 TTSD-v1.0(8B),批量服务

起价 $0.07–0.21/小时

RTX 4090 24GB

24 GB

TTSD + SoundEffect 同时运行

起价 $0.14–0.42/小时

应用场景

  • 有声书 — 使用一致的克隆声音进行长篇旁白,自动分块

  • 语音代理 — Realtime 版本可实现亚秒级首字节时间,适用于对话式 AI

  • IVR / 电话系统 — 仅 CPU 部署,48 kHz 立体声,20 种语言

  • 游戏 NPC — 轻量到可以直接随游戏客户端一起发布,按角色进行声音设计

  • 配音 — 多语言克隆,用于本地化流水线

  • 播客生成 — MOSS-TTSD-v1.0 原生支持多说话人对话

  • 音效 — MOSS-SoundEffect 为流水线添加时长可控的音效

基准 / 质量

  • MOSS-TTSD-v1.0 在主观多说话人对话评测中优于豆包和 Gemini 2.5-pro

  • Nano 实现实时因子 < 1.0,运行于 4 个 CPU 核心上 (即比播放更快)

  • Realtime 版本报告 约 180 ms 首字节时间 适用于对话场景

  • 在这个参数预算下,48 kHz 立体声输出明显优于 24 kHz 单声道竞争对手

故障排查

问题
解决方案

pynini 通过 pip 安装失败

conda install -c conda-forge pynini=2.1.6.post1 -y 然后重新安装 WeTextProcessing

CPU 上音频断续

确保有 4 个以上物理核心;禁用 SMT/HT 过度订阅;使用 ONNX 构建版

克隆的声音听起来不对

参考音频必须为 3–10 秒、干净、单说话人、语言匹配

TTSD-v1.0 出现 OOM

使用 FP16(model.half())或降级到 1.7B 的 Local-Transformer

模型下载卡住

设置 HF_HUB_ENABLE_HF_TRANSFER=1 然后重试

首次运行较慢

首次推理会编译内核 / 下载约 400 MB 权重——之后运行会很快

Torch 与其他模型冲突

使用 [llama-cpp-onnx] 无 PyTorch 环境所需的扩展

下一步


最后更新:2026 年 4 月 20 日

最后更新于

这有帮助吗?