For the complete documentation index, see llms.txt. This page is also available as Markdown.

MeloTTS

在 Clore.ai GPU 上运行高质量、多语言、快速推理的 MeloTTS

MeloTTS 是一个高质量的多语言文本转语音库,由 MyShell AI. 它提供快速、自然的语音合成,支持多种语言和英语口音,专为研究和生产部署而设计。MeloTTS 针对速度进行了优化——即使在 CPU 上也能显著快于实时生成语音——同时保持适合商业使用的高音频质量。

MeloTTS 当前支持:

  • 英语 (美式、英式、印度式、澳式、默认)

  • 中文(简体及中英混合)

  • 日语

  • 韩语

  • 西班牙语

  • 法语

主要亮点:

  • 快速推理 —— 在 CPU 上快于实时,在 GPU 上飞快

  • 🌍 多语言 —— 6 种语言,英语带口音变体

  • 🐳 可直接用于 Docker —— 提供官方 Docker 镜像

  • 🔌 REST API —— 可通过 HTTP API 集成到任何应用中

  • 📱 适合生产环境 —— 用于 MyShell 的消费级产品


服务器要求

参数
最低
推荐

GPU

NVIDIA GTX 1080(8 GB)

NVIDIA RTX 3090(24 GB)

显存

4 GB

8–16 GB

内存

8 GB

16 GB

CPU

4 核

8 核

磁盘

10 GB

20 GB

操作系统

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.7+(可选)

12.1+

Python

3.8+

3.10

端口

22, 8888

22, 8888

MeloTTS 的效率非常高——它在 CPU 上也能很好地运行,适合单次请求,而 GPU 则能大幅提升批量处理能力。即使是入门级 GPU,也能显著提升吞吐量。


在 CLORE.AI 上快速部署

1. 找到合适的服务器

前往 CLORE.AI 市场 并按以下条件筛选:

  • 显存:≥ 4 GB(低负载时可仅用 CPU)

  • GPU:任意 NVIDIA GPU(GTX 1080 及以上、RTX 系列、A100)

  • 磁盘:≥ 10 GB

2. 配置你的部署

Docker 镜像:

端口映射:

环境变量:

启动命令 (在通过 SSH 登录服务器后运行):

3. 访问 API

测试命令:


逐步设置

步骤 1:通过 SSH 登录你的服务器

步骤 2:构建并运行容器

由于 MeloTTS 没有预构建的 Docker Hub 镜像,请使用 NVIDIA CUDA 基础镜像并从源码安装 MeloTTS:

或者,从源码构建自定义 Docker 镜像:

步骤 3:验证服务是否正在运行

步骤 4:替代方案 — Jupyter Notebook 界面

访问地址: http://<server-ip>:8888

步骤 5:使用 pip 安装(不使用 Docker)


使用示例

示例 1:基础英语 TTS(Python)


示例 2:多语言 TTS


示例 3:REST API 使用


示例 4:高速批量处理


示例 5:中英混合 TTS


配置

Docker Compose 设置

由于 MeloTTS 没有官方 Docker Hub 镜像,请使用 NVIDIA CUDA 基础镜像并在启动时从源码安装 MeloTTS:

API 配置选项

参数
默认值
描述

--host

127.0.0.1

绑定地址(使用 0.0.0.0 用于公网)

--port

8888

API 服务器端口

--workers

1

工作进程数量

--device

自动

cuda, cpu,或 自动

支持的语言和说话人

语言
代码
说话人 ID

英语

EN

EN-Default, EN-US, EN-GB, EN-India, EN-Australia, EN-Brazil

中文

ZH

ZH

日语

JP

JP

韩语

KR

KR

西班牙语

SP

SP

法语

FR

FR


性能提示

1. GPU 与 CPU 基准测试

MeloTTS 性能(RTF = 实时因子,越低越好):

设备
RTF
备注

CPU(8 核)

~0.3x

速度快,适合低负载

RTX 3080

~0.05x

比实时快 20 倍

RTX 4090

~0.02x

比实时快 50 倍

A100

~0.01x

比实时快 100 倍

2. 针对吞吐量优化

3. 预热模型

4. 调整音频质量与速度

5. 内存效率


故障排查

问题: espeak-ng 未找到

问题:缺少 NLTK 数据

问题:8888 端口与 Jupyter 冲突

MeloTTS 默认使用 8888 端口,这与 Jupyter Notebook 冲突。解决方案:

问题:中文文本显示不正确

问题:Docker 镜像拉取失败

问题:GPU 上推理缓慢


Clore.ai GPU 推荐

MeloTTS 体积轻量——它在低负载下可在 CPU 上良好运行,并随 GPU 算力线性扩展。你不需要昂贵的硬件。

GPU
显存
Clore.ai 价格
RTF(实时因子)
容量

仅 CPU

约 $0.02/小时

约 0.3×

约 3 请求/分钟

RTX 3090

24 GB

$0.07–0.21/小时

约 0.02×(50 倍实时)

约 100 请求/分钟

RTX 4090

24 GB

$0.14–0.42/小时

约 0.01×(100 倍实时)

约 200 请求/分钟

A100 40GB

40 GB

约 0.005×(200 倍实时)

约 400 请求/分钟

TTS 工作负载的最佳性价比: 售价 $0.07–0.21/小时的 RTX 3090 可提供 50 倍实时的 TTS 速度。对于服务数百名用户的生产 API 来说,这已经绰绰有余。仅 CPU 实例($0.07–0.21/小时)则非常适合开发和低流量部署。

生产环境推荐: 对于一个服务 10–50 个并发用户的多语言 TTS API,RTX 3090 是最理想的选择。建议通过横向扩展(多实例)而不是升级到昂贵的 A100——MeloTTS 并不会随着更高端 GPU 的提升而成比例受益。


链接

最后更新于

这有帮助吗?