MeloTTS
在 Clore.ai GPU 上运行高质量、多语言、快速推理的 MeloTTS
MeloTTS 是一个高质量的多语言文本转语音库,由 MyShell AI. 它提供快速、自然的语音合成,支持多种语言和英语口音,专为研究和生产部署而设计。MeloTTS 针对速度进行了优化——即使在 CPU 上也能显著快于实时生成语音——同时保持适合商业使用的高音频质量。
MeloTTS 当前支持:
英语 (美式、英式、印度式、澳式、默认)
中文(简体及中英混合)
日语
韩语
西班牙语
法语
主要亮点:
⚡ 快速推理 —— 在 CPU 上快于实时,在 GPU 上飞快
🌍 多语言 —— 6 种语言,英语带口音变体
🐳 可直接用于 Docker —— 提供官方 Docker 镜像
🔌 REST API —— 可通过 HTTP API 集成到任何应用中
📱 适合生产环境 —— 用于 MyShell 的消费级产品
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
服务器要求
GPU
NVIDIA GTX 1080(8 GB)
NVIDIA RTX 3090(24 GB)
显存
4 GB
8–16 GB
内存
8 GB
16 GB
CPU
4 核
8 核
磁盘
10 GB
20 GB
操作系统
Ubuntu 20.04+
Ubuntu 22.04
CUDA
11.7+(可选)
12.1+
Python
3.8+
3.10
端口
22, 8888
22, 8888
在 CLORE.AI 上快速部署
注意: MeloTTS 在 Docker Hub 上没有官方预构建的 Docker 镜像(myshell-ai/melotts 并不存在)。推荐的做法是使用 NVIDIA CUDA 基础镜像,并通过官方 GitHub 仓库中的 pip 安装 MeloTTS。
1. 找到合适的服务器
前往 CLORE.AI 市场 并按以下条件筛选:
显存:≥ 4 GB(低负载时可仅用 CPU)
GPU:任意 NVIDIA GPU(GTX 1080 及以上、RTX 系列、A100)
磁盘:≥ 10 GB
2. 配置你的部署
Docker 镜像:
端口映射:
环境变量:
启动命令 (在通过 SSH 登录服务器后运行):
3. 访问 API
测试命令:
逐步设置
步骤 1:通过 SSH 登录你的服务器
步骤 2:构建并运行容器
由于 MeloTTS 没有预构建的 Docker Hub 镜像,请使用 NVIDIA CUDA 基础镜像并从源码安装 MeloTTS:
或者,从源码构建自定义 Docker 镜像:
步骤 3:验证服务是否正在运行
步骤 4:替代方案 — Jupyter Notebook 界面
访问地址: http://<server-ip>:8888
步骤 5:使用 pip 安装(不使用 Docker)
使用示例
示例 1:基础英语 TTS(Python)
示例 2:多语言 TTS
示例 3:REST API 使用
示例 4:高速批量处理
示例 5:中英混合 TTS
配置
Docker Compose 设置
由于 MeloTTS 没有官方 Docker Hub 镜像,请使用 NVIDIA CUDA 基础镜像并在启动时从源码安装 MeloTTS:
API 配置选项
--host
127.0.0.1
绑定地址(使用 0.0.0.0 用于公网)
--port
8888
API 服务器端口
--workers
1
工作进程数量
--device
自动
cuda, cpu,或 自动
支持的语言和说话人
英语
EN
EN-Default, EN-US, EN-GB, EN-India, EN-Australia, EN-Brazil
中文
ZH
ZH
日语
JP
JP
韩语
KR
KR
西班牙语
SP
SP
法语
FR
FR
性能提示
1. GPU 与 CPU 基准测试
MeloTTS 性能(RTF = 实时因子,越低越好):
CPU(8 核)
~0.3x
速度快,适合低负载
RTX 3080
~0.05x
比实时快 20 倍
RTX 4090
~0.02x
比实时快 50 倍
A100
~0.01x
比实时快 100 倍
2. 针对吞吐量优化
3. 预热模型
4. 调整音频质量与速度
5. 内存效率
故障排查
问题: espeak-ng 未找到
问题:缺少 NLTK 数据
问题:8888 端口与 Jupyter 冲突
MeloTTS 默认使用 8888 端口,这与 Jupyter Notebook 冲突。解决方案:
问题:中文文本显示不正确
问题:Docker 镜像拉取失败
问题:GPU 上推理缓慢
Clore.ai GPU 推荐
MeloTTS 体积轻量——它在低负载下可在 CPU 上良好运行,并随 GPU 算力线性扩展。你不需要昂贵的硬件。
仅 CPU
—
约 $0.02/小时
约 0.3×
约 3 请求/分钟
RTX 3090
24 GB
$0.07–0.21/小时
约 0.02×(50 倍实时)
约 100 请求/分钟
RTX 4090
24 GB
$0.14–0.42/小时
约 0.01×(100 倍实时)
约 200 请求/分钟
生产环境推荐: 对于一个服务 10–50 个并发用户的多语言 TTS API,RTX 3090 是最理想的选择。建议通过横向扩展(多实例)而不是升级到昂贵的 A100——MeloTTS 并不会随着更高端 GPU 的提升而成比例受益。
链接
Docker:没有官方 Docker Hub 镜像——请从 GitHub 源码 使用
nvidia/cuda:12.8.1-devel-ubuntu22.04基础镜像Hugging Face: https://huggingface.co/myshell-ai/MeloTTS-English
MyShell AI: https://myshell.ai
CLORE.AI 市场: https://clore.ai/marketplace
最后更新于
这有帮助吗?