For the complete documentation index, see llms.txt. This page is also available as Markdown.

XTTS(Coqui)

使用 Coqui XTTS 进行带声音克隆的自然语音生成

使用 Coqui XTTS 通过声音克隆生成自然语音。

在 CLORE.AI 上租用

  1. 按 GPU 类型、VRAM 和价格筛选

  2. 选择 按需 (固定费率)或 竞价 (出价)

  3. 配置你的订单:

    • 选择 Docker 镜像

    • 设置端口(SSH 用 TCP,Web UI 用 HTTP)

    • 如有需要,添加环境变量

    • 输入启动命令

  4. 选择支付方式: CLORE, BTC,或 USDT/USDC

  5. 创建订单并等待部署

访问你的服务器

  • 在以下位置查找连接信息 我的订单

  • Web 界面:使用 HTTP 端口 URL

  • SSH: ssh -p <port> root@<proxy-address>

什么是 XTTS?

XTTS(由 Coqui 提供)具有:

  • 高质量文本转语音

  • 仅需 6 秒音频即可进行声音克隆

  • 支持 17 种语言

  • 情感控制

  • 支持流式传输

需求

模式
显存
推荐

推理

4GB

RTX 3060

快速推理

6GB

RTX 3080

流式输出

4GB

RTX 3060

快速部署

Docker 镜像:

端口:

命令:

访问你的服务

部署后,找到你的 http_pub URL 在 我的订单:

  1. 前往 我的订单 页面

  2. 点击你的订单

  3. 找到 http_pub URL(例如, abc123.clorecloud.net)

使用 https://YOUR_HTTP_PUB_URL 替代 localhost 在下面的示例中。

安装

基础用法

简单 TTS

声音克隆

多种语言

支持的语言

代码
语言

en

英语

es

西班牙语

fr

法语

de

德语

it

意大利语

pt

葡萄牙语

pl

波兰语

tr

土耳其语

ru

俄语

nl

荷兰语

cs

捷克语

ar

阿拉伯语

zh-cn

中文

ja

日语

hu

匈牙利语

ko

韩语

hi

印地语

流式 TTS

Gradio 界面

API 服务器

批量处理

语音微调

为了获得更好的声音克隆效果:

音频预处理

性能

模式
GPU
速度

标准

RTX 3060

约 0.5 倍实时

标准

RTX 4090

约 2 倍实时

流式输出

RTX 3060

约 1 倍实时

流式输出

RTX 4090

约 3 倍实时

质量提示

  • 使用 6-15 秒干净的参考音频

  • 避免参考音频中的背景噪音

  • 使文本与参考音频语言一致

  • 使用多个参考样本以获得更好的结果

故障排查

声音质量差

  • 干净的参考音频

  • 更长的参考音频(10 秒以上)

  • 匹配说话风格

语言发音错误

  • 确保语言代码正确

  • 使用母语者参考音频

生成缓慢

  • 启用 GPU 推理

  • 使用流式模式

  • 减少每次调用的文本长度

成本估算

CLORE.AI 市场常见费率(截至 2024 年):

GPU
小时费率
日费率
4 小时会话

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

价格因提供商和需求而异。请查看 CLORE.AI 市场 以获取当前费率。

节省费用:

  • 使用 竞价 可中断工作市场——约三分之一的服务器将现货价格定得低于按需价格(中位数约优惠 13%),其余则与按需价格持平

  • 使用 CLORE 代币支付

  • 比较不同提供商的价格

下一步

最后更新于

这有帮助吗?