For the complete documentation index, see llms.txt. This page is also available as Markdown.

Разговорная речь ChatTTS

Запустите разговорный text-to-speech ChatTTS с тонким контролем просодии на GPU Clore.ai.

ChatTTS — это генеративная модель речи с 300 млн параметров, оптимизированная для диалоговых сценариев, таких как ассистенты LLM, чат-боты и интерактивные голосовые приложения. Она воспроизводит естественно звучащую речь с реалистичными паузами, смехом, словами-паразитами и интонацией — характеристиками, которые большинству TTS-систем трудно воспроизвести. Модель поддерживает английский и китайский языки и генерирует аудио с частотой 24 кГц.

GitHub: 2noise/ChatTTS (30K+ звёзд) Лицензия: AGPLv3+ (код), CC BY-NC 4.0 (веса модели — некоммерческое использование)

Ключевые особенности

  • Разговорная просодия — естественные паузы, слова-паразиты и интонация, настроенные для диалога

  • Метки тонкой настройки[oral_0-9], [laugh_0-2], [break_0-7], [uv_break], [lbreak]

  • Многоголосие — выбирайте случайных дикторов или повторно используйте встраивания дикторов для согласованности

  • Температура / top-P / top-K — управляют разнообразием генерации

  • Пакетный вывод — синтезируйте несколько текстов за один вызов

  • Компактность — ~300 млн параметров, работает на 4 ГБ VRAM

Требования

Компонент
Минимум
Рекомендуется

GPU

RTX 3060 (4 ГБ свободно)

RTX 3090 / RTX 4090

VRAM

4 ГБ

8 ГБ+

ОЗУ

8 ГБ

16 ГБ

Диск

5 ГБ

10 ГБ

Python

3.9+

3.11

CUDA

12.8+

12.8+

Рекомендация Clore.ai: RTX 3060 ($0.03–0.07/час) комфортно справляется с ChatTTS. Для пакетного производства или меньшей задержки выберите RTX 3090 ($0.07–0.21/час).

Установка

Быстрый старт

Примеры использования

Стабильный голос диктора

Сэмплируйте случайное встраивание диктора и повторно используйте его в нескольких генерациях для стабильного голоса:

Метки управления на уровне слов

Вставляйте управляющие метки прямо в текст для точной просодии:

Пакетная обработка с WebUI

ChatTTS поставляется с веб-интерфейсом Gradio для интерактивного использования:

Откройте http_pub URL-адрес из панели заказов Clore.ai для доступа к интерфейсу.

Советы для пользователей Clore.ai

  • Используйте compile=True после первоначального тестирования — компиляция PyTorch добавляет время запуска, но значительно ускоряет повторные запуски вывода

  • Проброс портов — откройте порт 7860/http при развёртывании с WebUI

  • Docker-образ — используйте pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime в качестве базового

  • Сохранение голоса диктора — сохраните rand_spk строки в файл, чтобы можно было повторно использовать голоса между сеансами без повторного сэмплирования

  • Пакетируйте запросыchat.infer() принимает список текстов и обрабатывает их вместе, что эффективнее, чем вызовы по одному

  • Некоммерческая лицензия — веса модели распространяются по лицензии CC BY-NC 4.0; проверьте требования к лицензированию для вашего случая использования

Устранение неполадок

Проблема
Решение

CUDA out of memory

Уменьшите размер пакета или используйте GPU с ≥ 6 ГБ VRAM

Модель медленно загружается

Заранее скачайте с HuggingFace: huggingface-cli download 2Noise/ChatTTS

В аудио есть статический шум

Это сделано намеренно в модели с открытым исходным кодом (мера против злоупотреблений); используйте compile=True для более чистого вывода

torchaudio.save ошибка размерности

Убедитесь, что тензор двумерный: audio.unsqueeze(0) при необходимости

Искажённый китайский вывод

Убедитесь, что входной текст закодирован в UTF-8; установите WeTextProcessing для лучшей нормализации

Медленный первый инференс

Обычный — компиляция модели и загрузка весов происходят при первом вызове; последующие вызовы быстрее

Последнее обновление

Это было полезно?