Разговорная речь ChatTTS
Запустите разговорный text-to-speech ChatTTS с тонким контролем просодии на GPU Clore.ai.
ChatTTS — это генеративная модель речи с 300 млн параметров, оптимизированная для диалоговых сценариев, таких как ассистенты LLM, чат-боты и интерактивные голосовые приложения. Она воспроизводит естественно звучащую речь с реалистичными паузами, смехом, словами-паразитами и интонацией — характеристиками, которые большинству TTS-систем трудно воспроизвести. Модель поддерживает английский и китайский языки и генерирует аудио с частотой 24 кГц.
GitHub: 2noise/ChatTTS (30K+ звёзд) Лицензия: AGPLv3+ (код), CC BY-NC 4.0 (веса модели — некоммерческое использование)
Ключевые особенности
Разговорная просодия — естественные паузы, слова-паразиты и интонация, настроенные для диалога
Метки тонкой настройки —
[oral_0-9],[laugh_0-2],[break_0-7],[uv_break],[lbreak]Многоголосие — выбирайте случайных дикторов или повторно используйте встраивания дикторов для согласованности
Температура / top-P / top-K — управляют разнообразием генерации
Пакетный вывод — синтезируйте несколько текстов за один вызов
Компактность — ~300 млн параметров, работает на 4 ГБ VRAM
Требования
GPU
RTX 3060 (4 ГБ свободно)
RTX 3090 / RTX 4090
VRAM
4 ГБ
8 ГБ+
ОЗУ
8 ГБ
16 ГБ
Диск
5 ГБ
10 ГБ
Python
3.9+
3.11
CUDA
12.8+
12.8+
Рекомендация Clore.ai: RTX 3060 ($0.03–0.07/час) комфортно справляется с ChatTTS. Для пакетного производства или меньшей задержки выберите RTX 3090 ($0.07–0.21/час).
Установка
Быстрый старт
Примеры использования
Стабильный голос диктора
Сэмплируйте случайное встраивание диктора и повторно используйте его в нескольких генерациях для стабильного голоса:
Метки управления на уровне слов
Вставляйте управляющие метки прямо в текст для точной просодии:
Пакетная обработка с WebUI
ChatTTS поставляется с веб-интерфейсом Gradio для интерактивного использования:
Откройте http_pub URL-адрес из панели заказов Clore.ai для доступа к интерфейсу.
Советы для пользователей Clore.ai
Используйте
compile=Trueпосле первоначального тестирования — компиляция PyTorch добавляет время запуска, но значительно ускоряет повторные запуски выводаПроброс портов — откройте порт
7860/httpпри развёртывании с WebUIDocker-образ — используйте
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtimeв качестве базовогоСохранение голоса диктора — сохраните
rand_spkстроки в файл, чтобы можно было повторно использовать голоса между сеансами без повторного сэмплированияПакетируйте запросы —
chat.infer()принимает список текстов и обрабатывает их вместе, что эффективнее, чем вызовы по одномуНекоммерческая лицензия — веса модели распространяются по лицензии CC BY-NC 4.0; проверьте требования к лицензированию для вашего случая использования
Устранение неполадок
CUDA out of memory
Уменьшите размер пакета или используйте GPU с ≥ 6 ГБ VRAM
Модель медленно загружается
Заранее скачайте с HuggingFace: huggingface-cli download 2Noise/ChatTTS
В аудио есть статический шум
Это сделано намеренно в модели с открытым исходным кодом (мера против злоупотреблений); используйте compile=True для более чистого вывода
torchaudio.save ошибка размерности
Убедитесь, что тензор двумерный: audio.unsqueeze(0) при необходимости
Искажённый китайский вывод
Убедитесь, что входной текст закодирован в UTF-8; установите WeTextProcessing для лучшей нормализации
Медленный первый инференс
Обычный — компиляция модели и загрузка весов происходят при первом вызове; последующие вызовы быстрее
Последнее обновление
Это было полезно?