For the complete documentation index, see llms.txt. This page is also available as Markdown.

Voz conversacional ChatTTS

Ejecuta texto a voz conversacional ChatTTS con control fino de la prosodia en GPUs de Clore.ai.

ChatTTS es un modelo generativo de voz de 300 millones de parámetros optimizado para escenarios de diálogo como asistentes LLM, chatbots y aplicaciones de voz interactivas. Produce voz con sonido natural, con pausas realistas, risas, muletillas y entonación — características que la mayoría de los sistemas TTS tienen dificultades para reproducir. El modelo admite inglés y chino y genera audio a 24 kHz.

GitHub: 2noise/ChatTTS (30K+ estrellas) Licencia: AGPLv3+ (código), CC BY-NC 4.0 (pesos del modelo — no comercial)

Características clave

  • Prosodia conversacional — pausas naturales, muletillas e entonación ajustadas para el diálogo

  • Etiquetas de control detalladas[oral_0-9], [laugh_0-2], [break_0-7], [uv_break], [lbreak]

  • Varios hablantes — muestrea hablantes aleatorios o reutiliza incrustaciones del hablante para mantener la coherencia

  • Temperatura / top-P / top-K — controla la diversidad de la generación

  • Inferencia por lotes — sintetiza varios textos en una sola llamada

  • Ligero — ~300M de parámetros, funciona con 4 GB de VRAM

Requisitos

Componente
Mínimo
Recomendado

GPU

RTX 3060 (4 GB libres)

RTX 3090 / RTX 4090

VRAM

4 GB

8 GB+

RAM

8 GB

16 GB

Disco

5 GB

10 GB

Python

3.9+

3.11

CUDA

12.8+

12.8+

Recomendación de Clore.ai: Una RTX 3060 ($0.03–0.07/h) maneja ChatTTS cómodamente. Para producción por lotes o menor latencia, elige una RTX 3090 ($0.07–0.21/h).

Instalación

Inicio rápido

Ejemplos de uso

Voz del hablante consistente

Muestrea una incrustación aleatoria del hablante y reutilízala en varias generaciones para una voz consistente:

Etiquetas de control a nivel de palabra

Inserta etiquetas de control directamente en el texto para una prosodia precisa:

Procesamiento por lotes con WebUI

ChatTTS incluye una interfaz web de Gradio para uso interactivo:

Abre la http_pub URL desde el panel de pedidos de Clore.ai para acceder a la interfaz.

Consejos para usuarios de Clore.ai

  • Usa compile=True después de las pruebas iniciales — la compilación de PyTorch añade tiempo de inicio, pero acelera significativamente la inferencia repetida

  • Mapeo de puertos — expón el puerto 7860/http al desplegar con la WebUI

  • Imagen Docker — usa pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime como base

  • Persistencia del hablante — guarda rand_spk cadenas en un archivo para que puedas reutilizar voces entre sesiones sin volver a muestrear

  • Agrupa tus solicitudeschat.infer() acepta una lista de textos y los procesa juntos, lo que es más eficiente que hacer llamadas una por una

  • Licencia no comercial — los pesos del modelo están bajo CC BY-NC 4.0; revisa los requisitos de la licencia para tu caso de uso

Solución de problemas

Problema
Solución

CUDA sin memoria

Reduce el tamaño del lote o usa una GPU con ≥ 6 GB de VRAM

La descarga del modelo es lenta

Descárgalo previamente desde HuggingFace: huggingface-cli download 2Noise/ChatTTS

El audio tiene estática/ruido

Esto es intencional en el modelo de código abierto (medida contra el abuso); usa compile=True para obtener una salida más limpia

torchaudio.save error de dimensión

Asegúrate de que el tensor sea 2D: audio.unsqueeze(0) si es necesario

Salida en chino ilegible

Asegúrate de que el texto de entrada esté codificado en UTF-8; instala WeTextProcessing para una mejor normalización

Primera inferencia lenta

Normal — la compilación del modelo y la carga de pesos ocurren en la primera llamada; las llamadas posteriores son más rápidas

Última actualización

¿Te fue útil?