Voz conversacional ChatTTS
Ejecuta texto a voz conversacional ChatTTS con control fino de la prosodia en GPUs de Clore.ai.
ChatTTS es un modelo generativo de voz de 300 millones de parámetros optimizado para escenarios de diálogo como asistentes LLM, chatbots y aplicaciones de voz interactivas. Produce voz con sonido natural, con pausas realistas, risas, muletillas y entonación — características que la mayoría de los sistemas TTS tienen dificultades para reproducir. El modelo admite inglés y chino y genera audio a 24 kHz.
GitHub: 2noise/ChatTTS (30K+ estrellas) Licencia: AGPLv3+ (código), CC BY-NC 4.0 (pesos del modelo — no comercial)
Características clave
Prosodia conversacional — pausas naturales, muletillas e entonación ajustadas para el diálogo
Etiquetas de control detalladas —
[oral_0-9],[laugh_0-2],[break_0-7],[uv_break],[lbreak]Varios hablantes — muestrea hablantes aleatorios o reutiliza incrustaciones del hablante para mantener la coherencia
Temperatura / top-P / top-K — controla la diversidad de la generación
Inferencia por lotes — sintetiza varios textos en una sola llamada
Ligero — ~300M de parámetros, funciona con 4 GB de VRAM
Requisitos
GPU
RTX 3060 (4 GB libres)
RTX 3090 / RTX 4090
VRAM
4 GB
8 GB+
RAM
8 GB
16 GB
Disco
5 GB
10 GB
Python
3.9+
3.11
CUDA
12.8+
12.8+
Recomendación de Clore.ai: Una RTX 3060 ($0.03–0.07/h) maneja ChatTTS cómodamente. Para producción por lotes o menor latencia, elige una RTX 3090 ($0.07–0.21/h).
Instalación
Inicio rápido
Ejemplos de uso
Voz del hablante consistente
Muestrea una incrustación aleatoria del hablante y reutilízala en varias generaciones para una voz consistente:
Etiquetas de control a nivel de palabra
Inserta etiquetas de control directamente en el texto para una prosodia precisa:
Procesamiento por lotes con WebUI
ChatTTS incluye una interfaz web de Gradio para uso interactivo:
Abre la http_pub URL desde el panel de pedidos de Clore.ai para acceder a la interfaz.
Consejos para usuarios de Clore.ai
Usa
compile=Truedespués de las pruebas iniciales — la compilación de PyTorch añade tiempo de inicio, pero acelera significativamente la inferencia repetidaMapeo de puertos — expón el puerto
7860/httpal desplegar con la WebUIImagen Docker — usa
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtimecomo basePersistencia del hablante — guarda
rand_spkcadenas en un archivo para que puedas reutilizar voces entre sesiones sin volver a muestrearAgrupa tus solicitudes —
chat.infer()acepta una lista de textos y los procesa juntos, lo que es más eficiente que hacer llamadas una por unaLicencia no comercial — los pesos del modelo están bajo CC BY-NC 4.0; revisa los requisitos de la licencia para tu caso de uso
Solución de problemas
CUDA sin memoria
Reduce el tamaño del lote o usa una GPU con ≥ 6 GB de VRAM
La descarga del modelo es lenta
Descárgalo previamente desde HuggingFace: huggingface-cli download 2Noise/ChatTTS
El audio tiene estática/ruido
Esto es intencional en el modelo de código abierto (medida contra el abuso); usa compile=True para obtener una salida más limpia
torchaudio.save error de dimensión
Asegúrate de que el tensor sea 2D: audio.unsqueeze(0) si es necesario
Salida en chino ilegible
Asegúrate de que el texto de entrada esté codificado en UTF-8; instala WeTextProcessing para una mejor normalización
Primera inferencia lenta
Normal — la compilación del modelo y la carga de pesos ocurren en la primera llamada; las llamadas posteriores son más rápidas
Última actualización
¿Te fue útil?