Dia TTS (Nari Labs)
Genera diálogo multihablante con emoción usando Dia TTS de Nari Labs
Dia de Nari Labs es un modelo avanzado de texto a voz que se especializa en diálogos realistas entre varios hablantes. A diferencia del TTS tradicional que maneja un hablante a la vez, Dia genera conversaciones naturales entre múltiples hablantes con emoción, risa, vacilación y otras señales no verbales. Con 1.6 mil millones de parámetros, funciona en cualquier GPU de 8 GB o más.
Características clave
Diálogo multihablante: Genera conversaciones entre 2 o más hablantes en una sola pasada
Señales no verbales: Risa
(ríe), vacilación(suspira), pausas — integradas automáticamenteHabla emocional: Entonación natural sin etiquetas de emoción explícitas
1.6 mil millones de parámetros: Cabe en una RTX 3070/3080 (8-10 GB de VRAM)
licencia Apache 2.0: Uso comercial completo
Integración con HuggingFace: Funciona con la biblioteca Transformers
Requisitos
GPU
RTX 3070 (8GB)
RTX 3080 (10GB)
VRAM
8GB
10GB+
RAM
16GB
32GB
Disco
10GB
15 GB
Python
3.9+
3.11
GPU recomendada de Clore.ai: RTX 3080 de 10 GB ($0.05–0.19/h)
Instalación
Inicio rápido
Diálogo multihablante básico
Con emoción y señales no verbales
Un solo hablante
Interfaz web de Gradio
Casos de uso
Generación de pódcast: Crea podcasts conversacionales a partir de guiones
Diálogos para audiolibros: Genera conversaciones de personajes con voces distintas
Diálogo de videojuegos: Conversaciones de NPC con patrones naturales del habla
Datos de entrenamiento: Genera conjuntos de datos de voz diversos para entrenamiento de ASR
Voces de chatbot: Diálogo de varios turnos con respuestas emocionales
Consejos para usuarios de Clore.ai
La RTX 3080 es ideal: 10 GB de VRAM manejan Dia fácilmente por $0.05–0.19/h
Generación por lotes: Procesa varios diálogos en un bucle para maximizar tu tiempo de alquiler
Guarda los modelos en almacenamiento persistente: Si tu instancia de Clore tiene disco persistente, almacena en caché el modelo para evitar volver a descargarlo
Temperatura 0.7–0.9: Más baja = más consistente, más alta = más expresiva/variada
Solo inglés: Dia actualmente se centra en inglés — para multilingüe, consulta la guía de Qwen3-TTS
Solución de problemas
CUDA sin memoria
Usa model.to("cuda", torch_dtype=torch.float16) para precisión media
Los hablantes suenan parecidos
Añade más texto/contexto por hablante; prueba con una temperatura más alta
Se ignoran las señales no verbales
Asegúrate de que el formato sea correcto: (ríe), (suspira) entre paréntesis
Calidad de audio baja
Aumenta num_steps parámetro si está disponible; asegúrate de una frecuencia de muestreo de 24 kHz
Lecturas adicionales
Comparación: Dia vs ElevenLabs — página oficial de demostración
Última actualización
¿Te fue útil?