For the complete documentation index, see llms.txt. This page is also available as Markdown.

Dia TTS (Nari Labs)

Genera diálogo multihablante con emoción usando Dia TTS de Nari Labs

Dia de Nari Labs es un modelo avanzado de texto a voz que se especializa en diálogos realistas entre varios hablantes. A diferencia del TTS tradicional que maneja un hablante a la vez, Dia genera conversaciones naturales entre múltiples hablantes con emoción, risa, vacilación y otras señales no verbales. Con 1.6 mil millones de parámetros, funciona en cualquier GPU de 8 GB o más.

Características clave

  • Diálogo multihablante: Genera conversaciones entre 2 o más hablantes en una sola pasada

  • Señales no verbales: Risa (ríe), vacilación (suspira), pausas — integradas automáticamente

  • Habla emocional: Entonación natural sin etiquetas de emoción explícitas

  • 1.6 mil millones de parámetros: Cabe en una RTX 3070/3080 (8-10 GB de VRAM)

  • licencia Apache 2.0: Uso comercial completo

  • Integración con HuggingFace: Funciona con la biblioteca Transformers

Requisitos

Componente
Mínimo
Recomendado

GPU

RTX 3070 (8GB)

RTX 3080 (10GB)

VRAM

8GB

10GB+

RAM

16GB

32GB

Disco

10GB

15 GB

Python

3.9+

3.11

GPU recomendada de Clore.ai: RTX 3080 de 10 GB ($0.05–0.19/h)

Instalación

Inicio rápido

Diálogo multihablante básico

Con emoción y señales no verbales

Un solo hablante

Interfaz web de Gradio

Casos de uso

  • Generación de pódcast: Crea podcasts conversacionales a partir de guiones

  • Diálogos para audiolibros: Genera conversaciones de personajes con voces distintas

  • Diálogo de videojuegos: Conversaciones de NPC con patrones naturales del habla

  • Datos de entrenamiento: Genera conjuntos de datos de voz diversos para entrenamiento de ASR

  • Voces de chatbot: Diálogo de varios turnos con respuestas emocionales

Consejos para usuarios de Clore.ai

  • La RTX 3080 es ideal: 10 GB de VRAM manejan Dia fácilmente por $0.05–0.19/h

  • Generación por lotes: Procesa varios diálogos en un bucle para maximizar tu tiempo de alquiler

  • Guarda los modelos en almacenamiento persistente: Si tu instancia de Clore tiene disco persistente, almacena en caché el modelo para evitar volver a descargarlo

  • Temperatura 0.7–0.9: Más baja = más consistente, más alta = más expresiva/variada

  • Solo inglés: Dia actualmente se centra en inglés — para multilingüe, consulta la guía de Qwen3-TTS

Solución de problemas

Problema
Solución

CUDA sin memoria

Usa model.to("cuda", torch_dtype=torch.float16) para precisión media

Los hablantes suenan parecidos

Añade más texto/contexto por hablante; prueba con una temperatura más alta

Se ignoran las señales no verbales

Asegúrate de que el formato sea correcto: (ríe), (suspira) entre paréntesis

Calidad de audio baja

Aumenta num_steps parámetro si está disponible; asegúrate de una frecuencia de muestreo de 24 kHz

Lecturas adicionales

Última actualización

¿Te fue útil?