> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/audio-and-stimme/dia-tts.md).

# Dia TTS (Nari Labs)

Generiere mehrsprachige Dialoge mit Emotionen mit Dia TTS von Nari Labs

Dia von Nari Labs ist ein fortschrittliches Text-zu-Sprache-Modell, das sich auf **realistische Dialoge mit mehreren Sprechern**. Im Gegensatz zu herkömmlichem TTS, das jeweils einen Sprecher verarbeitet, erzeugt Dia natürliche Gespräche zwischen mehreren Sprechern mit Emotionen, Lachen, Zögern und anderen nicht-verbalen Hinweisen. Mit 1,6 Milliarden Parametern läuft es auf jeder GPU mit 8 GB+.

## Hauptfunktionen

* **Dialog mit mehreren Sprechern**: Erzeuge Gespräche zwischen 2+ Sprechern in einem Durchgang
* **Nicht-verbale Hinweise**: Lachen `(lacht)`, Zögern `(seufzt)`, Pausen — automatisch eingebettet
* **Sprachäußerung mit Emotionen**: Natürliche Intonation ohne explizite Emotions-Tags
* **1,6 Milliarden Parameter**: Passt auf RTX 3070/3080 (8–10 GB VRAM)
* **Apache-2.0-Lizenz**: Vollständige kommerzielle Nutzung
* **HuggingFace-Integration**: Funktioniert mit der Transformers-Bibliothek

## Anforderungen

| Komponente | Minimum         | Empfohlen        |
| ---------- | --------------- | ---------------- |
| GPU        | RTX 3070 (8 GB) | RTX 3080 (10 GB) |
| VRAM       | 8 GB            | 10 GB+           |
| RAM        | 16 GB           | 32 GB            |
| Festplatte | 10 GB           | 15 GB            |
| Python     | 3.9+            | 3.11             |

**Empfohlene Clore.ai-GPU**: RTX 3080 10 GB ($0,05–0,19/Std.)

## Installation

```bash
# Option 1: pip install
pip install dia-tts

# Option 2: Aus dem Quellcode
git clone https://github.com/nari-labs/dia.git
cd dia
pip install -e .
```

## Schnellstart

### Einfacher Dialog mit mehreren Sprechern

```python
from dia import Dia

# Modell laden
model = Dia.from_pretrained("nari-labs/Dia-1.6B")

# Dialog mit mehreren Sprechern generieren
# [S1] = Sprecher 1, [S2] = Sprecher 2
text = """[S1] Hey, hast du die neue GPU-Mietplattform schon ausprobiert?
[S2] Du meinst Clore? Ja, ich habe gestern eine RTX 4090 gemietet.
[S1] Wie war es?
[S2] (lacht) Ehrlich? Viel günstiger, als ich erwartet hatte. So etwa zwei Dollar am Tag.
[S1] Unmöglich. Das ist... das ist wirklich verrückt."""

audio = model.generate(text)

# In Datei speichern
import soundfile as sf
sf.write("dialog.wav", audio, samplerate=24000)
```

### Mit Emotion und nicht-verbalen Hinweisen

```python
# Dia verarbeitet natürliche Sprachmuster automatisch
text = """[S1] Ich habe gerade die Ergebnisse bekommen...
[S2] Und? Lass mich nicht zappeln!
[S1] (seufzt) Wir haben bestanden. Wir haben tatsächlich alle Tests bestanden.
[S2] (lacht) Ich hab’s dir gesagt! Ich hab’s dir gesagt, dass wir es schaffen!
[S1] Ich kann es nicht glauben... (lacht) okay, okay, lass uns feiern."""

audio = model.generate(text, temperature=0,8)
sf.write("emotional_dialog.wav", audio, samplerate=24000)
```

### Einzelner Sprecher

```python
# Funktioniert auch für einen einzelnen Sprecher
text = "[S1] Willkommen in der Clore-AI-Dokumentation. In diesem Leitfaden zeigen wir dir, wie du deine erste GPU-Miete einrichtest und ein Machine-Learning-Modell bereitstellst."

audio = model.generate(text)
sf.write("narration.wav", audio, samplerate=24000)
```

## Gradio-Web-UI

```python
# Interaktive Demo starten
python -m dia.app --port 7860 --share

# Oder manuell:
import gradio as gr
from dia import Dia

model = Dia.from_pretrained("nari-labs/Dia-1.6B")

def generate_speech(text):
    audio = model.generate(text)
    return (24000, audio)

demo = gr.Interface(
    fn=generate_speech,
    inputs=gr.Textbox(label="Dialog (verwende [S1], [S2]-Tags)", lines=10),
    outputs=gr.Audio(label="Generierte Sprache"),
    title="Dia TTS — Dialog mit mehreren Sprechern"
)
demo.launch(server_port=7860)
```

## Anwendungsfälle

* **Podcast-Generierung**: Erstelle Podcast-Gespräche aus Skripten
* **Dialoge für Hörbücher**: Erzeuge Gespräche zwischen Figuren mit unterschiedlichen Stimmen
* **Dialoge im Spiel**: NPC-Gespräche mit natürlichen Sprachmustern
* **Trainingsdaten**: Erzeuge vielfältige Sprachdatensätze für das ASR-Training
* **Stimmen für Chatbots**: Dialog mit mehreren Runden und emotionalen Reaktionen

## Tipps für Clore.ai-Nutzer

* **RTX 3080 ist ideal**: 10 GB VRAM bewältigen Dia problemlos für $0,05–0,19/Std.
* **Batch-Generierung**: Verarbeite mehrere Dialoge in einer Schleife, um deine Mietzeit optimal zu nutzen
* **Modelle im persistenten Speicher ablegen**: Wenn deine Clore-Instanz über eine persistente Festplatte verfügt, speichere das Modell im Cache, um erneutes Herunterladen zu vermeiden
* **Temperatur 0,7–0,9**: Niedriger = konsistenter, höher = ausdrucksstärker/variierter
* **Nur Englisch**: Dia konzentriert sich derzeit auf Englisch — für Mehrsprachigkeit siehe die Qwen3-TTS-Anleitung

## Fehlerbehebung

| Problem                          | Lösung                                                                                       |
| -------------------------------- | -------------------------------------------------------------------------------------------- |
| CUDA-Speicher erschöpft          | Verwende `model.to("cuda", torch_dtype=torch.float16)` für Halbpräzision                     |
| Sprecher klingen ähnlich         | Füge mehr Text/Kontext pro Sprecher hinzu; versuche eine höhere Temperatur                   |
| Nicht-verbale Hinweise ignoriert | Stelle das richtige Format sicher: `(lacht)`, `(seufzt)` in Klammern                         |
| Audioqualität niedrig            | Erhöhen Sie `num_steps` Parameter, falls verfügbar; stelle eine Abtastrate von 24 kHz sicher |

## Weiterführende Lektüre

* [Nari Labs GitHub](https://github.com/nari-labs/dia)
* [HuggingFace-Modell](https://huggingface.co/nari-labs/Dia-1.6B)
* [Vergleich: Dia vs. ElevenLabs](https://nari-labs.github.io/dia/) — offizielle Demoseite


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/audio-and-stimme/dia-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
