> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/audio-and-stimme/qwen3-tts.md).

# Qwen3-TTS-Stimmklonung

Mehrsprachige Stimmklonung und TTS mit Qwen3-TTS — 10+ Sprachen, Streaming, Emotionskontrolle

Qwen3-TTS von Alibaba ist ein hochmodernes Text-zu-Sprache-Modell, das unterstützt **10+ Sprachen** mit Stimmklonung aus nur 3 Sekunden Audio. Es bietet natürliche Emotionssteuerung ("fröhlich sprechen", "sanft flüstern"), Streaming mit 97 ms Latenz und zwei Modellgrößen (0,6B und 1,7B). Unter Apache 2.0 veröffentlicht, ist es eines der leistungsfähigsten verfügbaren Open-Source-TTS-Systeme.

## Hauptfunktionen

* **10+ Sprachen**: Englisch, Chinesisch, Japanisch, Koreanisch, Französisch, Deutsch, Spanisch und mehr
* **3-Sekunden-Stimmklonung**: Klone jede Stimme aus einer kurzen Audio-Probe
* **Natürliche Emotionssteuerung**: Steuere den Stil mit einfachen Textanweisungen
* **Streaming-Unterstützung**: 97 ms Latenz beim ersten Token — ideal für Echtzeit-Apps
* **Zwei Größen**: 0,6B (4 GB VRAM) und 1,7B (8 GB VRAM)
* **Fein abstimmbar**: Basismodelle für individuelles Training verfügbar
* **Apache-2.0-Lizenz**: Vollständige kommerzielle Nutzung

## Modellvarianten

| Modell                  | Parameter | VRAM | Qualität  | Geschwindigkeit | Am besten geeignet für |
| ----------------------- | --------- | ---- | --------- | --------------- | ---------------------- |
| Qwen3-TTS-0.6B-Instruct | 0,6B      | 4 GB | Gut       | Schnell         | Echtzeit, Budget-GPUs  |
| Qwen3-TTS-1.7B-Instruct | 1,7B      | 8 GB | Am besten | Mittel          | Produktionsqualität    |
| Qwen3-TTS-0.6B-Base     | 0,6B      | 4 GB | —         | —               | Feinabstimmung         |
| Qwen3-TTS-1.7B-Base     | 1,7B      | 8 GB | —         | —               | Feinabstimmung         |

## Anforderungen

| Komponente | 0,6B          | 1,7B          |
| ---------- | ------------- | ------------- |
| GPU        | RTX 3060 6 GB | RTX 3080 10GB |
| VRAM       | 4 GB          | 8 GB          |
| RAM        | 8 GB          | 16 GB         |
| Festplatte | 5 GB          | 10 GB         |
| Python     | 3.10+         | 3.10+         |

**Empfohlene Clore.ai-GPU**: RTX 3060 ($0,03–0,07/Stunde) für 0,6B, RTX 3080 ($0,05–0,19/Stunde) für 1,7B

## Installation

```bash
pip install transformers torch torchaudio soundfile
```

## Schnellstart — Stimmklonung

```python
import torch
import torchaudio
from transformers import AutoModelForCausalLM, AutoProcessor

model_name = "Qwen/Qwen3-TTS-12Hz-1.7B-Instruct"
processor = AutoProcessor.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.float16,
    device_map="auto"
)

# Referenzstimme laden (3+ Sekunden einer beliebigen Stimme)
reference_audio, sr = torchaudio.load("reference_voice.wav")

# Sprache erzeugen und diese Stimme klonen
text = "Willkommen bei Clore.ai, dem dezentralen GPU-Mietmarktplatz."
inputs = processor(
    text=text,
    audio=reference_audio,
    sampling_rate=sr,
    return_tensors="pt"
).to("cuda")

with torch.no_grad():
    output = model.generate(**inputs, max_new_tokens=2048)

# Dekodieren und speichern
audio = processor.decode(output[0])
torchaudio.save("output.wav", audio.unsqueeze(0), 24000)
```

## Emotionssteuerung

```python
# Emotionen mit natürlichen Textanweisungen steuern
prompts = [
    ("Fröhlich und energiegeladen sprechen", "Tolle Neuigkeiten! Wir haben gerade die neue Funktion veröffentlicht!"),
    ("Sanft und leise flüstern", "Lass mich dir ein Geheimnis über GPU-Preise verraten..."),
    ("Professionell und klar sprechen", "Die Quartalsergebnisse zeigen einen Umsatzanstieg von 40 %."),
    ("Mit Begeisterung sprechen", "Du wirst die Benchmark-Ergebnisse nicht glauben!"),
]

für Stil, text in prompts:
    inputs = processor(
        text=text,
        style_prompt=style,
        audio=reference_audio,
        sampling_rate=sr,
        return_tensors="pt"
    ).to("cuda")
    
    output = model.generate(**inputs, max_new_tokens=2048)
    audio = processor.decode(output[0])
    torchaudio.save(f"output_{style[:10]}.wav", audio.unsqueeze(0), 24000)
```

## Mehrsprachige Generierung

```python
# In verschiedenen Sprachen generieren (gleiche Stimme!)
texts = {
    "en": "Hallo, willkommen auf dem GPU-Marktplatz.",
    "zh": "你好，欢迎来到GPU市场。",
    "ja": "こんにちは、GPUマーケットプレイスへようこそ。",
    "ko": "안녕하세요, GPU 마켓플레이스에 오신 것을 환영합니다.",
    "fr": "Bonjour, bienvenue sur le marché des GPU.",
    "de": "Hallo, willkommen auf dem GPU-Marktplatz.",
}

for lang, text in texts.items():
    inputs = processor(
        text=text, audio=reference_audio, sampling_rate=sr,
        language=lang, return_tensors="pt"
    ).to("cuda")
    output = model.generate(**inputs, max_new_tokens=2048)
    audio = processor.decode(output[0])
    torchaudio.save(f"output_{lang}.wav", audio.unsqueeze(0), 24000)
```

## Vergleich mit anderen TTS-Modellen

| Funktion          | Qwen3-TTS   | Zonos      | Dia           | Kokoro     | XTTS   |
| ----------------- | ----------- | ---------- | ------------- | ---------- | ------ |
| Sprachen          | 10+         | 1 (EN)     | 1 (EN)        | 1 (EN)     | 17     |
| Stimmklon         | 3 Sek.      | 2-30 Sek.  | Nein          | Nein       | 6 Sek. |
| Streaming         | ✅ (97 ms)   | ❌          | ❌             | ❌          | ✅      |
| Emotionssteuerung | ✅ Natürlich | ❌          | ✅ Automatisch | ❌          | ❌      |
| Mehrsprecher      | ❌           | ❌          | ✅             | ❌          | ❌      |
| Min. VRAM         | 4 GB        | 8 GB       | 8 GB          | 2GB        | 6 GB   |
| Lizenz            | Apache 2.0  | Apache 2.0 | Apache 2.0    | Apache 2.0 | AGPL   |

## Tipps für Clore.ai-Nutzer

* **0,6B auf RTX 3060**: Beste Budget-Option für $0,03–0,07/Stunde — gut genug für die meisten TTS-Aufgaben
* **Stapelverarbeitung**: Generiere alle Audioclips in einer Sitzung, um die Mietzeit zu maximieren
* **Referenzaudio zwischenspeichern**: Bewahre deine Stimmreferenzen auf persistentem Speicher auf
* **Streaming für Echtzeit**: Verwende die Streaming-API für Chatbot-/Assistenten-Anwendungen
* **Für benutzerdefinierte Stimmen feinabstimmen**: Miete eine RTX 4090 für ein paar Stunden, um das Basismodell mit deinen Sprachdaten feinabzustimmen

## Fehlerbehebung

| Problem                          | Lösung                                                                         |
| -------------------------------- | ------------------------------------------------------------------------------ |
| Nicht genügend Speicher bei 1,7B | Wechsle zu 0,6B oder verwende `torch_dtype=torch.float16`                      |
| Stimmklon klingt falsch          | Verwende 5-10 Sekunden sauberes Audio (kein Hintergrundrauschen)               |
| Falsche Sprachausgabe            | Explizit übergeben `Sprache` Parameter                                         |
| Langsame erste Generierung       | Normal — das Modell lädt beim ersten Aufruf. Nachfolgende Aufrufe sind schnell |

## Weiterführende Lektüre

* [HuggingFace-Modelle](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Instruct)
* [Qwen3-TTS-Dokumentation](https://qwen.readthedocs.io/)
* [Leitfaden zur Stimmklonung](https://medium.com/@zh.milo/qwen3-tts-the-complete-2026-guide)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/audio-and-stimme/qwen3-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
