> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/audio-and-voice/chatterbox-tts.md).

# Chatterbox वॉइस क्लोनिंग

Clore.ai GPUs पर ज़ीरो-शॉट वॉइस क्लोनिंग और बहुभाषी भाषण सिंथेसिस के लिए Resemble AI द्वारा Chatterbox TTS चलाएँ।

Chatterbox, द्वारा अत्याधुनिक ओपन-सोर्स टेक्स्ट-टू-स्पीच मॉडलों का एक परिवार [Resemble AI](https://resemble.ai)। यह एक छोटे संदर्भ क्लिप (\~10 सेकंड) से ज़ीरो-शॉट वॉइस क्लोनिंग करता है, और ऐसे पराभाषिक टैगों का समर्थन करता है जैसे `[हँसी]` और `[खाँसी]`, और 23+ भाषाओं को कवर करने वाला एक बहुभाषी वेरिएंट प्रदान करता है। तीन मॉडल वेरिएंट उपलब्ध हैं: Turbo (350M, कम-विलंबता), Original (500M, रचनात्मक नियंत्रण), और Multilingual (500M, 23+ भाषाएँ)।

{% hint style="info" %}
**Multilingual V3 अब अनुशंसित बहुभाषी चेकपॉइंट है।** पिछले रिलीज़ के समान 0.5B आकार, लेकिन बेहतर वक्ता समानता, कम हैलुसिनेशन और सभी समर्थित भाषाओं में अधिक प्राकृतिक वाणी के साथ। नीचे दी गई हर चीज़ बिना बदलाव के लागू होती है — वर्तमान वज़न प्राप्त करें और आपको V3 मिल जाएगा।
{% endhint %}

**GitHub:** [resemble-ai/chatterbox](https://github.com/resemble-ai/chatterbox) **PyPI:** [chatterbox-tts](https://pypi.org/project/chatterbox-tts/) **लाइसेंस:** MIT

## मुख्य विशेषताएँ

* **ज़ीरो-शॉट वॉइस क्लोनिंग** — \~10 सेकंड के संदर्भ ऑडियो से किसी भी आवाज़ की क्लोनिंग करें
* **पराभाषिक टैग** (Turbo) — `[हँसी]`, `[खाँसी]`, `[दबी हँसी]`, `[आह]` यथार्थवादी वाणी के लिए
* **23+ भाषाएँ** (Multilingual) — अरबी, चीनी, फ्रेंच, जर्मन, जापानी, कोरियाई, रूसी, स्पेनिश, और भी बहुत कुछ
* **CFG और Exaggeration ट्यूनिंग** (Original) — अभिव्यक्तिशीलता पर रचनात्मक नियंत्रण
* **तीन मॉडल आकार** — Turbo (350M), Original (500M), Multilingual (500M)
* **MIT लाइसेंस** — वाणिज्यिक उपयोग के लिए पूरी तरह खुला

## आवश्यकताएँ

| घटक    | न्यूनतम        | अनुशंसित            |
| ------ | -------------- | ------------------- |
| GPU    | RTX 3060 12 GB | RTX 3090 / RTX 4090 |
| VRAM   | 6 GB           | 10 GB+              |
| RAM    | 8 GB           | 16 GB               |
| डिस्क  | 5 GB           | 15 GB               |
| Python | 3.10+          | 3.11                |
| CUDA   | 12.8+          | 12.8+               |

**Clore.ai की सिफारिश:** आरामदायक VRAM हेडरूम के लिए RTX 3090 ($0.07–0.21/घंटा)। Turbo मॉडल के लिए RTX 3060 काम करता है। लंबे पाठ वाले Multilingual मॉडल के लिए RTX 4090 ($0.14–0.42/घंटा) पर विचार करें।

## इंस्टॉलेशन

```bash
# PyPI से इंस्टॉल करें
pip install chatterbox-tts

# या स्रोत से इंस्टॉल करें
git clone https://github.com/resemble-ai/chatterbox.git
cd chatterbox
pip install -e .

# सत्यापित करें
python -c "from chatterbox.tts import ChatterboxTTS; print('Chatterbox तैयार है')"
```

## त्वरित शुरुआत

### Turbo Model (Lowest Latency)

```python
import torchaudio as ta
from chatterbox.tts_turbo import ChatterboxTurboTTS

model = ChatterboxTurboTTS.from_pretrained(device="cuda")

# पराभाषिक टैगों के साथ बेसिक TTS
text = "अरे, वापस स्वागत है! [दबी हँसी] आज मेरे पास आपके लिए कुछ शानदार खबर है।"

# वॉइस क्लोनिंग — 10+ सेकंड का संदर्भ क्लिप दें
wav = model.generate(text, audio_prompt_path="reference_voice.wav")

ta.save("output_turbo.wav", wav, model.sr)
print(f"{model.sr} Hz पर सहेजा गया")
```

### Original Model (English, Creative Controls)

```python
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS

model = ChatterboxTTS.from_pretrained(device="cuda")

text = "तेज़ भूरी लोमड़ी आलसी कुत्ते के ऊपर कूदती है। यह एक सुंदर सुबह थी।"

# वॉइस क्लोनिंग के बिना जनरेट करें (डिफ़ॉल्ट आवाज़ का उपयोग करता है)
wav = model.generate(text)
ta.save("output_default.wav", wav, model.sr)

# वॉइस क्लोनिंग के साथ जनरेट करें
wav = model.generate(text, audio_prompt_path="my_voice_sample.wav")
ta.save("output_cloned.wav", wav, model.sr)
```

## उपयोग के उदाहरण

### बहुभाषी वॉइस क्लोनिंग

```python
import torchaudio as ta
from chatterbox.mtl_tts import ChatterboxMultilingualTTS

model = ChatterboxMultilingualTTS.from_pretrained(device="cuda")

# फ्रेंच
french_text = "Bonjour, comment allez-vous? Bienvenue dans notre démonstration."
wav_fr = model.generate(french_text, language_id="fr")
ta.save("output_french.wav", wav_fr, model.sr)

# जापानी
japanese_text = "こんにちは、テキスト読み上げのデモンストレーションです。"
wav_ja = model.generate(japanese_text, language_id="ja")
ta.save("output_japanese.wav", wav_ja, model.sr)

# रूसी में वॉइस क्लोनिंग के साथ
russian_text = "Привет! Это демонстрация синтеза речи на русском языке."
wav_ru = model.generate(
    russian_text,
    language_id="ru",
    audio_prompt_path="russian_speaker.wav"
)
ta.save("output_russian.wav", wav_ru, model.sr)

बहुभाषी जनरेशन पूरी हुई
```

### पराभाषिक टैग (Turbo)

```python
import torchaudio as ta
from chatterbox.tts_turbo import ChatterboxTurboTTS

model = ChatterboxTurboTTS.from_pretrained(device="cuda")

samples = [
    ("greeting", "नमस्ते! [हँसी] आपको फिर से देखकर बहुत अच्छा लगा।"),
    ("nervous", "उम्, ठीक है [खाँसी] मुझे इसके बारे में वास्तव में यकीन नहीं है।"),
    ("excited", "हे भगवान! [दबी हँसी] यह तो बिल्कुल अविश्वसनीय खबर है!"),
]

for name, text in samples:
    wav = model.generate(text, audio_prompt_path="speaker_ref.wav")
    ta.save(f"para_{name}.wav", wav, model.sr)
    print(f"जनरेट हुआ: {name}")
```

### बैच प्रोसेसिंग स्क्रिप्ट

```python
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS
import os

model = ChatterboxTTS.from_pretrained(device="cuda")

# पंक्तियों की एक सूची को प्रोसेस करें (जैसे, ऑडियोबुक अध्यायों के लिए)
lines = [
    "अध्याय एक। साहसिक यात्रा शुरू होती है।",
    "वह एक अँधेरी और तूफ़ानी रात थी।",
    "नायक चौराहे पर खड़ा था, आगे के मार्ग को लेकर अनिश्चित।",
]

os.makedirs("output_batch", exist_ok=True)

for i, line in enumerate(lines):
    wav = model.generate(line, audio_prompt_path="narrator_voice.wav")
    ta.save(f"output_batch/line_{i:03d}.wav", wav, model.sr)
    print(f"[{i+1}/{len(lines)}] {line[:40]}...")

print("बैच प्रोसेसिंग पूरी हुई")
```

## Clore.ai उपयोगकर्ताओं के लिए सुझाव

* **मॉडल चयन** — कम-विलंबता वाले वॉइस एजेंट के लिए Turbo का उपयोग करें, English रचनात्मक कार्य के लिए Original, और गैर-अंग्रेज़ी सामग्री के लिए Multilingual
* **संदर्भ ऑडियो गुणवत्ता** — सर्वोत्तम वॉइस क्लोनिंग परिणामों के लिए एक साफ़, शोर-रहित 10–30 सेकंड का क्लिप उपयोग करें
* **Docker सेटअप** — बेस इमेज `pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime`, पोर्ट एक्सपोज़ करें `7860/http` Gradio के लिए
* **मेमोरी प्रबंधन** — कॉल करें `torch.cuda.empty_cache()` बड़े बैचों के बीच VRAM मुक्त करने के लिए
* **समर्थित भाषाएँ** — ar, da, de, el, en, es, fi, fr, he, hi, it, ja, ko, ms, nl, no, pl, pt, ru, sv, sw, tr, zh
* **HuggingFace Space** — किराए पर लेने से पहले यहाँ आज़माएँ [huggingface.co/spaces/ResembleAI/Chatterbox](https://huggingface.co/spaces/ResembleAI/Chatterbox)

## समस्या निवारण

| समस्या                          | समाधान                                                                                                                 |
| ------------------------------- | ---------------------------------------------------------------------------------------------------------------------- |
| `CUDA out of memory`            | Turbo (350M) का उपयोग Original/Multilingual (500M) के बजाय करें, या एक बड़ा GPU किराए पर लें                           |
| क्लोन की गई आवाज़ मेल नहीं खाती | कम से कम बैकग्राउंड शोर वाले लंबे (15–30 सेकंड) संदर्भ क्लिप का उपयोग करें                                             |
| `numpy` संस्करण संघर्ष          | चलाएँ `pip install numpy==1.26.4 --force-reinstall`                                                                    |
| मॉडल डाउनलोड धीमा है            | मॉडल पहली बार रन करने पर HuggingFace से प्राप्त किए जाते हैं (\~2 GB); इनके साथ पहले से डाउनलोड करें `huggingface-cli` |
| ऑडियो में आर्टिफ़ैक्ट्स हैं     | प्रति जनरेशन पाठ की लंबाई कम करें; बहुत लंबे पाठ गुणवत्ता को खराब कर सकते हैं                                          |
| `ModuleNotFoundError`           | सुनिश्चित करें `pip install chatterbox-tts` बिना त्रुटियों के पूरा हो गया; Python 3.11 संगतता जाँचें                   |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/audio-and-voice/chatterbox-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
