> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/chatterbox-tts.md).

# Клонирование голоса Chatterbox

Chatterbox — это семейство современных моделей преобразования текста в речь с открытым исходным кодом от [Resemble AI](https://resemble.ai). Он выполняет клонирование голоса без обучения на коротком референсном фрагменте (\~10 секунд), поддерживает паралингвистические теги вроде `[laugh]` и `[cough]`и предлагает мультиязычную версию, охватывающую более 23 языков. Доступны три варианта модели: Turbo (350M, низкая задержка), Original (500M, творческие настройки) и Multilingual (500M, 23+ языков).

{% hint style="info" %}
**Multilingual V3 теперь является рекомендуемым мультиязычным чекпойнтом.** Та же размерность 0,5B, что и в предыдущем релизе, но с лучшим сходством голоса, меньшим числом галлюцинаций и более естественной речью во всех поддерживаемых языках. Всё ниже применимо без изменений — загрузите текущие веса, и вы получите V3.
{% endhint %}

**GitHub:** [resemble-ai/chatterbox](https://github.com/resemble-ai/chatterbox) **PyPI:** [chatterbox-tts](https://pypi.org/project/chatterbox-tts/) **Лицензия:** MIT

## Ключевые особенности

* **Клонирование голоса без обучения** — клонируйте любой голос по \~10 секундам эталонного аудио
* **Паралингвистические теги** (Turbo) — `[laugh]`, `[cough]`, `[chuckle]`, `[sigh]` для реалистичной речи
* **23+ языков** (Multilingual) — арабский, китайский, французский, немецкий, японский, корейский, русский, испанский и другие
* **Настройка CFG и выразительности** (Original) — творческий контроль над выразительностью
* **Три размера моделей** — Turbo (350M), Original (500M), Multilingual (500M)
* **лицензией MIT** — полностью открыт для коммерческого использования

## Требования

| Компонент | Минимум        | Рекомендуется       |
| --------- | -------------- | ------------------- |
| GPU       | RTX 3060 12 ГБ | RTX 3090 / RTX 4090 |
| VRAM      | 6 ГБ           | 10 ГБ+              |
| ОЗУ       | 8 ГБ           | 16 ГБ               |
| Диск      | 5 ГБ           | 15 ГБ               |
| Python    | 3.10+          | 3.11                |
| CUDA      | 12.8+          | 12.8+               |

**Рекомендация Clore.ai:** RTX 3090 ($0.07–0.21/ч) для комфортного запаса VRAM. RTX 3060 подходит для модели Turbo. Для модели Multilingual с длинными текстами рассмотрите RTX 4090 ($0.14–0.42/ч).

## Установка

```bash
# Установка из PyPI
pip install chatterbox-tts

# Или установите из исходников
git clone https://github.com/resemble-ai/chatterbox.git
cd chatterbox
pip install -e .

# Проверить
python -c "from chatterbox.tts import ChatterboxTTS; print('Chatterbox готов')"
```

## Быстрый старт

### Модель Turbo (минимальная задержка)

```python
import torchaudio as ta
from chatterbox.tts_turbo import ChatterboxTurboTTS

model = ChatterboxTurboTTS.from_pretrained(device="cuda")

# Базовый TTS с паралингвистическими тегами
text = "Эй, с возвращением! [chuckle] У меня для тебя сегодня отличные новости."

# Клонирование голоса — предоставьте референсный фрагмент длиной 10+ секунд
wav = model.generate(text, audio_prompt_path="reference_voice.wav")

ta.save("output_turbo.wav", wav, model.sr)
print(f"Сохранено с частотой {model.sr} Гц")
```

### Модель Original (английский, творческие настройки)

```python
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS

model = ChatterboxTTS.from_pretrained(device="cuda")

text = "Быстрая коричневая лиса перепрыгивает через ленивую собаку. Это было прекрасное утро."

# Генерация без клонирования голоса (используется голос по умолчанию)
wav = model.generate(text)
ta.save("output_default.wav", wav, model.sr)

# Генерация с клонированием голоса
wav = model.generate(text, audio_prompt_path="my_voice_sample.wav")
ta.save("output_cloned.wav", wav, model.sr)
```

## Примеры использования

### Мультиязычное клонирование голоса

```python
import torchaudio as ta
from chatterbox.mtl_tts import ChatterboxMultilingualTTS

model = ChatterboxMultilingualTTS.from_pretrained(device="cuda")

# Французский
french_text = "Bonjour, comment allez-vous? Bienvenue dans notre démonstration."
wav_fr = model.generate(french_text, language_id="fr")
ta.save("output_french.wav", wav_fr, model.sr)

# Японский
こんにちは、テキスト読み上げのデモンストレーションです。
wav_ja = model.generate(japanese_text, language_id="ja")
ta.save("output_japanese.wav", wav_ja, model.sr)

# Русский с клонированием голоса
Привет! Это демонстрация синтеза речи на русском языке.
wav_ru = model.generate(
    russian_text,
    language_id="ru",
    audio_prompt_path="russian_speaker.wav"
)
ta.save("output_russian.wav", wav_ru, model.sr)

print("Мультиязычная генерация завершена")
```

### Паралингвистические теги (Turbo)

```python
import torchaudio as ta
from chatterbox.tts_turbo import ChatterboxTurboTTS

model = ChatterboxTurboTTS.from_pretrained(device="cuda")

samples = [
    ("greeting", "Привет! [laugh] Так здорово снова видеть тебя."),
    ("nervous", "Умм, ну [cough] я не совсем уверена в этом."),
    ("excited", "О боже! [chuckle] Это совершенно невероятные новости!"),
]

for name, text in samples:
    wav = model.generate(text, audio_prompt_path="speaker_ref.wav")
    ta.save(f"para_{name}.wav", wav, model.sr)
    print(f"Сгенерировано: {name}")
```

### Скрипт пакетной обработки

```python
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS
import os

model = ChatterboxTTS.from_pretrained(device="cuda")

# Обработка списка строк (например, для глав аудиокниги)
lines = [
    "Глава первая. Приключение начинается.",
    "Это была тёмная и бурная ночь.",
    "Герой стоял на перепутье, не зная, какой путь выбрать.",
]

os.makedirs("output_batch", exist_ok=True)

for i, line in enumerate(lines):
    wav = model.generate(line, audio_prompt_path="narrator_voice.wav")
    ta.save(f"output_batch/line_{i:03d}.wav", wav, model.sr)
    print(f"[{i+1}/{len(lines)}] {line[:40]}...")

print("Пакетная обработка завершена")
```

## Советы для пользователей Clore.ai

* **Выбор модели** — используйте Turbo для голосовых агентов с низкой задержкой, Original для творческой работы на английском, Multilingual для контента не на английском
* **Качество эталонного аудио** — используйте чистый фрагмент без шума длительностью 10–30 секунд для лучших результатов клонирования голоса
* **Настройка Docker** — базовый образ `pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime`, откройте порт `7860/http` для Gradio
* **Управление памятью** — вызывайте `torch.cuda.empty_cache()` между большими партиями, чтобы освободить VRAM
* **Поддерживаемые языки** — ar, da, de, el, en, es, fi, fr, he, hi, it, ja, ko, ms, nl, no, pl, pt, ru, sv, sw, tr, zh
* **HuggingFace Space** — попробуйте перед арендой на [huggingface.co/spaces/ResembleAI/Chatterbox](https://huggingface.co/spaces/ResembleAI/Chatterbox)

## Устранение неполадок

| Проблема                         | Решение                                                                                                            |
| -------------------------------- | ------------------------------------------------------------------------------------------------------------------ |
| `CUDA out of memory`             | Используйте Turbo (350M) вместо Original/Multilingual (500M) или арендуйте более мощный GPU                        |
| Клонированный голос не совпадает | Используйте более длинный (15–30 с) и более чистый референсный фрагмент с минимальным фоновым шумом                |
| `numpy` конфликт версий          | Запускайте `pip install numpy==1.26.4 --force-reinstall`                                                           |
| Медленная загрузка модели        | Модели загружаются с HuggingFace при первом запуске (\~2 ГБ); предварительно загрузите с помощью `huggingface-cli` |
| В аудио есть артефакты           | Уменьшите длину текста для одной генерации; очень длинные тексты могут ухудшать качество                           |
| `ModuleNotFoundError`            | Убедитесь, что `pip install chatterbox-tts` завершено без ошибок; проверьте совместимость с Python 3.11            |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/chatterbox-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
