> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/qwen3-tts.md).

# Клонирование голоса Qwen3-TTS

Qwen3-TTS от Alibaba — это передовая модель преобразования текста в речь, поддерживающая **10+ языков** с клонированием голоса всего по 3 секундам аудио. Она включает управление эмоциями на естественном языке («говорите радостно», «шепчите тихо»), потоковую передачу с задержкой 97 мс и два размера модели (0,6B и 1,7B). Выпущена под лицензией Apache 2.0 и является одной из самых мощных доступных систем TTS с открытым исходным кодом.

## Ключевые особенности

* **10+ языков**: английский, китайский, японский, корейский, французский, немецкий, испанский и другие
* **Клонирование голоса по 3 секундам**: Клонируйте любой голос по короткому аудиосемплу
* **Естественное управление эмоциями**: Управляйте стилем с помощью простых текстовых инструкций
* **Поддержка потоковой передачи**: Задержка первого токена 97 мс — отлично подходит для приложений реального времени
* **Два размера**: 0,6B (4 ГБ VRAM) и 1,7B (8 ГБ VRAM)
* **Поддаётся дообучению**: Базовые модели доступны для кастомного обучения
* **лицензии Apache 2.0**: Полностью для коммерческого использования

## Варианты модели

| Модель                  | Параметры | VRAM | Качество    | Скорость | Лучше всего для                          |
| ----------------------- | --------- | ---- | ----------- | -------- | ---------------------------------------- |
| Qwen3-TTS-0.6B-Instruct | 0,6B      | 4 ГБ | Хорошо      | Быстро   | Работа в реальном времени, бюджетные GPU |
| Qwen3-TTS-1.7B-Instruct | 1,7B      | 8 ГБ | Лучше всего | Средне   | Качество для продакшена                  |
| Qwen3-TTS-0.6B-Base     | 0,6B      | 4 ГБ | —           | —        | Дообучение                               |
| Qwen3-TTS-1.7B-Base     | 1,7B      | 8 ГБ | —           | —        | Дообучение                               |

## Требования

| Компонент | 0,6B          | 1,7B          |
| --------- | ------------- | ------------- |
| GPU       | RTX 3060 6 ГБ | RTX 3080 10GB |
| VRAM      | 4 ГБ          | 8 ГБ          |
| ОЗУ       | 8 ГБ          | 16GB          |
| Диск      | 5 ГБ          | 10 ГБ         |
| Python    | 3.10+         | 3.10+         |

**Рекомендуемая GPU от Clore.ai**: RTX 3060 ($0,03–0,07/ч) для 0,6B, RTX 3080 ($0,05–0,19/ч) для 1,7B

## Установка

```bash
pip install transformers torch torchaudio soundfile
```

## Быстрый старт — клонирование голоса

```python
import torch
import torchaudio
from transformers import AutoModelForCausalLM, AutoProcessor

model_name = "Qwen/Qwen3-TTS-12Hz-1.7B-Instruct"
processor = AutoProcessor.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.float16,
    device_map="auto"
)

# Загрузить эталонный голос (3+ секунды любого голоса)
reference_audio, sr = torchaudio.load("reference_voice.wav")

# Сгенерировать речь, клонируя этот голос
text = "Добро пожаловать в Clore.ai, децентрализованный маркетплейс аренды GPU."
inputs = processor(
    text=text,
    audio=reference_audio,
    sampling_rate=sr,
    return_tensors="pt"
).to("cuda")

with torch.no_grad():
    output = model.generate(**inputs, max_new_tokens=2048)

# Декодировать и сохранить
audio = processor.decode(output[0])
torchaudio.save("output.wav", audio.unsqueeze(0), 24000)
```

## Управление эмоциями

```python
# Управляйте эмоциями с помощью естественно-языковых инструкций
prompts = [
    ("Говорите радостно и энергично", "Отличные новости! Мы только что запустили новую функцию!"),
    ("Шепчите мягко и нежно", "Позвольте рассказать вам секрет о ценах на GPU..."),
    ("Говорите профессионально и чётко", "Квартальные результаты показывают рост выручки на 40%."),
    ("Говорите с воодушевлением", "Вы не поверите результатам бенчмарка!"),
]

for style, text in prompts:
    inputs = processor(
        text=text,
        style_prompt=style,
        audio=reference_audio,
        sampling_rate=sr,
        return_tensors="pt"
    ).to("cuda")
    
    output = model.generate(**inputs, max_new_tokens=2048)
    audio = processor.decode(output[0])
    torchaudio.save(f"output_{style[:10]}.wav", audio.unsqueeze(0), 24000)
```

## Мультиязычная генерация

```python
# Генерировать на разных языках (тем же голосом!)
texts = {
    "en": "Hello, welcome to the GPU marketplace.",
    "zh": "你好，欢迎来到GPU市场。",
    "ja": "こんにちは、GPUマーケットプレイスへようこそ。",
    "ko": "안녕하세요, GPU 마켓플레이스에 오신 것을 환영합니다.",
    "fr": "Bonjour, bienvenue sur le marché GPU.",
    "de": "Hallo, willkommen auf dem GPU-Marktplatz.",
}

for lang, text in texts.items():
    inputs = processor(
        text=text, audio=reference_audio, sampling_rate=sr,
        language=lang, return_tensors="pt"
    ).to("cuda")
    output = model.generate(**inputs, max_new_tokens=2048)
    audio = processor.decode(output[0])
    torchaudio.save(f"output_{lang}.wav", audio.unsqueeze(0), 24000)
```

## Сравнение с другими TTS-моделями

| Функция             | Qwen3-TTS     | Zonos      | Dia        | Kokoro     | XTTS  |
| ------------------- | ------------- | ---------- | ---------- | ---------- | ----- |
| Языки               | 10+           | 1 (EN)     | 1 (EN)     | 1 (EN)     | 17    |
| Клонирование голоса | 3 сек         | 2–30 с     | Нет        | Нет        | 6 сек |
| Потоковая передача  | ✅ (97 мс)     | ❌          | ❌          | ❌          | ✅     |
| Управление эмоциями | ✅ Естественно | ❌          | ✅ Авто     | ❌          | ❌     |
| Многоголосый        | ❌             | ❌          | ✅          | ❌          | ❌     |
| Мин. VRAM           | 4 ГБ          | 8 ГБ       | 8 ГБ       | 2 ГБ       | 6 ГБ  |
| Лицензия            | Apache 2.0    | Apache 2.0 | Apache 2.0 | Apache 2.0 | AGPL  |

## Советы для пользователей Clore.ai

* **0,6B на RTX 3060**: Лучший бюджетный вариант за $0,03–0,07/ч — достаточно хорошо для большинства задач TTS
* **Пакетная обработка**: Генерируйте все аудиоклипы за один сеанс, чтобы максимально использовать время аренды
* **Кэшируйте эталонный звук**: Храните эталонные записи голоса на постоянном хранилище
* **Потоковая передача для работы в реальном времени**: Используйте потоковый API для чат-ботов/ассистентов
* **Дообучайте для пользовательских голосов**: Арендуйте RTX 4090 на несколько часов, чтобы дообучить базовую модель на данных вашего голоса

## Устранение неполадок

| Проблема                               | Решение                                                                      |
| -------------------------------------- | ---------------------------------------------------------------------------- |
| Не хватает памяти на 1,7B              | Переключитесь на 0,6B или используйте `torch_dtype=torch.float16`            |
| Клонированный голос звучит неправильно | Используйте 5–10 секунд чистого аудио (без фонового шума)                    |
| Неверный язык вывода                   | Явно передайте `language` параметр                                           |
| Медленная первая генерация             | Нормально — модель загружается при первом вызове. Последующие вызовы быстрые |

## Дополнительное чтение

* [Модели HuggingFace](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Instruct)
* [Документация Qwen3-TTS](https://qwen.readthedocs.io/)
* [Руководство по клонированию голоса](https://medium.com/@zh.milo/qwen3-tts-the-complete-2026-guide)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/qwen3-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
