> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/dia-tts.md).

# Dia TTS (Nari Labs)

Dia от Nari Labs — это продвинутая модель преобразования текста в речь, которая специализируется на **реалистичном диалоге нескольких говорящих**. В отличие от традиционных TTS, которые обрабатывают одного говорящего за раз, Dia генерирует естественные разговоры между несколькими участниками с эмоциями, смехом, заминками и другими невербальными сигналами. При 1,6 млрд параметров она работает на любом GPU с 8 ГБ+.

## Ключевые особенности

* **Диалог нескольких говорящих**: Генерируйте разговоры между 2+ говорящими за один проход
* **Невербальные сигналы**: Смех `(смеётся)`, заминки `(вздыхает)`, паузы — автоматически встроены
* **Эмоциональная речь**: Естественная интонация без явных тегов эмоций
* **1,6 млрд параметров**: Помещается на RTX 3070/3080 (8–10 ГБ VRAM)
* **лицензии Apache 2.0**: Полностью для коммерческого использования
* **Интеграция с HuggingFace**: Работает с библиотекой Transformers

## Требования

| Компонент | Минимум         | Рекомендуется   |
| --------- | --------------- | --------------- |
| GPU       | RTX 3070 (8 ГБ) | RTX 3080 (10GB) |
| VRAM      | 8 ГБ            | 10 ГБ+          |
| ОЗУ       | 16GB            | 32GB            |
| Диск      | 10 ГБ           | 15 ГБ           |
| Python    | 3.9+            | 3.11            |

**Рекомендуемая GPU от Clore.ai**: RTX 3080 10 ГБ ($0,05–0,19/ч)

## Установка

```bash
# Вариант 1: pip install
pip install dia-tts

# Вариант 2: из исходников
git clone https://github.com/nari-labs/dia.git
cd dia
pip install -e .
```

## Быстрый старт

### Базовый диалог нескольких говорящих

```python
from dia import Dia

# Загрузить модель
model = Dia.from_pretrained("nari-labs/Dia-1.6B")

# Сгенерировать разговор нескольких говорящих
# [S1] = Говорящий 1, [S2] = Говорящий 2
text = """[S1] Эй, ты пробовал новую платформу аренды GPU?
[S2] Ты про Clore? Да, вчера я арендовал RTX 4090.
[S1] И как оно?
[S2] (смеётся) Честно? Гораздо дешевле, чем я ожидал. Примерно два доллара в день.
[S1] Да ладно. Это... это на самом деле безумие."""

audio = model.generate(text)

# Сохранить в файл
import soundfile as sf
sf.write("dialog.wav", audio, samplerate=24000)
```

### С эмоциями и невербальными сигналами

```python
# Dia автоматически обрабатывает естественные речевые паттерны
text = """[S1] Я только что получил результаты...
[S2] И? Не томи!
[S1] (вздыхает) Мы прошли. Мы действительно прошли все тесты.
[S2] (смеётся) Я же говорил! Я же говорил, что у нас получится!
[S1] Не могу поверить... (смеётся) ладно, ладно, давай праздновать."""

audio = model.generate(text, temperature=0.8)
sf.write("emotional_dialog.wav", audio, samplerate=24000)
```

### Один говорящий

```python
# Подходит и для одного говорящего
text = "[S1] Добро пожаловать в документацию Clore AI. В этом руководстве мы рассмотрим, как настроить первую аренду GPU и развернуть модель машинного обучения."

audio = model.generate(text)
sf.write("narration.wav", audio, samplerate=24000)
```

## Gradio Web UI

```python
# Запустить интерактивную демонстрацию
python -m dia.app --port 7860 --share

# Или вручную:
import gradio as gr
from dia import Dia

model = Dia.from_pretrained("nari-labs/Dia-1.6B")

def generate_speech(text):
    audio = model.generate(text)
    return (24000, audio)

demo = gr.Interface(
    fn=generate_speech,
    inputs=gr.Textbox(label="Диалог (используйте теги [S1], [S2])", lines=10),
    outputs=gr.Audio(label="Сгенерированная речь"),
    title="Dia TTS — Диалог нескольких говорящих"
)
demo.launch(server_port=7860)
```

## Сценарии использования

* **Генерация подкастов**: Создавайте разговорные подкасты по сценариям
* **Диалоги для аудиокниг**: Генерируйте разговоры персонажей с разными голосами
* **Диалоги для игр**: Разговоры NPC с естественными речевыми паттернами
* **Данные для обучения**: Генерируйте разнообразные наборы речевых данных для обучения ASR
* **Голоса чат-ботов**: Многотуровые диалоги с эмоциональными ответами

## Советы для пользователей Clore.ai

* **RTX 3080 — идеальный вариант**: 10 ГБ VRAM легко хватает для Dia по цене $0,05–0,19/ч
* **Пакетная генерация**: Обрабатывайте несколько диалогов в цикле, чтобы максимально использовать время аренды
* **Сохраняйте модели в постоянное хранилище**: Если у вашего экземпляра Clore есть постоянный диск, кэшируйте модель, чтобы не загружать её повторно
* **Температура 0,7–0,9**: Ниже = более последовательно, выше = более выразительно/разнообразно
* **Только английский**: Сейчас Dia ориентирована на английский — для многоязычности см. руководство по Qwen3-TTS

## Устранение неполадок

| Проблема                          | Решение                                                                                       |
| --------------------------------- | --------------------------------------------------------------------------------------------- |
| CUDA out of memory                | Используйте `model.to("cuda", torch_dtype=torch.float16)` для половинной точности             |
| Голоса звучат похоже              | Добавьте больше текста/контекста для каждого говорящего; попробуйте более высокую температуру |
| Невербальные сигналы игнорируются | Убедитесь, что формат правильный: `(смеётся)`, `(вздыхает)` в скобках                         |
| Низкое качество аудио             | Увеличьте `num_steps` параметр, если доступен; убедитесь, что частота дискретизации 24 кГц    |

## Дополнительное чтение

* [GitHub Nari Labs](https://github.com/nari-labs/dia)
* [Модель на HuggingFace](https://huggingface.co/nari-labs/Dia-1.6B)
* [Сравнение: Dia против ElevenLabs](https://nari-labs.github.io/dia/) — официальная страница демо


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/dia-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
