> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/sravneniya/tts-comparison.md).

# Сравнение TTS-движков

Сравните ведущие open-source движки text-to-speech для развертывания на GPU-серверах Clore.ai.

{% hint style="info" %}
**Преобразование текста в речь (TTS)** преобразует написанный текст в естественно звучащее аудио. В этом руководстве сравниваются пять ведущих open-source движков TTS: XTTS v2, Bark, Kokoro, Fish Speech и MeloTTS — по качеству, скорости, поддержке языков и возможностям клонирования голоса.
{% endhint %}

***

## Быстрая матрица выбора

|                         | XTTS v2               | Bark                        | Kokoro           | Fish Speech   | MeloTTS           |
| ----------------------- | --------------------- | --------------------------- | ---------------- | ------------- | ----------------- |
| **Разработчик**         | Coqui AI              | Suno AI                     | Hexgrad          | Fish Audio    | MyShell AI        |
| **Качество**            | ⭐⭐⭐⭐⭐                 | ⭐⭐⭐⭐                        | ⭐⭐⭐⭐             | ⭐⭐⭐⭐⭐         | ⭐⭐⭐               |
| **Скорость**            | Средне                | Медленно                    | **Быстро**       | **Быстро**    | **Самый быстрый** |
| **Клонирование голоса** | ✅ (клип 3 с)          | ✅ (готовые пресеты голосов) | ✅ (ограниченно)  | ✅ (клип 10 с) | ❌                 |
| **Языки**               | 17                    | 10+                         | Английский       | 8+            | 8                 |
| **Мин. VRAM**           | 4 ГБ                  | 8 ГБ                        | **CPU подходит** | 4 ГБ          | **CPU подходит**  |
| **Лицензия**            | CPML (некоммерческая) | MIT                         | Apache 2.0       | CC BY-NC-SA   | MIT               |
| **Звёзды на GitHub**    | 35 тыс.+ (Coqui TTS)  | 38 тыс.+                    | 12 тыс.+         | 14 тыс.+      | 15 тыс.+          |

***

## Обзор

### XTTS v2

XTTS v2 от Coqui — золотой стандарт open-source TTS для клонирования голоса. Он может клонировать любой голос по 3-секундному аудиоклипу с исключительной точностью.

**Философия**: Максимальная выразительность и качество клонирования голоса.

```python
from TTS.api import TTS

tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to("cuda")

# Zero-shot клонирование голоса по 3-секундному эталону
tts.tts_to_file(
    text="Привет, это клонированный голос, который звучит естественно.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output.wav"
)
```

### Bark

Bark от Suno — это TTS-модель на основе трансформера, которая генерирует чрезвычайно выразительную речь, включая неречевые звуки: смех, вздохи, музыку и звуковые эффекты.

**Философия**: Не просто речь — полноценная генерация аудио.

```python
from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav

preload_models()

audio_array = generate_audio(
    "[смех] Привет! [прочищает горло] Это Bark TTS. [вздох]"
)
write_wav("output.wav", SAMPLE_RATE, audio_array)
```

### Kokoro

Kokoro — это легкая и быстрая TTS-модель, оптимизированная для английского языка. Несмотря на небольшой размер (\~82 млн параметров), она обеспечивает удивительно высокое качество.

**Философия**: Маленькая модель, большое качество, работает где угодно.

```python
from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code='a')  # 'a' = американский английский

generator = pipeline(
    "Быстрая бурая лисица перепрыгивает через ленивую собаку.",
    voice='af_heart',  # предустановленный голос
    speed=1.0,
)

for _, _, audio in generator:
    sf.write('output.wav', audio, 24000)
```

### Fish Speech

Fish Speech от Fish Audio — это TTS уровня production с исключительным клонированием голоса по коротким клипам. Он использует новую архитектуру codec + language model.

**Философия**: Качество production, быстрый инференс, отличное клонирование.

```python
# Fish Speech через HTTP API
import requests

response = requests.post(
    "http://localhost:8080/v1/tts",
    json={
        "text": "Привет, это Fish Speech генерирует аудио.",
        "reference_id": "your-voice-id",
        "format": "wav",
    }
)

with open("output.wav", "wb") as f:
    f.write(response.content)
```

### MeloTTS

MeloTTS от MyShell — это ультрабыстрая многоакцентная TTS, оптимизированная для приложений реального времени. Она эффективно работает на CPU и поддерживает несколько английских акцентов и азиатские языки.

**Философия**: Скорость реального времени на любом масштабе.

```python
from melo.api import TTS

speed = 1.0
device = 'auto'

model = TTS(language='EN', device=device)
speaker_ids = model.hps.data.spk2id

output_path = 'output.wav'
model.tts_to_file(
    "Привет, мир! MeloTTS очень быстрая.",
    speaker_ids['EN-Default'],
    output_path,
    speed=speed
)
```

***

## Сравнение качества

### Оценки естественности (MOS — средняя оценка мнения, 1-5)

{% hint style="info" %}
Оценки MOS являются приблизительными значениями, основанными на опубликованных статьях и оценках сообщества. Реальное качество сильно зависит от содержания текста и конфигурации голоса.
{% endhint %}

| Модель      | Английский MOS | Многоязычный MOS       | Выразительность   |
| ----------- | -------------- | ---------------------- | ----------------- |
| XTTS v2     | 4.3            | 4.1                    | ⭐⭐⭐⭐⭐             |
| Bark        | 3.9            | 3.7                    | ⭐⭐⭐⭐⭐ (уникально) |
| Kokoro      | 4.2            | Недоступно (только EN) | ⭐⭐⭐               |
| Fish Speech | 4.4            | 4.2                    | ⭐⭐⭐⭐              |
| MeloTTS     | 3.8            | 3.6                    | ⭐⭐                |

### В чем каждая модель лучшая

| Модель      | Выдающаяся особенность качества                               |
| ----------- | ------------------------------------------------------------- |
| XTTS v2     | Почти идеальное клонирование голоса, эмоциональный диапазон   |
| Bark        | Неречевые звуки, смех, музыка, эффекты                        |
| Kokoro      | Лучшее соотношение качества и размера, естественная интонация |
| Fish Speech | Лучшая общая естественность + точность клонирования           |
| MeloTTS     | Стабильный, чистый вывод для длинных текстов                  |

***

## Бенчмарки скорости

### Символов в секунду (CPU против GPU)

Тест: "Быстрая бурая лисица перепрыгивает через ленивую собаку. Как вы сегодня?" (60 символов)

| Модель      | Скорость на CPU   | Скорость на GPU (RTX 3080) | Коэффициент реального времени |
| ----------- | ----------------- | -------------------------- | ----------------------------- |
| XTTS v2     | \~15 симв./с      | \~150 симв./с              | 0.3× (GPU)                    |
| Bark        | \~5 симв./с       | \~40 симв./с               | 0.1× (GPU)                    |
| Kokoro      | \~200 симв./с     | \~800 симв./с              | **5× (GPU)**                  |
| Fish Speech | \~80 симв./с      | \~500 симв./с              | **3× (GPU)**                  |
| MeloTTS     | **\~500 симв./с** | \~2000 симв./с             | **12× (GPU)**                 |

*Коэффициент real-time > 1.0 означает скорость выше скорости воспроизведения*

### Время генерации 1 минуты аудио

| Модель      | CPU       | RTX 3080  | A100     |
| ----------- | --------- | --------- | -------- |
| XTTS v2     | \~8 мин   | \~30с     | \~10 с   |
| Bark        | ≈20 мин   | \~3 мин   | \~45с    |
| Kokoro      | \~20с     | \~5 с     | \~2 с    |
| Fish Speech | \~45с     | \~8 с     | \~3 с    |
| MeloTTS     | **\~8 с** | **\~2 с** | **<1 с** |

{% hint style="success" %}
**Для приложений реального времени**: MeloTTS и Kokoro — явные победители. Оба могут генерировать речь быстрее скорости воспроизведения даже на CPU.
{% endhint %}

***

## Поддержка языков

### Поддерживаемые языки

| Модель      | Языки | Примечательно                                                      |
| ----------- | ----- | ------------------------------------------------------------------ |
| XTTS v2     | 17    | EN, ES, FR, DE, IT, PT, PL, TR, RU, NL, CS, AR, ZH, JA, HU, KO, HI |
| Bark        | 10+   | EN, ZH, FR, DE, HI, IT, JA, KO, PL, PT, RU, ES, TR                 |
| Kokoro      | 2     | Английский (США/Великобритания), японский (ограниченно)            |
| Fish Speech | 8     | EN, ZH, JA, KO, FR, DE, AR, ES                                     |
| MeloTTS     | 8     | EN (4 акцента), ES, FR, ZH, JA, KO                                 |

### Примечания по качеству языков

| Модель      | Английский | Китайский       | Японский     | Европейские |
| ----------- | ---------- | --------------- | ------------ | ----------- |
| XTTS v2     | Отлично    | Хорошо          | Хорошо       | Отлично     |
| Bark        | Хорошо     | Средне          | Средне       | Хорошо      |
| Kokoro      | Отлично    | ❌               | Ограниченная | ❌           |
| Fish Speech | Отлично    | **Лучше всего** | Хорошо       | Хорошо      |
| MeloTTS     | Хорошо     | Хорошо          | Хорошо       | Хорошо      |

{% hint style="info" %}
**Для китайского TTS**: Fish Speech и MeloTTS — лучшие open-source варианты. Оба естественно обрабатывают тоны и иероглифы.

**Для многоязычных приложений**: XTTS v2 поддерживает больше всего языков с одинаково высоким качеством на каждом из них.
{% endhint %}

***

## Сравнение клонирования голоса

### Возможности клонирования

| Модель      | Длина эталона          | Качество клонирования | Zero-shot |
| ----------- | ---------------------- | --------------------- | --------- |
| XTTS v2     | **3 секунды**          | ⭐⭐⭐⭐⭐                 | ✅         |
| Bark        | Только пресеты голосов | ⭐⭐⭐                   | Частично  |
| Kokoro      | Не поддерживается      | ❌                     | ❌         |
| Fish Speech | 10 секунд              | ⭐⭐⭐⭐⭐                 | ✅         |
| MeloTTS     | Не поддерживается      | ❌                     | ❌         |

### Клонирование голоса XTTS v2

```python
from TTS.api import TTS
import torch

# Загрузить модель
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2")
tts.to("cuda" if torch.cuda.is_available() else "cpu")

# Клонируйте голос по эталону (минимум 3 секунды, идеально 10–30 секунд)
tts.tts_to_file(
    text="""
    Добро пожаловать в наш подкаст. Сегодня мы обсуждаем будущее ИИ 
    и его влияние на общество. Я ваш ведущий, и я рад 
    поделиться с вами несколькими увлекательными идеями.
    """,
    speaker_wav="speaker_sample.wav",  # Ваш эталонный аудиофайл
    language="en",
    file_path="cloned_voice_output.wav"
)
```

### Клонирование голоса Fish Speech

```bash
# Клонирование по эталонному аудио
fish_speech_cli tts \
  --text "Это мой клонированный голос произносит новое предложение." \
  --reference-audio speaker_sample.wav \
  --reference-text "Исходный текст, произнесенный в эталонном аудио." \
  --output cloned_output.wav
```

### Пресеты голосов Bark

```python
from bark import generate_audio, SAMPLE_RATE
from scipy.io.wavfile import write

# Bark использует заранее определенные коды дикторов
voice_presets = {
    "male_US": "v2/en_speaker_6",
    "female_US": "v2/en_speaker_9",
    "male_UK": "v2/en_speaker_0",
    "announcer": "v2/en_speaker_2",
}

audio = generate_audio(
    "Добро пожаловать! [смех] Это совершенно удивительная технология.",
    history_prompt=voice_presets["female_US"]
)
write("bark_output.wav", SAMPLE_RATE, audio)
```

***

## XTTS v2: Подробный разбор

### Архитектура

* **VITS + GPT** гибридная архитектура
* Обучена на более чем 16 тыс. часов на 17 языках
* Минимум 3 секунды для zero-shot-клонирования

### Установка на Clore.ai

```bash
pip install TTS
# Версия для GPU
pip install TTS[all]
```

### Развертывание в Docker

```dockerfile
FROM nvidia/cuda:12.8.1-cudnn-runtime-ubuntu22.04

RUN apt-get update && apt-get install -y python3 python3-pip git ffmpeg
RUN pip3 install TTS fastapi uvicorn

WORKDIR /app
COPY server.py .

EXPOSE 5002
CMD ["uvicorn", "server:app", "--host", "0.0.0.0", "--port", "5002"]
```

```python
# server.py — REST API XTTS v2
from fastapi import FastAPI, UploadFile, Form
from fastapi.responses import FileResponse
from TTS.api import TTS
import tempfile, os

app = FastAPI()
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to("cuda")

@app.post("/tts")
async def synthesize(
    text: str = Form(...),
    language: str = Form("en"),
    speaker_file: UploadFile = None
):
    with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as out:
        output_path = out.name

    speaker_path = None
    if speaker_file:
        with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as ref:
            ref.write(await speaker_file.read())
            speaker_path = ref.name

    tts.tts_to_file(
        text=text,
        speaker_wav=speaker_path,
        language=language,
        file_path=output_path
    )
    return FileResponse(output_path, media_type="audio/wav")
```

```bash
docker build -t xtts-server .
docker run -d --gpus all -p 5002:5002 xtts-server
```

**Недостатки**: лицензия CPML (некоммерческое использование без разрешения), медленнее, чем Kokoro/MeloTTS

***

## Bark: Подробный разбор

### Архитектура

* **трансформер в стиле GPT** для генерации аудиотокенов
* Трехэтапный процесс: текст → семантические → грубые → точные токены
* Генерирует реальные токены аудиокодека (EnCodec)

### Что делает Bark уникальным

Bark — единственный open-source TTS, который нативно генерирует:

* 🎵 Фоновую музыку внутри речи
* 😂 Смех, вздохи, прочищение горла
* 🎭 Несколько говорящих в одной генерации
* 🌍 Смешанные языковые высказывания

### Язык разметки

```python
from bark import generate_audio, SAMPLE_RATE
from scipy.io.wavfile import write

# Специальные токены для выразительности
text = """
[прочищает горло] Доброе утро всем. [смех] 
Сегодняшняя презентация будет посвящена... 
[глубоко вздыхает] ...на самом деле весьма многому.
[music: бодрый джаз] Давайте начнем!
"""

audio = generate_audio(text, history_prompt="v2/en_speaker_6")
write("output.wav", SAMPLE_RATE, audio)
```

### Установка

```bash
pip install git+https://github.com/suno-ai/bark.git
```

**Недостатки**: медленно (3-этапный конвейер), нестабильно между запусками, нет настоящего клонирования голоса

***

## Kokoro: Подробный разбор

### Архитектура

* **82 млн параметров** Модель на основе StyleTTS2
* Чрезвычайно маленькая, но удивительно высокого качества
* Быстрый инференс на CPU и GPU

### Доступные голоса

```python
from kokoro import KPipeline

pipeline = KPipeline(lang_code='a')  # 'a' = американский английский, 'b' = британский

# Доступные голоса
voices = {
    'af_heart': 'американский женский (warm)',
    'af_bella': 'американский женский (bella)',
    'af_nicole': 'американский женский (nicole)',
    'am_michael': 'американский мужской (michael)',
    'am_fenrir': 'американский мужской (fenrir)',
    'bf_emma': 'британский женский (emma)',
    'bm_george': 'британский мужской (george)',
}

# Генерация с разными голосами
for voice_name, description in voices.items():
    gen = pipeline("Привет, это тест.", voice=voice_name)
    for _, _, audio in gen:
        print(f"Сгенерировано с помощью {description}")
```

### Поддержка потоковой передачи

```python
import sounddevice as sd
from kokoro import KPipeline

pipeline = KPipeline(lang_code='a')

# Потоковая передача аудио в реальном времени по мере генерации
text = "Это очень длинный текст, который будет передаваться по мере генерации, обеспечивая низкую задержку аудиовывода."

for _, _, audio in pipeline(text, voice='af_heart'):
    sd.play(audio, samplerate=24000)
    sd.wait()
```

**Недостатки**: в основном только английский, нет клонирования голоса, ограниченная выразительность

***

## Fish Speech: Подробный разбор

### Архитектура

* **VQGAN + языковая модель** архитектура
* Обучена на более чем 700 тыс. часов аудио
* Сильная многоязычность с поддержкой азиатских языков

### Установка

```bash
pip install fish-speech

# Или через Docker
docker run -d \
  --gpus all \
  -p 8080:8080 \
  fishaudio/fish-speech:latest \
  +api_server.workers_count=1
```

### Python API

```python
import httpx
import base64

# Через HTTP API
with httpx.Client() as client:
    response = client.post(
        "http://localhost:8080/v1/tts",
        json={
            "text": "Привет от Fish Speech! Это звучит очень естественно.",
            "format": "wav",
            "mp3_bitrate": 128,
            "normalize": True,
        }
    )
    
    with open("fish_output.wav", "wb") as f:
        f.write(response.content)
```

### Клонирование голоса

```python
# Загрузите эталон, получите обратно ID голоса
with open("my_voice.wav", "rb") as f:
    response = httpx.post(
        "http://localhost:8080/v1/voices",
        files={"file": f},
        data={"text": "Текст, произнесенный в этой записи."}
    )
    voice_id = response.json()["id"]

# Использовать клонированный голос
response = httpx.post(
    "http://localhost:8080/v1/tts",
    json={
        "text": "Теперь говорю клонированным голосом.",
        "reference_id": voice_id,
    }
)
```

**Недостатки**: лицензия CC BY-NC-SA (некоммерческая), для лучшего качества требуется больше VRAM

***

## MeloTTS: Подробный разбор

### Архитектура

* **На базе VITS2** архитектура
* Обучение на английском с несколькими акцентами
* Чрезвычайно оптимизирована для скорости вывода

### Акценты и языки

```python
from melo.api import TTS

# Поддерживаемые коды языков и акценты
configs = {
    'EN':    ['EN-Default', 'EN-US', 'EN-BR', 'EN-INDIA', 'EN-AU'],
    'ES':    ['ES'],
    'FR':    ['FR'],
    'ZH':    ['ZH'],
    'JP':    ['JP'],
    'KR':    ['KR'],
}

model = TTS(language='EN', device='cuda')
speaker_ids = model.hps.data.spk2id

# Генерация с британским акцентом
model.tts_to_file(
    "Чирс! Не хотите ли чашечку чая?",
    speaker_ids['EN-BR'],
    'british.wav'
)

# Генерация с индийским акцентом
model.tts_to_file(
    "Намасте! Добро пожаловать в нашу компанию.",
    speaker_ids['EN-INDIA'],
    'indian.wav'
)
```

### Пакетная обработка (очень быстро)

```python
from melo.api import TTS
import time

model = TTS(language='EN', device='cuda')
sid = model.hps.data.spk2id['EN-Default']

texts = [
    "Первое предложение для синтеза.",
    "Второе предложение здесь."
    "Третье и последнее предложение.",
]

start = time.time()
for i, text in enumerate(texts):
    model.tts_to_file(text, sid, f'output_{i}.wav')
elapsed = time.time() - start
print(f"Сгенерировано {len(texts)} файлов за {elapsed:.2f}с")
```

**Недостатки**: Без клонирования голоса, роботизированно на высокой скорости, ограниченная выразительность

***

## Развертывание на Clore.ai

### Универсальный TTS-сервер

```yaml
# docker-compose.yml — сервис TTS с несколькими бэкендами
version: "3.8"

services:
  xtts:
    build:
      context: ./xtts
    ports:
      - "5002:5002"
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    volumes:
      - ./voices:/app/voices

  kokoro:
    image: ghcr.io/remsky/kokoro-fastapi-cpu:latest
    ports:
      - "8880:8880"
    # GPU не нужен!

  fish-speech:
    image: fishaudio/fish-speech:latest
    ports:
      - "8080:8080"
    command: +api_server.workers_count=2
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
```

### Сводка по требованиям к VRAM

| Модель      | CPU               | 4 ГБ GPU | 8 ГБ GPU | 16 ГБ GPU |
| ----------- | ----------------- | -------- | -------- | --------- |
| XTTS v2     | Медленно          | ✅        | ✅        | ✅         |
| Bark        | Очень медленно    | ❌        | ✅        | ✅         |
| Kokoro      | **Быстро**        | ✅        | ✅        | ✅         |
| Fish Speech | Средне            | ✅        | ✅        | ✅         |
| MeloTTS     | **Очень быстрый** | ✅        | ✅        | ✅         |

***

## Примеры интеграции

### API, совместимый с OpenAI (для прямой замены)

```python
# Многие TTS-серверы предлагают конечные точки, совместимые с OpenAI
# Используйте Kokoro FastAPI или аналогичный

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8880/v1",  # Ваш TTS-сервер
    api_key="not-needed"
)

response = client.audio.speech.create(
    model="kokoro",
    voice="af_heart",
    input="Привет, мир! Это использует формат API OpenAI TTS.",
)
response.stream_to_file("output.mp3")
```

### Интеграция с LangChain

```python
# Использование TTS с LangChain для голосовых агентов
from langchain_community.tools import Tool
from TTS.api import TTS

tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to("cuda")

def speak(text: str) -> str:
    tts.tts_to_file(text=text, language="en", file_path="/tmp/response.wav")
    return "/tmp/response.wav"

tts_tool = Tool(
    name="text_to_speech",
    func=speak,
    description="Преобразовать текст в аудиофайл речи"
)
```

***

## Когда что использовать

### Руководство по выбору

```
Нужно клонирование голоса по короткому фрагменту?
  → XTTS v2 (3 с эталона) или Fish Speech (10 с эталона)

Нужно генерация в реальном времени / максимально быстро?
  → MeloTTS (дружелюбен к CPU) или Kokoro

Нужна выразительная речь (смех, эмоции)?
  → Bark (уникальные не-речевые звуки) или XTTS v2

Нужен китайский/японский/корейский?
  → Fish Speech (лучший для CJK) или MeloTTS

Только английский, максимальное качество?
  → Kokoro (лучшее соотношение размера и качества)

Нужно 17+ языков?
  → XTTS v2

Разрешено коммерческое использование?
  → Kokoro (Apache) или MeloTTS (MIT) или Bark (MIT)

Некоммерческое исследование?
  → Любой (XTTS v2 CPML или Fish Speech CC BY-NC-SA)
```

### По типу применения

| Приложение                    | Лучший выбор            | Почему                              |
| ----------------------------- | ----------------------- | ----------------------------------- |
| Генерация аудиокниг           | XTTS v2                 | Естественный, стабильный голос      |
| Чат-бот в реальном времени    | MeloTTS или Kokoro      | Самая быстрая инференция            |
| Автоматизация подкастов       | XTTS v2 или Fish Speech | Лучшее клонирование                 |
| Игровые персонажи             | Bark                    | Выразительные, разнообразные голоса |
| Обслуживание клиентов         | MeloTTS                 | Масштабируемо, быстро               |
| Инструменты доступности       | Kokoro                  | Лёгкий, бесплатный                  |
| Дубляж голоса                 | Fish Speech             | Лучшее качество клонирования        |
| Длинноформатное повествование | XTTS v2                 | Стабильное качество                 |

***

## Сводка по лицензиям

{% hint style="warning" %}
**Лицензия важна для коммерческого использования!** Всегда проверяйте перед развёртыванием в production.
{% endhint %}

| Модель      | Лицензия                   | Коммерческое? | Примечания                                         |
| ----------- | -------------------------- | ------------- | -------------------------------------------------- |
| XTTS v2     | Coqui Public Model License | ❌ Бесплатно   | Требуется лицензия для коммерческого использования |
| Bark        | MIT                        | ✅             | Бесплатно для любого использования                 |
| Kokoro      | Apache 2.0                 | ✅             | Бесплатно для любого использования                 |
| Fish Speech | CC BY-NC-SA 4.0            | ❌             | Только некоммерческое использование                |
| MeloTTS     | MIT                        | ✅             | Бесплатно для любого использования                 |

**Полностью открыто для коммерческого использования**: Bark, Kokoro, MeloTTS

***

## Стоимость на Clore.ai

```
Kokoro/MeloTTS (CPU или дешёвый GPU):
  Самый дешёвый сервер от ~$0.05/час → ~$36/месяц
  Может обрабатывать 100+ одновременных запросов на CPU

XTTS v2 (RTX 3080):
  ~$0.30/час → ~$220/месяц
  ≈500 запросов/час

Fish Speech (RTX 4090):
  ~$0.60/час → ~$440/месяц  
  ≈1000 запросов/час
```

***

## Полезные ссылки

* [Coqui TTS (XTTS)](https://github.com/coqui-ai/TTS) — 35K+ звёзд
* [Bark GitHub](https://github.com/suno-ai/bark) — 38K+ звёзд
* [Kokoro GitHub](https://github.com/hexgrad/kokoro) — 12K+ звёзд
* [Fish Speech GitHub](https://github.com/fishaudio/fish-speech) — 14K+ звёзд
* [MeloTTS GitHub](https://github.com/myshell-ai/MeloTTS) — 15K+ звёзд
* [Таблица лидеров TTS Arena](https://huggingface.co/spaces/TTS-AGI/TTS-Arena)

***

## Итог

| Модель          | Использовать, когда                                                                 |
| --------------- | ----------------------------------------------------------------------------------- |
| **XTTS v2**     | Лучшее клонирование голоса (3 с эталона), 17 языков, некоммерческое                 |
| **Bark**        | Выразительный, смех/эффекты, лицензия MIT                                           |
| **Kokoro**      | Быстрый, высококачественный английский, лицензия Apache                             |
| **Fish Speech** | Лучший для CJK, клонирование для production, некоммерческое                         |
| **MeloTTS**     | Самый быстрый, в реальном времени, английский с несколькими акцентами, лицензия MIT |

Для большинства production-развёртываний на Clore.ai:

* **Голосовые приложения в реальном времени** → MeloTTS или Kokoro (бесплатно, быстро, MIT)
* **Сервис клонирования голоса** → XTTS v2 или Fish Speech (проверьте лицензию)
* **Выразительное повествование** → Bark или XTTS v2

***

## Рекомендации по GPU для Clore.ai

| Сценарий использования  | Рекомендуемый GPU | Оценочная стоимость на Clore.ai             |
| ----------------------- | ----------------- | ------------------------------------------- |
| Разработка/тестирование | RTX 3090 (24 ГБ)  | $0.07–0.21/гпу/ч                            |
| Продакшен               | RTX 4090 (24 ГБ)  | $0.14–0.42/гпу/ч                            |
| Масштабирование         | A100 80 ГБ        | [голое железо](https://clore.ai/bare-metal) |

> 💡 Все примеры в этом руководстве можно развернуть на [Clore.ai](https://clore.ai/marketplace) GPU-серверах. Просматривайте доступные GPU и арендуйте по часам — без обязательств, с полным root-доступом.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/sravneniya/tts-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
