> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/moss-tts.md).

# MOSS-TTS (только CPU, 100M)

MOSS-TTS — это семейство с открытым исходным кодом для генерации речи от **OpenMOSS** (Инновационный институт Шанхая, в сотрудничестве с **Fudan NLP** и **MOSI.AI**, под руководством проф. Сипэна Цю). Флагманская **MOSS-TTS-Nano** всего лишь **100 млн параметров**, работает в реальном времени на **4-ядерном CPU без GPU**, выдает **стерео 48 кГц**, и поддерживает **20 языков** с нулевым клонированием голоса. Вся линейка масштабируется до 8B для диалогов с несколькими дикторами, дизайна голоса и генерации звуковых эффектов.

{% hint style="info" %}
**Выпущено:** 10 апреля 2026 (Nano) · сборка ONNX для CPU 17 апреля 2026 · **Лицензия:** Apache 2.0
{% endhint %}

Если Kokoro занимает нишу западно-английских моделей с 82 млн параметров, то MOSS-TTS-Nano занимает **многоязычную нишу с приоритетом CPU** нишу: та же философия миниатюрной модели, но стерео 48 кГц, 20 языков, клонирование голоса и путь ONNX/GGUF без PyTorch. Для тех, кто хочет выпустить TTS без оплаты GPU — это та самая модель.

### Семейство MOSS-TTS

| Модель                         | Размер          | VRAM               | Лучше всего для                                      |
| ------------------------------ | --------------- | ------------------ | ---------------------------------------------------- |
| **MOSS-TTS-Nano-100M**         | 100M            | 0 ГБ (CPU, 4 ядра) | Реальное время, edge, IVR, на устройстве             |
| **MOSS-TTS-Nano-100M-ONNX**    | 100M            | 0 ГБ (CPU)         | Продакшн-обслуживание без PyTorch                    |
| **MOSS-TTS-GGUF**              | 100M (Q4\_K\_M) | 0 ГБ (CPU)         | развертывание в стиле llama.cpp                      |
| **MOSS-TTS-Local-Transformer** | 1.7B            | 4 ГБ               | Легковесный GPU, высокое объективное качество        |
| **MOSS-TTS-Realtime**          | 1.7B            | 4 ГБ               | Голосовые агенты с несколькими раундами, 180 мс TTFB |
| **MOSS-VoiceGenerator**        | 1.7B            | 4 ГБ               | Дизайн голоса по текстовым подсказкам                |
| **MOSS-TTSD-v1.0**             | 8B              | 8 ГБ               | Диалоги с несколькими дикторами, длинные подкасты    |
| **MOSS-SoundEffect**           | 8B              | 8 ГБ               | Генерация звуковых эффектов с контролем длительности |

### Ключевые характеристики

| Характеристики            | Значение                                                                                                                        |
| ------------------------- | ------------------------------------------------------------------------------------------------------------------------------- |
| **Разработчик**           | Команда OpenMOSS · MOSI.AI · лаборатория Fudan NLP                                                                              |
| **Архитектура**           | Автогрессивная (аудиотокенизатор + LLM)                                                                                         |
| **Частота дискретизации** | 48 кГц, стерео                                                                                                                  |
| **Языки**                 | 20 (zh, en, de, es, fr, ja, it, hu, ko, ru, fa, ar, pl, pt, cs, da, sv, el, tr, +1)                                             |
| **Клонирование голоса**   | Zero-shot по \~3-секундному референсу                                                                                           |
| **Потоковая передача**    | Да — пофрагментное декодирование на CPU                                                                                         |
| **Лицензия**              | Apache 2.0                                                                                                                      |
| **HuggingFace**           | [OpenMOSS-Team](https://huggingface.co/OpenMOSS-Team)                                                                           |
| **GitHub**                | [OpenMOSS/MOSS-TTS-Nano](https://github.com/OpenMOSS/MOSS-TTS-Nano) · [OpenMOSS/MOSS-TTS](https://github.com/OpenMOSS/MOSS-TTS) |

### Почему MOSS-TTS?

* **Развертывание без GPU** — Nano работает на 4 ядрах CPU, без CUDA и без Triton
* **Вывод стерео 48 кГц** — вещательного качества, редкость для моделей менее 100M
* **20 языков** — большее покрытие, чем у Kokoro (\~5), при сопоставимом размере
* **Клонирование голоса без обучения** по референсному аудио длиной \~3 с
* **Пути ONNX/GGUF без PyTorch** — поставляется с бинарником размером 200 МБ
* **Линейка масштабируется** — один и тот же токенизатор/API от Nano до 8B TTSD
* **Apache 2.0** — коммерческое использование без ограничений
* **Основано на серьезных исследованиях** — Fudan NLP + MOSI.AI, а не любительский проект

## Требования

| Компонент | Минимум (Nano, CPU)      | Рекомендуется (Nano, CPU) | Полная линейка (GPU)     |
| --------- | ------------------------ | ------------------------- | ------------------------ |
| CPU       | 4 ядра (x86\_64 / ARM64) | 8 ядер                    | 8 ядер                   |
| ОЗУ       | 4 ГБ                     | 8 ГБ                      | 16 ГБ                    |
| GPU       | — (не требуется)         | — (опционально)           | RTX 3060 12 ГБ+          |
| VRAM      | 0 ГБ                     | 0 ГБ                      | 4–8 ГБ                   |
| Диск      | 1 ГБ                     | 2 ГБ                      | 10 ГБ (8B + зависимости) |
| Python    | 3.12                     | 3.12                      | 3.12                     |

{% hint style="success" %}
**Совет по Clore.ai:** Nano буквально не нуждается в GPU. Если у вас уже есть машина Clore для других задач, TTS бесплатен. Если вы *хотите* GPU для пакетной обработки или для запуска вариантов 1.7B/8B, то **RTX 3060 12 ГБ ($0.03–0.07/ч)** — это избыточно.
{% endhint %}

## Вариант A — установка через Python + быстрый инференс

```bash
conda create -n moss-tts-nano python=3.12 -y
conda activate moss-tts-nano

git clone https://github.com/OpenMOSS/MOSS-TTS-Nano.git
cd MOSS-TTS-Nano
pip install -r requirements.txt
pip install -e .

# Если pynini не устанавливается через pip, используйте conda-forge:
conda install -c conda-forge pynini=2.1.6.post1 -y
```

Инференс по референсному аудио + целевому тексту:

```bash
python infer.py \
  --prompt-audio-path assets/audio/en_1.wav \
  --text "Добро пожаловать в Clore.ai — децентрализованный маркетплейс GPU."
# Вывод: generated_audio/infer_output.wav  (стерео 48 кГц)
```

Или через CLI-точку входа:

```bash
moss-tts-nano generate \
  --prompt-speech ref.wav \
  --text "Привет от MOSS-TTS Nano, работающего на CPU."
```

Веб-демо (Gradio):

```bash
python app.py
# → http://127.0.0.1:18083
```

## Вариант B — Docker (CPU и GPU)

**только CPU** (Nano, образ \~1 ГБ):

```dockerfile
FROM python:3.12-slim
RUN apt-get update && apt-get install -y git build-essential \
    && rm -rf /var/lib/apt/lists/*
WORKDIR /app
RUN git clone https://github.com/OpenMOSS/MOSS-TTS-Nano.git . \
    && pip install -r requirements.txt && pip install -e .
EXPOSE 18083
CMD ["python", "app.py"]
```

```bash
docker build -t moss-tts-nano-cpu .
docker run --rm -p 18083:18083 moss-tts-nano-cpu
```

**GPU-версия** (для Realtime / TTSD / SoundEffect):

```bash
docker run --gpus all -p 18083:18083 \
  pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime \
  bash -c "git clone https://github.com/OpenMOSS/MOSS-TTS.git /app \
           && cd /app \
           && pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e '.[torch-runtime]' \
           && python app.py"
```

## Вариант C — Zero-shot клонирование голоса (референс 3 с)

MOSS-TTS-Nano клонирует голос с короткого референсного клипа и обрабатывает синтез длинных текстов с помощью автоматического разбиения на фрагменты.

```python
from moss_tts_nano import MossTTSNano
import soundfile as sf

model = MossTTSNano.from_pretrained("OpenMOSS-Team/MOSS-TTS-Nano-100M")

# Клонируйте голос по любому чистому клипу длительностью 3–10 с
audio, sr = model.synthesize(
    text="Это мой клонированный голос, озвучивающий главу аудиокниги Clore.ai.",
    prompt_audio_path="speaker_ref_3s.wav",
    language="en",
)
sf.write("cloned.wav", audio, sr)  # стерео 48 кГц
```

**Советы по качеству (перенесены из playbook XTTS — те же принципы применимы):**

* Используйте 3–10 с **чистого** референса (без фона, без реверберации помещения)
* По возможности сопоставляйте язык референса и целевого текста
* Нормализуйте и обрезайте тишину перед подачей (`librosa.effects.trim`)
* Для стабильной длинной озвучки используйте один и тот же референс во всех вызовах

## Вариант D — GGUF на llama.cpp-audio / ONNX без PyTorch

Для edge-устройств, мобильных бэкендов или любых случаев, где не нужен PyTorch:

```bash
# Клонируйте основной репозиторий с дополнениями без PyTorch
git clone https://github.com/OpenMOSS/MOSS-TTS.git
cd MOSS-TTS
pip install -e ".[llama-cpp-onnx]"

# Скачайте квантизированные веса GGUF (Q4_K_M)
huggingface-cli download OpenMOSS-Team/MOSS-TTS-GGUF --local-dir weights/

# Или чистая сборка ONNX (вообще без torch)
huggingface-cli download OpenMOSS-Team/MOSS-TTS-Nano-100M-ONNX --local-dir weights-onnx/
```

Этот путь работает на инструментах, совместимых с llama.cpp, — отлично подходит для Raspberry Pi, Android или serverless-функций, где важен бинарник размером 200 МБ.

## Рекомендации по GPU для Clore.ai

**Для Nano GPU не нужен.** В этом и смысл. Но если вы хотите генерировать пакетно или запускать более крупные модели:

| GPU                       | VRAM  | Подходит                                     | Цена на Clore (примерно) |
| ------------------------- | ----- | -------------------------------------------- | ------------------------ |
| **Инстанс только на CPU** | —     | Nano, Nano-ONNX, GGUF                        | от **$0.01/ч**           |
| RTX 3060 12GB             | 12 ГБ | Nano + Local-Transformer + Realtime          | от $0.03–0.07/ч          |
| RTX 3090 24GB             | 24 ГБ | Полный TTSD-v1.0 (8B), пакетное обслуживание | от $0.07–0.21/ч          |
| RTX 4090 24GB             | 24 ГБ | Одновременные TTSD + SoundEffect             | от $0.14–0.42/ч          |

{% hint style="success" %}
Для 90% производственных TTS-задач — голосовых агентов, IVR, озвучки — **машина Clore.ai только на CPU — буквально самое дешевое жизнеспособное развертывание**. Арендуйте ее, запустите MOSS-TTS-Nano и забудьте о счетах за GPU.
{% endhint %}

## Сценарии использования

* **Аудиокниги** — длинная озвучка с единообразным клонированным голосом, автоматическое разбиение на фрагменты
* **Голосовые агенты** — TTFB менее секунды в варианте Realtime для разговорного ИИ
* **IVR / телефонные системы** — развертывание только на CPU, стерео 48 кГц, 20 языков
* **NPC в играх** — достаточно легковесно, чтобы встроить в игровой клиент, дизайн голоса для каждого персонажа
* **Дубляж** — многоязычное клонирование для пайплайнов локализации
* **Генерация подкастов** — MOSS-TTSD-v1.0 нативно обрабатывает диалоги с несколькими дикторами
* **Звуковые эффекты** — MOSS-SoundEffect добавляет в пайплайн FX с контролем длительности

## Бенчмарки / качество

* **MOSS-TTSD-v1.0** превзошел Doubao и Gemini 2.5-pro в субъективных оценках диалогов с несколькими дикторами
* **Nano** обеспечивает real-time factor **< 1.0 на 4 ядрах CPU** (то есть быстрее воспроизведения)
* **Realtime** сообщает **\~180 мс до первого байта** для разговорного использования
* Вывод стерео 48 кГц — явный шаг вперед по сравнению с 24-килогерцовыми моно-конкурентами при таком бюджете параметров

## Устранение неполадок

| Проблема                                 | Решение                                                                                           |
| ---------------------------------------- | ------------------------------------------------------------------------------------------------- |
| `pynini` установка через pip не удается  | `conda install -c conda-forge pynini=2.1.6.post1 -y` затем переустановите WeTextProcessing        |
| Прерывистый звук на CPU                  | Убедитесь, что есть 4+ физических ядра; отключите переподписку SMT/HT; используйте сборку ONNX    |
| Клонированный голос звучит неестественно | Референс должен быть длительностью 3–10 с, чистым, с одним диктором и на том же языке             |
| OOM в TTSD-v1.0                          | Используйте FP16 (`model.half()`) или перейдите на 1.7B Local-Transformer                         |
| Загрузка модели зависает                 | Установите `HF_HUB_ENABLE_HF_TRANSFER=1` и повторите                                              |
| Медленный первый запуск                  | При первом инференсе компилируются ядра / загружаются веса \~400 МБ — последующие запуски быстрые |
| Torch конфликтует с другими моделями     | Используйте `[llama-cpp-onnx]` дополнения для среды без torch                                     |

## Дальнейшие шаги

* [Kokoro TTS](/guides/guides_v2-ru/audio-i-golos/kokoro-tts.md) — англоязычная альтернатива на 82M, если вам не нужен многоязычный режим
* [Voxtral TTS](/guides/guides_v2-ru/audio-i-golos/voxtral-tts.md) — модель Mistral на 4B, 9 языков, требуется GPU, но потолок выше
* [XTTS (Coqui)](/guides/guides_v2-ru/audio-i-golos/xtts-coqui.md) — клонирование голоса на 17 языках, только GPU, крупнее
* [Whisper Transcription](/guides/guides_v2-ru/audio-i-golos/whisper-transcription.md) — сочетайте MOSS-TTS с Whisper для полноценных голосовых пайплайнов
* [Арендуйте GPU (или CPU) на маркетплейсе Clore.ai](https://clore.ai/marketplace)

***

*Последнее обновление: 20 апреля 2026*


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/audio-i-golos/moss-tts.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
