For the complete documentation index, see llms.txt. This page is also available as Markdown.

MOSS-TTS (solo CPU, 100M)

Ejecuta MOSS-TTS: texto a voz multilingüe ultraligero de 100M parámetros, centrado en CPU, de OpenMOSS (MOSI.AI + Fudan NLP) en Clore.ai.

MOSS-TTS es una familia de generación de voz de código abierto de OpenMOSS (Institución de Innovación de Shanghái, en colaboración con Fudan NLP y MOSI.AI, dirigida por el Prof. Xipeng Qiu). El modelo insignia MOSS-TTS-Nano es solo 100M parámetros, se ejecuta en tiempo real en una CPU de 4 núcleos sin GPU, genera estéreo de 48 kHz, y admite 20 idiomas con clonación de voz zero-shot. La familia completa escala hasta 8B para diálogo entre múltiples hablantes, diseño de voz y generación de efectos de sonido.

Publicado: 10 de abril de 2026 (Nano) · compilación ONNX para CPU 17 de abril de 2026 · Licencia: Apache 2.0

Si Kokoro domina el nicho de inglés occidental de 82M parámetros, MOSS-TTS-Nano domina el nicho multilingüe centrado en CPU : la misma filosofía de modelo pequeño, pero con estéreo de 48 kHz, 20 idiomas, clonación de voz y una ruta ONNX/GGUF sin Torch. Para cualquiera que quiera desplegar TTS sin pagar por una GPU, este es el modelo.

Familia MOSS-TTS

Modelo
Tamaño
VRAM
Ideal para

MOSS-TTS-Nano-100M

100M

0 GB (CPU, 4 núcleos)

Tiempo real, edge, IVR, en el dispositivo

MOSS-TTS-Nano-100M-ONNX

100M

0 GB (CPU)

serving de producción sin Torch

MOSS-TTS-GGUF

100M (Q4_K_M)

0 GB (CPU)

despliegues estilo llama.cpp

MOSS-TTS-Local-Transformer

1.7B

4 GB

GPU ligera, alta calidad objetiva

MOSS-TTS-Realtime

1.7B

4 GB

agentes de voz con múltiples turnos, 180 ms TTFB

MOSS-VoiceGenerator

1.7B

4 GB

Diseño de voz a partir de prompts de texto

MOSS-TTSD-v1.0

8B

8 GB

Diálogo entre múltiples hablantes, pódcast largos

MOSS-SoundEffect

8B

8 GB

Generación de efectos de sonido con control de duración

Especificaciones clave

Especificaciones
Valor

Desarrollador

Equipo OpenMOSS · MOSI.AI · Laboratorio Fudan NLP

Arquitectura

Autoregresivo (tokenizador de audio + LLM)

Frecuencia de muestreo

48 kHz, estéreo

Idiomas

20 (zh, en, de, es, fr, ja, it, hu, ko, ru, fa, ar, pl, pt, cs, da, sv, el, tr, +1)

Clonación de voz

Zero-shot a partir de una referencia de ~3 s

Transmisión

Sí — decodificación por fragmentos en CPU

Licencia

Apache 2.0

HuggingFace

¿Por qué MOSS-TTS?

  • Despliegue sin GPU — Nano se ejecuta en 4 núcleos de CPU, sin CUDA ni Triton

  • Salida estéreo de 48 kHz — calidad de difusión, poco común en modelos de menos de 100M

  • 20 idiomas — más cobertura que Kokoro (~5) a un tamaño similar

  • Clonación de voz zero-shot a partir de audio de referencia de ~3 s

  • Rutas ONNX/GGUF sin Torch — distribúyelo con un binario de 200 MB

  • La familia escala hasta — mismo tokenizador/API desde Nano hasta TTSD de 8B

  • Apache 2.0 — uso comercial, sin restricciones

  • De investigación seria — Fudan NLP + MOSI.AI, no es un proyecto de afición

Requisitos

Componente
Mínimo (Nano, CPU)
Recomendado (Nano, CPU)
Familia completa (GPU)

CPU

4 núcleos (x86_64 / ARM64)

8 núcleos

8 núcleos

RAM

4 GB

8 GB

16 GB

GPU

— (no requerido)

— (opcional)

RTX 3060 12 GB+

VRAM

0 GB

0 GB

4–8 GB

Disco

1 GB

2 GB

10 GB (8B + dependencias)

Python

3.12

3.12

3.12

Opción A — instalación con Python + inferencia rápida

Inferencia a partir del audio de referencia + texto objetivo:

O mediante el punto de entrada CLI:

Demo web (Gradio):

Opción B — Docker (CPU y GPU)

Solo CPU (Nano, imagen de ~1 GB):

Variante GPU (para Realtime / TTSD / SoundEffect):

Opción C — clonación de voz zero-shot (referencia de 3 s)

MOSS-TTS-Nano clona una voz a partir de un clip corto de referencia y gestiona la síntesis de formato largo mediante fragmentación automática.

Consejos de calidad (adaptados del manual de XTTS — se aplican los mismos principios):

  • Usa 3–10 s de audio limpio (sin música de fondo ni reverberación de sala)

  • Haz coincidir el idioma de la referencia y del texto objetivo cuando sea posible

  • Normaliza y recorta el silencio antes de pasar el audio (librosa.effects.trim)

  • Para una narración larga y consistente, reutiliza la misma referencia en todas las llamadas

Opción D — GGUF en llama.cpp-audio / ONNX sin Torch

Para equipos edge, backends móviles o cualquier lugar donde no quieras PyTorch:

Esta ruta funciona con herramientas compatibles con llama.cpp — excelente para Raspberry Pi, Android o funciones sin servidor donde importa un binario de 200 MB.

Recomendaciones de GPU para Clore.ai

No necesitas GPU para Nano. Ese es precisamente el punto. Pero si quieres generar por lotes o ejecutar los hermanos mayores:

GPU
VRAM
Cabe en
Precio en Clore (aprox.)

Instancia solo CPU

Nano, Nano-ONNX, GGUF

desde $0.01/h

RTX 3060 12GB

12 GB

Nano + Local-Transformer + Realtime

desde $0.03–0.07/h

RTX 3090 24GB

24 GB

TTSD-v1.0 completo (8B), servicio por lotes

desde $0.07–0.21/h

RTX 4090 24GB

24 GB

TTSD + SoundEffect concurrente

desde $0.14–0.42/h

Casos de uso

  • Audiolibros — narración de formato largo con voz clonada consistente, fragmentación automática

  • Agentes de voz — TTFB de menos de un segundo en la variante Realtime para IA conversacional

  • IVR / sistemas telefónicos — despliegue solo CPU, 48 kHz estéreo, 20 idiomas

  • NPCs de juegos — lo bastante ligero para integrarlo dentro de un cliente de juego, diseño de voz por personaje

  • Doblaje — clonación multilingüe para canalizaciones de localización

  • Generación de pódcast — MOSS-TTSD-v1.0 maneja de forma nativa el diálogo entre múltiples hablantes

  • Efectos de sonido — MOSS-SoundEffect añade FX con duración controlada al flujo

Puntos de referencia / calidad

  • MOSS-TTSD-v1.0 superó a Doubao y Gemini 2.5-pro en evaluaciones subjetivas de diálogo entre múltiples hablantes

  • Nano ofrece un factor en tiempo real < 1.0 en 4 núcleos de CPU (es decir, más rápido que la reproducción)

  • Realtime la variante informa ~180 ms de tiempo hasta el primer byte para uso conversacional

  • La salida estéreo de 48 kHz supone una mejora clara frente a competidores mono de 24 kHz en este presupuesto de parámetros

Solución de problemas

Problema
Solución

pynini la instalación falla vía pip

conda install -c conda-forge pynini=2.1.6.post1 -y luego reinstala WeTextProcessing

Audio entrecortado en CPU

Asegúrate de tener 4+ núcleos físicos; desactiva la sobreasignación SMT/HT; usa la compilación ONNX

La voz clonada suena rara

La referencia debe ser de 3–10 s, limpia, de un solo hablante y con idioma coincidente

OOM en TTSD-v1.0

Usa FP16 (model.half()) o baja al Local-Transformer de 1.7B

La descarga del modelo se detiene

Establece HF_HUB_ENABLE_HF_TRANSFER=1 y vuelve a intentarlo

Primera ejecución lenta

La primera inferencia compila kernels / descarga ~400 MB de pesos — las ejecuciones posteriores son rápidas

Torch entra en conflicto con otros modelos

Usa el [llama-cpp-onnx] extras para un entorno sin Torch

Siguientes pasos


Última actualización: 20 de abril de 2026

Última actualización

¿Te fue útil?