For the complete documentation index, see llms.txt. This page is also available as Markdown.

MeloTTS

Ejecuta TTS multilingüe de alta calidad MeloTTS con inferencia rápida en GPUs de Clore.ai

MeloTTS es una biblioteca multilingüe de texto a voz de alta calidad desarrollada por MyShell AI. Ofrece síntesis de voz rápida y de sonido natural en varios idiomas y acentos del inglés, diseñada tanto para investigación como para despliegue en producción. MeloTTS está optimizado para la velocidad — puede generar voz significativamente más rápido que en tiempo real incluso en CPU — manteniendo una alta calidad de audio adecuada para uso comercial.

MeloTTS actualmente admite:

  • Inglés (estadounidense, británico, indio, australiano, predeterminado)

  • Chino (simplificado y chino-inglés mixto)

  • Japonés

  • Coreano

  • Español

  • Francés

Puntos destacados clave:

  • Inferencia rápida — más rápida que el tiempo real en CPU, rapidísima en GPU

  • 🌍 Multilingüe — 6 idiomas con variantes de acento para inglés

  • 🐳 Listo para Docker — imagen oficial de Docker disponible

  • 🔌 API REST — API HTTP para integración en cualquier aplicación

  • 📱 De nivel de producción — usado en los productos de consumo de MyShell


Requisitos del servidor

Parámetro
Mínimo
Recomendado

GPU

NVIDIA GTX 1080 (8 GB)

NVIDIA RTX 3090 (24 GB)

VRAM

4 GB

8–16 GB

RAM

8 GB

16 GB

CPU

4 núcleos

8 núcleos

Disco

10 GB

20 GB

SO

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.7+ (opcional)

12.1+

Python

3.8+

3.10

Puertos

22, 8888

22, 8888

MeloTTS es excepcionalmente eficiente: funciona bien en CPU para solicitudes individuales y se beneficia enormemente de la GPU para el procesamiento por lotes. Incluso una GPU económica duplica drásticamente el rendimiento.


Despliegue rápido en CLORE.AI

1. Encuentra un servidor adecuado

Ve a Marketplace de CLORE.AI y filtra por:

  • VRAM: ≥ 4 GB (o solo CPU para bajo volumen)

  • GPU: Cualquier GPU NVIDIA (GTX 1080+, serie RTX, A100)

  • Disco: ≥ 10 GB

2. Configura tu despliegue

Imagen de Docker:

Mapeos de puertos:

Variables de entorno:

Comando de inicio (ejecutar después de conectarse por SSH al servidor):

3. Acceder a la API

Prueba con:


Configuración paso a paso

Paso 1: conéctate por SSH a tu servidor

Paso 2: Construir y ejecutar el contenedor

Dado que MeloTTS no tiene una imagen de Docker Hub preconstruida, usa una base NVIDIA CUDA e instala MeloTTS desde el código fuente:

Alternativamente, construye una imagen Docker personalizada desde el código fuente:

Paso 3: Verificar que el servicio se está ejecutando

Paso 4: Alternativa — interfaz de Jupyter Notebook

Accede en: http://<server-ip>:8888

Paso 5: Instalar desde pip (sin Docker)


Ejemplos de uso

Ejemplo 1: TTS básico en inglés (Python)


Ejemplo 2: TTS multilingüe


Ejemplo 3: Uso de la API REST


Ejemplo 4: Procesamiento por lotes de alta velocidad


Ejemplo 5: TTS mixto chino-inglés


Configuración

Configuración con Docker Compose

Dado que MeloTTS no tiene una imagen oficial de Docker Hub, usa la imagen base de NVIDIA CUDA e instala MeloTTS desde el código fuente al iniciar:

Opciones de configuración de la API

Parámetro
Valor predeterminado
Descripción

--host

127.0.0.1

Dirección de enlace (usar 0.0.0.0 para público)

--port

8888

Puerto del servidor API

--workers

1

Número de procesos de trabajo

--device

auto

cuda, cpu, o auto

Idiomas y altavoces compatibles

Idioma
Código
IDs de altavoz

Inglés

EN

EN-Default, EN-US, EN-GB, EN-India, EN-Australia, EN-Brazil

Chino

ZH

ZH

Japonés

JP

JP

Coreano

KR

KR

Español

SP

SP

Francés

FR

FR


Consejos de rendimiento

1. Benchmark GPU vs CPU

Rendimiento de MeloTTS (RTF = factor de tiempo real, más bajo es mejor):

Dispositivo
RTF
Notas

CPU (8 núcleos)

~0.3x

Rápido, ideal para poca carga

RTX 3080

~0.05x

20 veces más rápido que el tiempo real

RTX 4090

~0.02x

50 veces más rápido que el tiempo real

A100

~0.01x

100 veces más rápido que el tiempo real

2. Optimizar para rendimiento

3. Precalentar el modelo

4. Ajustar la calidad de audio frente a la velocidad

5. Eficiencia de memoria


Solución de problemas

Problema: espeak-ng no encontrado

Problema: faltan datos de NLTK

Problema: el puerto 8888 entra en conflicto con Jupyter

MeloTTS usa el puerto 8888 de forma predeterminada, lo que choca con Jupyter Notebook. Soluciones:

Problema: el texto chino no se representa correctamente

Problema: falla la descarga de la imagen de Docker

Problema: inferencia lenta en GPU


Recomendaciones de GPU para Clore.ai

MeloTTS es ligero — funciona bien en CPU para bajo volumen y escala linealmente con el cómputo de GPU. No necesitas hardware caro.

GPU
VRAM
Precio de Clore.ai
RTF (factor de tiempo real)
Capacidad

Solo CPU

~$0.02/h

~0.3×

~3 solicitudes/min

RTX 3090

24 GB

$0.07–0.21/h

~0.02× (50× tiempo real)

~100 solicitudes/min

RTX 4090

24 GB

$0.14–0.42/h

~0.01× (100× tiempo real)

~200 solicitudes/min

A100 40GB

40 GB

~0.005× (200× tiempo real)

~400 solicitudes/min

La mejor relación calidad-precio para cargas de trabajo TTS: La RTX 3090 a 0,07–0,21 $/h ofrece velocidad TTS 50 veces superior al tiempo real. Para una API de producción que atiende a cientos de usuarios, esto es más que suficiente. Las instancias solo CPU (0,07–0,21 $/h) funcionan bien para desarrollo y despliegues con poco tráfico.

Recomendación para producción: Para una API TTS multilingüe que atiende a 10–50 usuarios concurrentes, la RTX 3090 es el punto ideal. Escala horizontalmente (múltiples instancias) en lugar de actualizar a una costosa A100 — MeloTTS no se beneficia de forma proporcional de GPUs de gama alta.


Enlaces

Última actualización

¿Te fue útil?