MeloTTS
Ejecuta TTS multilingüe de alta calidad MeloTTS con inferencia rápida en GPUs de Clore.ai
MeloTTS es una biblioteca multilingüe de texto a voz de alta calidad desarrollada por MyShell AI. Ofrece síntesis de voz rápida y de sonido natural en varios idiomas y acentos del inglés, diseñada tanto para investigación como para despliegue en producción. MeloTTS está optimizado para la velocidad — puede generar voz significativamente más rápido que en tiempo real incluso en CPU — manteniendo una alta calidad de audio adecuada para uso comercial.
MeloTTS actualmente admite:
Inglés (estadounidense, británico, indio, australiano, predeterminado)
Chino (simplificado y chino-inglés mixto)
Japonés
Coreano
Español
Francés
Puntos destacados clave:
⚡ Inferencia rápida — más rápida que el tiempo real en CPU, rapidísima en GPU
🌍 Multilingüe — 6 idiomas con variantes de acento para inglés
🐳 Listo para Docker — imagen oficial de Docker disponible
🔌 API REST — API HTTP para integración en cualquier aplicación
📱 De nivel de producción — usado en los productos de consumo de MyShell
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Requisitos del servidor
GPU
NVIDIA GTX 1080 (8 GB)
NVIDIA RTX 3090 (24 GB)
VRAM
4 GB
8–16 GB
RAM
8 GB
16 GB
CPU
4 núcleos
8 núcleos
Disco
10 GB
20 GB
SO
Ubuntu 20.04+
Ubuntu 22.04
CUDA
11.7+ (opcional)
12.1+
Python
3.8+
3.10
Puertos
22, 8888
22, 8888
Despliegue rápido en CLORE.AI
Nota: MeloTTS no tiene una imagen oficial preconstruida de Docker en Docker Hub (myshell-ai/melotts no existe). El enfoque recomendado es usar una imagen base de NVIDIA CUDA e instalar MeloTTS mediante pip desde el repositorio oficial de GitHub.
1. Encuentra un servidor adecuado
Ve a Marketplace de CLORE.AI y filtra por:
VRAM: ≥ 4 GB (o solo CPU para bajo volumen)
GPU: Cualquier GPU NVIDIA (GTX 1080+, serie RTX, A100)
Disco: ≥ 10 GB
2. Configura tu despliegue
Imagen de Docker:
Mapeos de puertos:
Variables de entorno:
Comando de inicio (ejecutar después de conectarse por SSH al servidor):
3. Acceder a la API
Prueba con:
Configuración paso a paso
Paso 1: conéctate por SSH a tu servidor
Paso 2: Construir y ejecutar el contenedor
Dado que MeloTTS no tiene una imagen de Docker Hub preconstruida, usa una base NVIDIA CUDA e instala MeloTTS desde el código fuente:
Alternativamente, construye una imagen Docker personalizada desde el código fuente:
Paso 3: Verificar que el servicio se está ejecutando
Paso 4: Alternativa — interfaz de Jupyter Notebook
Accede en: http://<server-ip>:8888
Paso 5: Instalar desde pip (sin Docker)
Ejemplos de uso
Ejemplo 1: TTS básico en inglés (Python)
Ejemplo 2: TTS multilingüe
Ejemplo 3: Uso de la API REST
Ejemplo 4: Procesamiento por lotes de alta velocidad
Ejemplo 5: TTS mixto chino-inglés
Configuración
Configuración con Docker Compose
Dado que MeloTTS no tiene una imagen oficial de Docker Hub, usa la imagen base de NVIDIA CUDA e instala MeloTTS desde el código fuente al iniciar:
Opciones de configuración de la API
--host
127.0.0.1
Dirección de enlace (usar 0.0.0.0 para público)
--port
8888
Puerto del servidor API
--workers
1
Número de procesos de trabajo
--device
auto
cuda, cpu, o auto
Idiomas y altavoces compatibles
Inglés
EN
EN-Default, EN-US, EN-GB, EN-India, EN-Australia, EN-Brazil
Chino
ZH
ZH
Japonés
JP
JP
Coreano
KR
KR
Español
SP
SP
Francés
FR
FR
Consejos de rendimiento
1. Benchmark GPU vs CPU
Rendimiento de MeloTTS (RTF = factor de tiempo real, más bajo es mejor):
CPU (8 núcleos)
~0.3x
Rápido, ideal para poca carga
RTX 3080
~0.05x
20 veces más rápido que el tiempo real
RTX 4090
~0.02x
50 veces más rápido que el tiempo real
A100
~0.01x
100 veces más rápido que el tiempo real
2. Optimizar para rendimiento
3. Precalentar el modelo
4. Ajustar la calidad de audio frente a la velocidad
5. Eficiencia de memoria
Solución de problemas
Problema: espeak-ng no encontrado
Problema: faltan datos de NLTK
Problema: el puerto 8888 entra en conflicto con Jupyter
MeloTTS usa el puerto 8888 de forma predeterminada, lo que choca con Jupyter Notebook. Soluciones:
Problema: el texto chino no se representa correctamente
Problema: falla la descarga de la imagen de Docker
Problema: inferencia lenta en GPU
Recomendaciones de GPU para Clore.ai
MeloTTS es ligero — funciona bien en CPU para bajo volumen y escala linealmente con el cómputo de GPU. No necesitas hardware caro.
Solo CPU
—
~$0.02/h
~0.3×
~3 solicitudes/min
RTX 3090
24 GB
$0.07–0.21/h
~0.02× (50× tiempo real)
~100 solicitudes/min
RTX 4090
24 GB
$0.14–0.42/h
~0.01× (100× tiempo real)
~200 solicitudes/min
Recomendación para producción: Para una API TTS multilingüe que atiende a 10–50 usuarios concurrentes, la RTX 3090 es el punto ideal. Escala horizontalmente (múltiples instancias) en lugar de actualizar a una costosa A100 — MeloTTS no se beneficia de forma proporcional de GPUs de gama alta.
Enlaces
Docker: No hay imagen oficial en Docker Hub — instalar desde código fuente de GitHub usando
nvidia/cuda:12.8.1-devel-ubuntu22.04imagen baseArtículo: https://arxiv.org/abs/2406.06753
Hugging Face: https://huggingface.co/myshell-ai/MeloTTS-English
MyShell AI: https://myshell.ai
Marketplace de CLORE.AI: https://clore.ai/marketplace
Última actualización
¿Te fue útil?