Clonación de voz Qwen3-TTS
Clonación de voz multilingüe y TTS con Qwen3-TTS: más de 10 idiomas, streaming, control de emoción
Qwen3-TTS de Alibaba es un modelo de texto a voz de última generación que admite más de 10 idiomas con clonación de voz a partir de solo 3 segundos de audio. Cuenta con control de emociones en lenguaje natural ("habla felizmente", "susurra suavemente"), streaming con 97 ms de latencia y dos tamaños de modelo (0.6B y 1.7B). Lanzado bajo Apache 2.0, es uno de los sistemas TTS de código abierto más capaces disponibles.
Características clave
más de 10 idiomas: inglés, chino, japonés, coreano, francés, alemán, español y más
Clonación de voz de 3 segundos: Clona cualquier voz a partir de una breve muestra de audio
Control natural de las emociones: Controla el estilo con instrucciones de texto plano
Compatibilidad con streaming: latencia del primer token de 97 ms — ideal para aplicaciones en tiempo real
Dos tamaños: 0.6B (4 GB de VRAM) y 1.7B (8 GB de VRAM)
Ajustable: Modelos base disponibles para entrenamiento personalizado
licencia Apache 2.0: Uso comercial completo
Variantes del modelo
Qwen3-TTS-0.6B-Instruct
0.6B
4GB
Bueno
Rápido
GPUs económicas en tiempo real
Qwen3-TTS-1.7B-Instruct
1.7B
8GB
Mejor
Medio
Calidad de producción
Qwen3-TTS-0.6B-Base
0.6B
4GB
—
—
Ajuste fino
Qwen3-TTS-1.7B-Base
1.7B
8GB
—
—
Ajuste fino
Requisitos
GPU
RTX 3060 6GB
RTX 3080 10GB
VRAM
4GB
8GB
RAM
8GB
16GB
Disco
5GB
10GB
Python
3.10+
3.10+
GPU recomendada de Clore.ai: RTX 3060 ($0.03–0.07/h) para 0.6B, RTX 3080 ($0.05–0.19/h) para 1.7B
Instalación
Inicio rápido — Clonación de voz
Control de emociones
Generación multilingüe
Comparación con otros modelos TTS
Idiomas
10+
1 (EN)
1 (EN)
1 (EN)
17
Clonación de voz
3 sec
2-30 sec
No
No
6 s
Transmisión
✅ (97ms)
❌
❌
❌
✅
Control de emociones
✅ Natural
❌
✅ Automático
❌
❌
Multihablante
❌
❌
✅
❌
❌
VRAM mínima
4GB
8GB
8GB
2 GB
6GB
Licencia
Apache 2.0
Apache 2.0
Apache 2.0
Apache 2.0
AGPL
Consejos para usuarios de Clore.ai
0.6B en RTX 3060: La mejor opción económica a $0.03–0.07/h: suficiente para la mayoría de las tareas TTS
Procesamiento por lotes: Genera todos los clips de audio en una sola sesión para maximizar el tiempo de alquiler
Almacena en caché el audio de referencia: Mantén tus referencias de voz en almacenamiento persistente
Streaming en tiempo real: Usa la API de streaming para aplicaciones de chatbot/asistente
Ajuste fino para voces personalizadas: Alquila una RTX 4090 por unas horas para ajustar el modelo base con tus datos de voz
Solución de problemas
Sin memoria en 1.7B
Cambia a 0.6B o usa torch_dtype=torch.float16
La clonación de voz suena mal
Usa 5-10 segundos de audio limpio (sin ruido de fondo)
Salida en idioma incorrecto
Pasa explícitamente idioma parámetro
Primera generación lenta
Normal: el modelo se carga en la primera llamada. Las llamadas posteriores son rápidas
Lecturas adicionales
Última actualización
¿Te fue útil?