For the complete documentation index, see llms.txt. This page is also available as Markdown.

Clonación de voz Qwen3-TTS

Clonación de voz multilingüe y TTS con Qwen3-TTS: más de 10 idiomas, streaming, control de emoción

Qwen3-TTS de Alibaba es un modelo de texto a voz de última generación que admite más de 10 idiomas con clonación de voz a partir de solo 3 segundos de audio. Cuenta con control de emociones en lenguaje natural ("habla felizmente", "susurra suavemente"), streaming con 97 ms de latencia y dos tamaños de modelo (0.6B y 1.7B). Lanzado bajo Apache 2.0, es uno de los sistemas TTS de código abierto más capaces disponibles.

Características clave

  • más de 10 idiomas: inglés, chino, japonés, coreano, francés, alemán, español y más

  • Clonación de voz de 3 segundos: Clona cualquier voz a partir de una breve muestra de audio

  • Control natural de las emociones: Controla el estilo con instrucciones de texto plano

  • Compatibilidad con streaming: latencia del primer token de 97 ms — ideal para aplicaciones en tiempo real

  • Dos tamaños: 0.6B (4 GB de VRAM) y 1.7B (8 GB de VRAM)

  • Ajustable: Modelos base disponibles para entrenamiento personalizado

  • licencia Apache 2.0: Uso comercial completo

Variantes del modelo

Modelo
Parámetros
VRAM
Calidad
Velocidad
Ideal para

Qwen3-TTS-0.6B-Instruct

0.6B

4GB

Bueno

Rápido

GPUs económicas en tiempo real

Qwen3-TTS-1.7B-Instruct

1.7B

8GB

Mejor

Medio

Calidad de producción

Qwen3-TTS-0.6B-Base

0.6B

4GB

Ajuste fino

Qwen3-TTS-1.7B-Base

1.7B

8GB

Ajuste fino

Requisitos

Componente
0.6B
1.7B

GPU

RTX 3060 6GB

RTX 3080 10GB

VRAM

4GB

8GB

RAM

8GB

16GB

Disco

5GB

10GB

Python

3.10+

3.10+

GPU recomendada de Clore.ai: RTX 3060 ($0.03–0.07/h) para 0.6B, RTX 3080 ($0.05–0.19/h) para 1.7B

Instalación

Inicio rápido — Clonación de voz

Control de emociones

Generación multilingüe

Comparación con otros modelos TTS

Función
Qwen3-TTS
Zonos
Dia
Kokoro
XTTS

Idiomas

10+

1 (EN)

1 (EN)

1 (EN)

17

Clonación de voz

3 sec

2-30 sec

No

No

6 s

Transmisión

✅ (97ms)

Control de emociones

✅ Natural

✅ Automático

Multihablante

VRAM mínima

4GB

8GB

8GB

2 GB

6GB

Licencia

Apache 2.0

Apache 2.0

Apache 2.0

Apache 2.0

AGPL

Consejos para usuarios de Clore.ai

  • 0.6B en RTX 3060: La mejor opción económica a $0.03–0.07/h: suficiente para la mayoría de las tareas TTS

  • Procesamiento por lotes: Genera todos los clips de audio en una sola sesión para maximizar el tiempo de alquiler

  • Almacena en caché el audio de referencia: Mantén tus referencias de voz en almacenamiento persistente

  • Streaming en tiempo real: Usa la API de streaming para aplicaciones de chatbot/asistente

  • Ajuste fino para voces personalizadas: Alquila una RTX 4090 por unas horas para ajustar el modelo base con tus datos de voz

Solución de problemas

Problema
Solución

Sin memoria en 1.7B

Cambia a 0.6B o usa torch_dtype=torch.float16

La clonación de voz suena mal

Usa 5-10 segundos de audio limpio (sin ruido de fondo)

Salida en idioma incorrecto

Pasa explícitamente idioma parámetro

Primera generación lenta

Normal: el modelo se carga en la primera llamada. Las llamadas posteriores son rápidas

Lecturas adicionales

Última actualización

¿Te fue útil?