Clonación de voz Zonos TTS
Ejecuta Zonos TTS de Zyphra para clonación de voz con control de emoción y tono en GPUs de Clore.ai.
Zonos de Zyphra es un modelo de texto a voz de peso abierto con 0.4B de parámetros, entrenado con más de 200 mil horas de voz multilingüe. Realiza clonación de voz zero-shot a partir de solo 2–30 segundos de audio de referencia y ofrece un control detallado sobre la emoción, la velocidad de habla, la variación del tono y la calidad del audio. La salida es audio de alta fidelidad de 44 kHz. Hay dos variantes del modelo disponibles: Transformer (mejor calidad) e Hybrid/Mamba (inferencia más rápida).
GitHub: Zyphra/Zonos HuggingFace: Zyphra/Zonos-v0.1-transformer Licencia: Apache 2.0
Características clave
Clonación de voz a partir de 2–30 segundos — no requiere ajuste fino
salida de alta fidelidad de 44 kHz — calidad de audio de nivel de estudio
Control de emociones — felicidad, tristeza, ira, miedo, sorpresa, asco mediante un vector 8D
Velocidad de habla y tono — control granular independiente
Entradas de prefijo de audio — permite susurrar y otros comportamientos difíciles de clonar
Multilingüe — inglés, japonés, chino, francés, alemán
Dos arquitecturas — Transformer (calidad) y Hybrid/Mamba (velocidad, ~2× en tiempo real en una RTX 4090)
Apache 2.0 — gratis para uso personal y comercial
Requisitos
GPU
RTX 3080 10 GB
RTX 4090 24 GB
VRAM
6 GB (Transformer)
10 GB+
RAM
16 GB
32 GB
Disco
10 GB
20 GB
Python
3.10+
3.11
CUDA
12.8+
12.8+
Sistema
espeak-ng
—
Recomendación de Clore.ai: RTX 3090 ($0.07–0.21/h) para un margen cómodo. RTX 4090 ($0.14–0.42/h) para el modelo Hybrid y la inferencia más rápida.
Instalación
Inicio rápido
Ejemplos de uso
Control de emociones
Zonos acepta un vector de emoción de 8 dimensiones: [felicidad, tristeza, asco, miedo, sorpresa, ira, otro, neutral].
Control de velocidad de habla y tono
Interfaz web de Gradio
Exponer puerto 7860/http en tu pedido de Clore.ai y abre la http_pub URL para acceder a la interfaz de usuario.
Consejos para usuarios de Clore.ai
Elección del modelo — Transformer para la mejor calidad, Hybrid para una inferencia ~2× más rápida (requiere GPU RTX 3000+)
Audio de referencia — 10–30 segundos de voz limpia ofrecen los mejores resultados; fragmentos más cortos (2–5 s) funcionan, pero con menor fidelidad
Configuración de Docker — usa
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime, añadeapt-get install -y espeak-ngal inicioMapeo de puertos — expone
7860/httppara la interfaz de Gradio,8000/httppara el servidor APIControl de semilla — establece
torch.manual_seed()antes de la generación para una salida reproducibleParámetro de calidad de audio — experimenta con el
audio_qualitycampo de condicionamiento para una salida más limpia
Solución de problemas
espeak-ng no encontrado
Ejecuta apt-get install -y espeak-ng (requerido para la fonemización)
CUDA sin memoria
Usa el modelo Transformer (más pequeño que Hybrid); reduce la longitud del texto por llamada
El modelo Hybrid falla
Requiere una GPU Ampere+ (serie RTX 3000 o más nueva) y pip install -e ".[compile]"
La voz clonada suena rara
Usa un fragmento de referencia más largo (15–30 s) con voz clara y ruido de fondo mínimo
Generación lenta
Normal para Transformer (~0.5× en tiempo real); Hybrid alcanza ~2× en tiempo real en una RTX 4090
ModuleNotFoundError: zonos
Asegúrate de haberlo instalado desde el código fuente: cd Zonos && pip install -e .
Última actualización
¿Te fue útil?