For the complete documentation index, see llms.txt. This page is also available as Markdown.

Clonación de voz Zonos TTS

Ejecuta Zonos TTS de Zyphra para clonación de voz con control de emoción y tono en GPUs de Clore.ai.

Zonos de Zyphra es un modelo de texto a voz de peso abierto con 0.4B de parámetros, entrenado con más de 200 mil horas de voz multilingüe. Realiza clonación de voz zero-shot a partir de solo 2–30 segundos de audio de referencia y ofrece un control detallado sobre la emoción, la velocidad de habla, la variación del tono y la calidad del audio. La salida es audio de alta fidelidad de 44 kHz. Hay dos variantes del modelo disponibles: Transformer (mejor calidad) e Hybrid/Mamba (inferencia más rápida).

GitHub: Zyphra/Zonos HuggingFace: Zyphra/Zonos-v0.1-transformer Licencia: Apache 2.0

Características clave

  • Clonación de voz a partir de 2–30 segundos — no requiere ajuste fino

  • salida de alta fidelidad de 44 kHz — calidad de audio de nivel de estudio

  • Control de emociones — felicidad, tristeza, ira, miedo, sorpresa, asco mediante un vector 8D

  • Velocidad de habla y tono — control granular independiente

  • Entradas de prefijo de audio — permite susurrar y otros comportamientos difíciles de clonar

  • Multilingüe — inglés, japonés, chino, francés, alemán

  • Dos arquitecturas — Transformer (calidad) y Hybrid/Mamba (velocidad, ~2× en tiempo real en una RTX 4090)

  • Apache 2.0 — gratis para uso personal y comercial

Requisitos

Componente
Mínimo
Recomendado

GPU

RTX 3080 10 GB

RTX 4090 24 GB

VRAM

6 GB (Transformer)

10 GB+

RAM

16 GB

32 GB

Disco

10 GB

20 GB

Python

3.10+

3.11

CUDA

12.8+

12.8+

Sistema

espeak-ng

Recomendación de Clore.ai: RTX 3090 ($0.07–0.21/h) para un margen cómodo. RTX 4090 ($0.14–0.42/h) para el modelo Hybrid y la inferencia más rápida.

Instalación

Inicio rápido

Ejemplos de uso

Control de emociones

Zonos acepta un vector de emoción de 8 dimensiones: [felicidad, tristeza, asco, miedo, sorpresa, ira, otro, neutral].

Control de velocidad de habla y tono

Interfaz web de Gradio

Exponer puerto 7860/http en tu pedido de Clore.ai y abre la http_pub URL para acceder a la interfaz de usuario.

Consejos para usuarios de Clore.ai

  • Elección del modelo — Transformer para la mejor calidad, Hybrid para una inferencia ~2× más rápida (requiere GPU RTX 3000+)

  • Audio de referencia — 10–30 segundos de voz limpia ofrecen los mejores resultados; fragmentos más cortos (2–5 s) funcionan, pero con menor fidelidad

  • Configuración de Docker — usa pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime, añade apt-get install -y espeak-ng al inicio

  • Mapeo de puertos — expone 7860/http para la interfaz de Gradio, 8000/http para el servidor API

  • Control de semilla — establece torch.manual_seed() antes de la generación para una salida reproducible

  • Parámetro de calidad de audio — experimenta con el audio_quality campo de condicionamiento para una salida más limpia

Solución de problemas

Problema
Solución

espeak-ng no encontrado

Ejecuta apt-get install -y espeak-ng (requerido para la fonemización)

CUDA sin memoria

Usa el modelo Transformer (más pequeño que Hybrid); reduce la longitud del texto por llamada

El modelo Hybrid falla

Requiere una GPU Ampere+ (serie RTX 3000 o más nueva) y pip install -e ".[compile]"

La voz clonada suena rara

Usa un fragmento de referencia más largo (15–30 s) con voz clara y ruido de fondo mínimo

Generación lenta

Normal para Transformer (~0.5× en tiempo real); Hybrid alcanza ~2× en tiempo real en una RTX 4090

ModuleNotFoundError: zonos

Asegúrate de haberlo instalado desde el código fuente: cd Zonos && pip install -e .

Última actualización

¿Te fue útil?