Clonación de voz Kani-TTS-2
Ejecuta Kani-TTS-2: un modelo de texto a voz ultrar eficiente de 400M parámetros con clonación de voz en GPUs de Clore.ai
Kani-TTS-2 de nineninesix.ai (lanzado el 15 de febrero de 2026) es un modelo de texto a voz de código abierto con 400 millones de parámetros que logra síntesis de voz de alta fidelidad usando solo 3 GB de VRAM. Construido sobre la arquitectura LFM2 de LiquidAI con NVIDIA NanoCodec, trata el audio como un lenguaje — generando voz de sonido natural con clonación de voz zero-shot a partir de un breve clip de audio de referencia. Con menos de la mitad del tamaño de los modelos competidores y una fracción del cómputo, Kani-TTS-2 es perfecto para IA conversacional en tiempo real, generación de audiolibros y clonación de voz en hardware económico.
HuggingFace: nineninesix/kani-tts-2-en GitHub: nineninesix-ai/kani-tts-2 PyPI: kani-tts-2 Licencia: Apache 2.0
Características clave
400 millones de parámetros, 3 GB de VRAM — funciona en prácticamente cualquier GPU moderna, incluida la RTX 3060
Clonación de voz zero-shot — clona cualquier voz a partir de una muestra de audio de referencia de 3 a 30 segundos
Embeddings del hablante — representaciones del hablante de 128 dimensiones basadas en WavLM para un control preciso de la voz
Hasta 40 segundos de audio continuo — adecuado para pasajes más largos y diálogos
En tiempo real o más rápido — RTF ~0.2 en RTX 5080, en tiempo real incluso en GPU económicas
Apache 2.0 — totalmente abierto para uso personal y comercial
Marco de preentrenamiento incluido — entrena tu propio modelo TTS desde cero en cualquier idioma
Comparación con otros modelos TTS
Kani-TTS-2
400M
3GB
✅ Zero-shot
Inglés (extensible)
Apache 2.0
Kokoro
82M
2 GB
❌ Voces preestablecidas
EN, JP, CN
Apache 2.0
Zonos
400M
8GB
✅
Varias
Apache 2.0
ChatTTS
300M
4GB
❌ Semillas aleatorias
Chino, inglés
AGPL 3.0
Chatterbox
500M
6GB
✅
Inglés
Apache 2.0
XTTS (Coqui)
467M
6GB
✅
Varias
MPL 2.0
F5-TTS
335M
4GB
✅
Varias
CC-BY-NC 4.0
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
GPU
Cualquiera con 3 GB de VRAM
RTX 3060 o superior
VRAM
3GB
6GB
RAM
8GB
16GB
Disco
2 GB
5GB
Python
3.9+
3.11+
CUDA
12.8+
12.8+
Recomendación de Clore.ai: Una RTX 3060 ($0.03–0.07/h) es más que suficiente. Incluso las instancias de GPU más baratas en Clore.ai ejecutarán Kani-TTS-2 con comodidad. Para el procesamiento por lotes (audiolibros, conjuntos de datos), una RTX 4090 ($0.14–0.42/h) proporciona un rendimiento excelente.
Instalación
Inicio rápido
Tres líneas para generar voz:
Ejemplos de uso
1. Texto a voz básico
2. Clonación de voz
Clona cualquier voz a partir de una breve muestra de audio de referencia:
3. Generación por lotes para audiolibros
Genera múltiples capítulos de forma eficiente:
4. API de streaming compatible con OpenAI
Para aplicaciones en tiempo real, usa el servidor compatible con OpenAI:
Luego úsalo con cualquier cliente TTS de OpenAI:
Consejos para usuarios de Clore.ai
Este es el modelo más económico de ejecutar — Con 3 GB de VRAM, Kani-TTS-2 se ejecuta literalmente en cualquier instancia de GPU en Clore.ai. Una RTX 3060 a $0.03–0.07/h es más que suficiente para TTS en producción.
Combínalo con un modelo de lenguaje — Alquila una instancia de GPU y ejecuta simultáneamente un LLM pequeño (p. ej., Mistral 3 8B) y Kani-TTS-2 para tener un asistente de voz completo. Compartirán la GPU con margen de sobra.
Precalcula los embeddings del hablante — Extrae los embeddings del hablante una sola vez y guárdalos. Así evitas cargar el modelo embebedor WavLM en cada solicitud.
Usa el servidor compatible con OpenAI — El
kani-tts-2-openai-serverproporciona un reemplazo directo de la API TTS de OpenAI, lo que facilita la integración con aplicaciones existentes.Entrena en idiomas personalizados — Kani-TTS-2 incluye un marco completo de preentrenamiento (kani-tts-2-pretrain). Ajusta el modelo con tu propio conjunto de datos de idioma — solo se necesitan 8× H100 durante unas 6 horas.
Solución de problemas
ImportError: no se puede importar LFM2
Instala la versión correcta de transformers: pip install -U "transformers==4.56.0"
La calidad de audio es mala / robótica
Aumenta temperature a 0.8–0.9; asegúrate de que el audio de referencia para la clonación esté limpio (sin ruido de fondo)
La clonación de voz no suena como la referencia
Usa de 5 a 15 segundos de audio claro de un solo hablante. Evita música o ruido de fondo en la referencia
CUDA sin memoria
No debería ocurrir con el modelo de 3 GB — comprueba si otros procesos están usando memoria de la GPU (nvidia-smi)
El audio se corta a mitad de la oración
Kani-TTS-2 admite hasta ~40 segundos. Divide los textos más largos en oraciones y concatena las salidas
Lento en CPU
Se recomienda encarecidamente la inferencia en GPU. Incluso una GPU básica es de 10 a 50 veces más rápida que la CPU
Lecturas adicionales
GitHub — kani-tts-2 — paquete de PyPI, documentación de uso, ejemplos avanzados
HuggingFace — kani-tts-2-en — pesos del modelo en inglés
Marco de preentrenamiento — Entrena tu propio modelo TTS desde cero
Servidor compatible con OpenAI — Reemplazo directo de la API TTS de OpenAI
Modelo de embeddings del hablante — embebedor de voz basado en WavLM
Resumen de MarkTechPost — Cobertura de la comunidad
Última actualización
¿Te fue útil?