Voxtral TTS
El modelo de texto a voz de código abierto de Mistral: 4 mil millones de parámetros, 9 idiomas, clonación de voz zero-shot, solo 3 GB de VRAM.
Desarrollador
Mistral AI
Parámetros
4 mil millones
Arquitectura
TTS de solo decodificador
Idiomas
9 (inglés, francés, alemán, español, hindi, árabe, portugués, italiano, japonés)
Licencia
Apache 2.0 (pesos abiertos)
VRAM
~3 GB (FP16)
Latencia
70 ms para una salida de 10 segundos
Clonación de voz
Zero-shot a partir de una referencia de 3 segundos
Lanzamiento
26 de marzo de 2026
¿Por qué Voxtral TTS?
Voxtral TTS es la respuesta de código abierto de Mistral a ElevenLabs y OpenAI TTS. Ventajas clave para los usuarios de Clore.ai:
Funciona en cualquier GPU — solo 3 GB de VRAM significa que incluso una RTX 3060 funciona perfectamente
Sin tarifas de API — autohospedado = síntesis ilimitada con coste marginal cero
Privacidad de datos — el audio nunca sale de tu máquina
Clonación zero-shot — clona cualquier voz a partir de 3 segundos de audio de referencia
9 idiomas de forma nativa — incluidos hindi y árabe, que a menudo faltan en la competencia
Velocidad en tiempo real — RTF 0.1–0.2× en RTX 4070+ (clip de 10 segundos en 1–2 segundos)
Requisitos de GPU en Clore.ai
RTX 3060 12GB
12 GB
✅ Bueno — 3–4× en tiempo real
desde $0.03–0.07/h
RTX 3090 24GB
24 GB
✅ Excelente — procesamiento por lotes
desde $0.07–0.21/h
RTX 4070 12 GB
12 GB
✅ Excelente — 5–10× en tiempo real
desde $0.04–0.20/h
RTX 4090 24GB
24 GB
✅ Excesivo — latencia subsegundo
desde $0.14–0.42/h
Recomendación: Una RTX 3060 de 12 GB ($0.03–0.07/h en Clore.ai) es el punto óptimo para la mayoría de los casos de uso. Voxtral solo necesita 3 GB de VRAM, así que puedes ejecutarlo junto con otros modelos.
Inicio rápido en Clore.ai
Paso 1: Alquila un servidor GPU
Filtra cualquier GPU con 8+ GB de VRAM
Selecciona un Docker despliegue
Usa la imagen:
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel
Paso 2: Instala las dependencias
Paso 3: Texto a voz básico
Paso 4: Clonación de voz zero-shot
Paso 5: Síntesis multilingüe
Servidor API de producción
Despliega Voxtral como una API REST para integrarlo en tus aplicaciones:
Despliegue con Docker
Voxtral frente a otros modelos TTS
Pesos abiertos
✅ Apache 2.0
❌ Solo API
✅
✅
✅
VRAM
3 GB
N/D (nube)
8 GB
2 GB
4 GB
Idiomas
9
30+
50+
5
8
Clonación de voz
ref. 3 s
ref. 1 s
ref. 5 s
❌
ref. 10 s
Latencia
70 ms
~200 ms
~150 ms
50 ms
100 ms
Calidad
⭐⭐⭐⭐⭐
⭐⭐⭐⭐⭐
⭐⭐⭐⭐
⭐⭐⭐⭐
⭐⭐⭐⭐
Autohospedado
✅
❌
✅
✅
✅
Procesamiento por lotes para proyectos grandes
Modo de streaming para aplicaciones en tiempo real
Solución de problemas
Falta de memoria en GPU pequeña
Usa model.half() para FP16 (reduce a la mitad la VRAM a ~1.5 GB)
Primera inferencia lenta
Normal — el modelo compila kernels CUDA en la primera ejecución (~30 s)
Calidad deficiente para el idioma X
Asegúrate de usar el parámetro correcto idioma parámetro; algunos idiomas necesitan audio de referencia más largo
Artefactos de audio
Aumenta reference_audio la longitud a 5–10 s para mejorar la clonación de voz
La descarga del modelo falla
Establece HF_TOKEN variable de entorno para el acceso al modelo restringido
Análisis de costos: Voxtral en Clore.ai frente a TTS en la nube
ElevenLabs Pro
$99/mes
500 mil caracteres incluidos, cargos por excedente
OpenAI TTS
$15/mes
$15 por 1 millón de caracteres
Google Cloud TTS
$16/mes
Voces estándar
Voxtral en Clore.ai
$3–15/mes
RTX 3060 a $0.03–0.07/h, caracteres ilimitados
Conclusión: Autohospedar Voxtral en Clore.ai es de 6 a 30 veces más barato que las API de TTS en la nube, con límites de caracteres cero y privacidad total de los datos.
Lecturas adicionales
Última actualización: 30 de marzo de 2026
Última actualización
¿Te fue útil?