For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.5-Omni (multimodal)

De Alibaba Qwen3.5-Omni es un modelo multimodal unificado de extremo a extremo lanzado el 30 de marzo de 2026 bajo la licencia Apache 2.0. Puede comprender y razonar simultáneamente a través de texto, audio, imágenes y video, y generar tanto texto como voz como salida. Ejecutarlo en una GPU alquilada de Clore.ai te brinda un asistente multimodal de nivel de producción a una fracción del costo de las API en la nube.


¿Qué es Qwen3.5-Omni?

Qwen3.5-Omni es un modelo multimodal de extremo a extremo construido sobre una arquitectura dispersa Mixture-of-Experts. El lanzamiento en HuggingFace (Qwen3.5-Omni-7B) usa la convención de nombres de Alibaba, donde "7B" se refiere a la configuración de parámetros activos por paso de inferencia; el punto de control completo incluye todos los pesos de los expertos. Esa dispersión es lo que permite implementarlo en una sola RTX 4090 (24 GB) usando cuantización INT4, un modelo que de otro modo requeriría mucha más VRAM en precisión completa.

Capacidades clave

Modalidad
Entrada
Salida

Texto

Audio

✅ (transcripción, comprensión)

✅ (síntesis de voz)

Imagen

✅ (comprensión, OCR, análisis)

Video

✅ (comprensión de escenas, preguntas y respuestas)

A diferencia de los modelos multimodales anteriores que unen codificadores separados, Qwen3.5-Omni procesa todas las modalidades en una sola pasada unificada hacia adelante. Puede transcribir simultáneamente audio hablado, analizar un fotograma de video y responder con texto y una voz sintetizada, todo en una sola llamada de inferencia.

Aspectos destacados de la arquitectura

  • Redes Gated Delta (GDN) para un modelado eficiente de secuencias con complejidad subcuadrática en flujos largos de audio/video

  • Mixture-of-Experts disperso — 30B de parámetros totales, ~3B activos por token; calidad comparable a modelos densos de 7–14B pero más rápido a escala

  • Tokenizador unificado que cubre texto, fotogramas de audio, fragmentos de imagen y secuencias de fotogramas de video

  • Decodificador TTS integrado — genera ondas de voz de forma nativa en lugar de a través de una canalización separada

Lanzado el 30 de marzo de 2026 · Licencia: Apache 2.0 · HuggingFace


Qwen3.5-Omni vs. modelos relacionados

Modelo
Parámetros
Modalidades de entrada
Salida de voz
Licencia
VRAM (INT4)

Qwen3.5-Omni

MoE de 30B (3B activos)

Texto, audio, imagen, video

Apache 2.0

~15 GB

Qwen3.5 (solo texto)

32B

Solo texto

Apache 2.0

~18 GB

Qwen2.5-VL

72B

Texto, imagen, video

Apache 2.0

~40 GB

Gemini 2.0 Flash

Texto, audio, imagen, video

Propietario

Solo API

Comparado con Qwen3.5 (solo texto), la variante Omni añade comprensión de audio/video y generación de voz, mientras que en realidad requiere menos VRAM en INT4 gracias a la arquitectura MoE. Comparado con Qwen2.5-VL, añade entrada/salida de audio pero requiere mucho menos hardware.


Requisitos de hardware

Precisión
VRAM requerida
GPU recomendada

BF16 (completa)

64–80 GB

A100 80GB, H100

BF16 multi-GPU

2× 40 GB

2× A40 / 2× A6000

INT4 / GGUF

~15 GB

RTX 4090 (24 GB) ✅

INT8

~30 GB

A6000 48GB, RTX 6000 Ada

Para la mayoría de los casos de uso autoalojados, INT4 en una RTX 4090 es el punto ideal: capacidad multimodal completa a $0.14–0.42/h en Clore.ai.


Inicio rápido en Clore.ai

Paso 1: Alquilar una GPU

Ve a clore.ai/marketplace y alquila:

  • INT4 / GPU única: RTX 4090 (24 GB) — desde $0.14–0.42/h

  • BF16 / Precisión completa: A100 80GB o H100 — desde ~$1.04/h

Usa el vllm/vllm-openai Imagen de Docker o la imagen CUDA estándar.

Paso 2: Desplegar con vLLM (recomendado)

Se requiere vLLM v0.17.0+ para compatibilidad con Qwen3.5-Omni.

Nota: El awq_marlin la bandera requiere un modelo AWQ previamente cuantizado. Descarga Qwen/Qwen3.5-Omni-7B-AWQ en lugar del modelo base, u omite --quantization para BF16 en A100/H100.

Una vez que el servidor esté en funcionamiento, expone una API compatible con OpenAI en http://localhost:8000/v1.

Paso 3: Desplegar con Ollama (configuración más sencilla)

Para experimentar rápidamente sin la complejidad de Docker:

Ollama maneja la cuantización automáticamente y proporciona un /api/generate simple punto final.


Ejemplos de llamadas a la API

Entrada multimodal: imagen + texto

Transcripción y comprensión de audio

Comprensión de video


Configuración multi-GPU para BF16

Si alquilas una máquina multi-GPU en Clore.ai (por ejemplo, 2× A40 o 2× A6000), usa paralelismo tensorial:

Esto divide el modelo entre ambas GPU para obtener el máximo rendimiento y calidad.


Casos de uso

1. Automatización del servicio al cliente

Qwen3.5-Omni puede escuchar llamadas de voz de clientes, transcribirlas en tiempo real, comprender el problema y generar tanto un resumen de texto como una respuesta hablada. Todo en un solo modelo, sin unir pipelines separados de ASR + LLM + TTS.

2. Comprensión de contenido de video

Sube videos de demostraciones de productos, grabaciones de clases o material de vigilancia y obtén descripciones detalladas en texto, resúmenes con marcas de tiempo o preguntas y respuestas. El modelo maneja hasta 32K tokens de contexto, cubriendo videos de varios minutos.

3. Agentes de voz en tiempo real

Crea asistentes de voz conversacionales que comprendan el contexto entre turnos de audio. Qwen3.5-Omni mantiene la memoria conversacional y puede intercalar su razonamiento en texto con la generación de voz, ideal para bots de atención al cliente por teléfono.

4. Análisis de documentos + capturas de pantalla

OCR, comprensión del diseño, interpretación de gráficos: pasa capturas de pantalla de paneles, PDFs o notas manuscritas y obtén salida de texto estructurada o un análisis detallado.

5. Procesamiento de audio multilingüe

El modelo admite 29 idiomas tanto para texto como para voz, lo que lo hace adecuado para soporte al cliente internacional, canalizaciones de transcripción multilingüe y análisis de video multilingüe.


Estimación de costos en Clore.ai

GPU
Precisión
VRAM
Precio/Día
Ideal para

RTX 4090

INT4

24 GB

~$0.50

Desarrollo, pruebas, producción a pequeña escala

RTX 6000 Ada

INT8

48 GB

~$1.20

Mejor calidad, rendimiento moderado

A100 80GB

BF16

80 GB

~$2.50

Calidad completa, alto rendimiento

2× A40

Paralelismo tensorial BF16

2×48 GB

~$2.00

Calidad completa, rentable

Ejecutar Qwen3.5-Omni en INT4 en una RTX 4090 cuesta menos por día que una sola llamada a la API de OpenAI para una tarea multimodal compleja a escala.


Consejos y solución de problemas

"CUDA out of memory" en RTX 4090

  • Añade --gpu-memory-utilization 0.90 al comando vLLM

  • Reduce --max-model-len a 16384 si procesas entradas cortas

La entrada de audio no funciona

  • Asegúrate de que la versión de vLLM sea exactamente v0.17.0 o más nueva — las versiones anteriores no tienen compatibilidad con el audio de Omni

  • Los archivos WAV deben ser mono de 16 kHz para obtener mejores resultados; usa ffmpeg -ar 16000 -ac 1 para convertir

Primera inferencia lenta

  • vLLM compila kernels CUDA en la primera ejecución; el calentamiento tarda de 2 a 5 minutos. Las llamadas posteriores son rápidas.

Ollama no reconoce la entrada de video

  • Actualmente, Ollama solo admite imagen+texto y audio; para la comprensión de video usa el despliegue con vLLM.


Resumen

Qwen3.5-Omni trae una verdadera IA multimodal de extremo a extremo — texto, audio, imagen y video como entrada, texto y voz como salida — en un solo modelo de código abierto que funciona en hardware de consumo. En INT4, cabe en una RTX 4090 de 24 GB y cuesta menos de un dólar al día en Clore.ai. Con licencia Apache 2.0 y API compatible con OpenAI a través de vLLM, se integra directamente en las canalizaciones existentes.

Alquila una RTX 4090 en Clore.ai y despliega Qwen3.5-Omni hoy mismo.

Última actualización

¿Te fue útil?