Qwen3.5
Ejecuta Alibaba Qwen3.5 en Clore.ai: el modelo frontier más reciente (feb. 2026)
Qwen3.5, lanzado el 16 de febrero de 2026, es el último modelo insignia de Alibaba y uno de los lanzamientos de código abierto más destacados de 2026. El insignia MoE de 397B superó a Claude 4.5 Opus en el benchmark de matemáticas HMMT, mientras que el más pequeño modelo denso de 35B cabe en una sola RTX 4090. Todos los modelos vienen con capacidades agénticas (uso de herramientas, llamada de funciones, ejecución autónoma de tareas) y comprensión multimodal de serie.
Características clave
Tres tamaños: 9B (denso), 35B (denso), 397B (MoE) — algo para cada GPU
Superó a Claude 4.5 Opus en el benchmark de matemáticas HMMT
Multimodal de forma nativa: Comprensión de texto + imagen
Capacidades agénticas: Uso de herramientas, llamada de funciones, flujos de trabajo autónomos
Ventana de contexto de 128K: Maneja documentos y bases de código grandes
Licencia Apache 2.0: Uso comercial completo, sin restricciones
Variantes del modelo
Qwen3.5-9B
9B
Denso
6GB
18GB
Rápido, eficiente
Qwen3.5-35B
35B
Denso
22GB
70GB
Mejor para una sola GPU
Qwen3.5-397B
397B
MoE
~100GB
400GB+
De clase frontier
Requisitos
Las configuraciones multi-GPU de clase 80GB no aparecen en el mercado de Clore.ai. Las mayores configuraciones listadas hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo solicitud. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
GPU
RTX 3080 10GB
RTX 4090 24GB
4× H100 80GB
VRAM
8GB
22GB
320GB+
RAM
16GB
32GB
128GB
Disco
15GB
30GB
250GB
GPU recomendada de Clore.ai: RTX 4090 24GB ($0.14–0.42/h) para 35B — la mejor calidad por dólar
Inicio rápido con Ollama
Configuración de vLLM (producción)
Transformers de HuggingFace
Ejemplo de uso agéntico / de herramientas
¿Por qué Qwen3.5 en Clore.ai?
El modelo 35B es posiblemente el mejor modelo que puedes ejecutar en una sola RTX 4090:
Supera a Llama 4 Scout en matemáticas y razonamiento
Supera a Gemma 3 27B en tareas agénticas
El uso de herramientas / llamada de funciones funciona de inmediato
Apache 2.0 = sin problemas de licencia
A $0.14–0.42/h para una RTX 4090, obtienes IA de vanguardia por el precio de un café.
Consejos para usuarios de Clore.ai
35B es el punto ideal: Cabe en una RTX 4090 en Q4, supera a la mayoría de los modelos 70B
9B para presupuesto: Incluso una RTX 3060 ($0.03–0.07/h) ejecuta bien el modelo 9B
Usa Ollama para empezar rápido: Un comando para servir; API compatible con OpenAI incluida
Flujos de trabajo agénticos: Qwen3.5 destaca en el uso de herramientas — combínalo con llamada de funciones para automatización
Modelo nuevo = menos caché: La primera descarga toma tiempo (~20GB para 35B). Precárgalo antes de que empiece tu carga de trabajo
Solución de problemas
35B se queda sin memoria en 24GB
Usa load_in_4bit=True o reduce --max-model-len
No se encuentra el modelo de Ollama
Actualiza Ollama: curl -fsSL https://ollama.com/install.sh | sh
Lento en la primera solicitud
La carga del modelo toma 30-60 s; las solicitudes posteriores son rápidas
Las llamadas a herramientas no funcionan
Asegúrate de pasar tools parámetro; usa solo la variante instruct
Lecturas adicionales
Última actualización
¿Te fue útil?