> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen35.md).

# Qwen3.5

Ejecuta Alibaba Qwen3.5 en Clore.ai: el modelo frontier más reciente (feb. 2026)

Qwen3.5, lanzado el 16 de febrero de 2026, es el último modelo insignia de Alibaba y uno de los lanzamientos de código abierto más destacados de 2026. El **insignia MoE de 397B** superó a Claude 4.5 Opus en el benchmark de matemáticas HMMT, mientras que el más pequeño **modelo denso de 35B** cabe en una sola RTX 4090. Todos los modelos vienen con capacidades agénticas (uso de herramientas, llamada de funciones, ejecución autónoma de tareas) y comprensión multimodal de serie.

## Características clave

* **Tres tamaños**: 9B (denso), 35B (denso), 397B (MoE) — algo para cada GPU
* **Superó a Claude 4.5 Opus** en el benchmark de matemáticas HMMT
* **Multimodal de forma nativa**: Comprensión de texto + imagen
* **Capacidades agénticas**: Uso de herramientas, llamada de funciones, flujos de trabajo autónomos
* **Ventana de contexto de 128K**: Maneja documentos y bases de código grandes
* **Licencia Apache 2.0**: Uso comercial completo, sin restricciones

## Variantes del modelo

| Modelo       | Parámetros | Tipo  | VRAM (Q4) | VRAM (FP16) | Fortaleza               |
| ------------ | ---------- | ----- | --------- | ----------- | ----------------------- |
| Qwen3.5-9B   | 9B         | Denso | 6GB       | 18GB        | Rápido, eficiente       |
| Qwen3.5-35B  | 35B        | Denso | 22GB      | 70GB        | Mejor para una sola GPU |
| Qwen3.5-397B | 397B       | MoE   | \~100GB   | 400GB+      | De clase frontier       |

## Requisitos

{% hint style="warning" %}
**Las configuraciones multi-GPU de clase 80GB no aparecen en el mercado de Clore.ai.** Las mayores configuraciones listadas hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo solicitud. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

| Componente | 9B (Q4)       | 35B (Q4)      | 397B (multi-GPU) |
| ---------- | ------------- | ------------- | ---------------- |
| GPU        | RTX 3080 10GB | RTX 4090 24GB | 4× H100 80GB     |
| VRAM       | 8GB           | 22GB          | 320GB+           |
| RAM        | 16GB          | 32GB          | 128GB            |
| Disco      | 15GB          | 30GB          | 250GB            |

**GPU recomendada de Clore.ai**: RTX 4090 24GB ($0.14–0.42/h) para 35B — la mejor calidad por dólar

## Inicio rápido con Ollama

```bash
# Instalar Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 9B — funciona en cualquier equipo (8GB de VRAM)
ollama run qwen3.5:9b

# 35B cuantizado — necesita RTX 4090 (24GB)
ollama run qwen3.5:35b

# Como servidor API
ollama serve &
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:35b",
    "messages": [{"role": "user", "content": "Resuelve esto: si f(x) = x^3 - 3x + 1, encuentra todas las raíces reales"}]
  }'
```

## Configuración de vLLM (producción)

```bash
pip install vllm

# 35B en una sola GPU
vllm serve Qwen/Qwen3.5-35B-Instruct \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.90

# 9B con contexto largo
vllm serve Qwen/Qwen3.5-9B-Instruct \
  --max-model-len 65536

# 397B en un clúster multi-GPU
vllm serve Qwen/Qwen3.5-397B-A45B-Instruct \
  --tensor-parallel-size 8 \
  --max-model-len 32768
```

## Transformers de HuggingFace

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3.5-35B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True  # Cabe el 35B en 24GB
)

messages = [
    {"role": "system", "content": "Eres un tutor de matemáticas servicial."},
    {"role": "user", "content": "Demuestra que la raíz cuadrada de 2 es irracional."}
]

input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(input_ids, max_new_tokens=2048, temperature=0.7, do_sample=True)
print(tokenizer.decode(output[0][input_ids.shape[-1]:], skip_special_tokens=True))
```

## Ejemplo de uso agéntico / de herramientas

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

tools = [{
    "type": "function",
    "function": {
        "name": "get_gpu_price",
        "description": "Obtener el precio actual de alquiler de un modelo de GPU en Clore.ai",
        "parameters": {
            "type": "object",
            "properties": {
                "gpu_model": {"type": "string", "description": "Nombre del modelo de GPU, por ejemplo RTX 4090"}
            },
            "required": ["gpu_model"]
        }
    }
}]

response = client.chat.completions.create(
    model="qwen3.5:35b",
    messages=[{"role": "user", "content": "¿Cuál es la GPU más barata que puedo alquilar para ejecutar un modelo 7B?"}],
    tools=tools,
    tool_choice="auto"
)

# Qwen3.5 llamará a get_gpu_price con los parámetros apropiados
print(response.choices[0].message)
```

## ¿Por qué Qwen3.5 en Clore.ai?

El modelo 35B es posiblemente el **mejor modelo que puedes ejecutar en una sola RTX 4090**:

* Supera a Llama 4 Scout en matemáticas y razonamiento
* Supera a Gemma 3 27B en tareas agénticas
* El uso de herramientas / llamada de funciones funciona de inmediato
* Apache 2.0 = sin problemas de licencia

A $0.14–0.42/h para una RTX 4090, obtienes IA de vanguardia por el precio de un café.

## Consejos para usuarios de Clore.ai

* **35B es el punto ideal**: Cabe en una RTX 4090 en Q4, supera a la mayoría de los modelos 70B
* **9B para presupuesto**: Incluso una RTX 3060 ($0.03–0.07/h) ejecuta bien el modelo 9B
* **Usa Ollama para empezar rápido**: Un comando para servir; API compatible con OpenAI incluida
* **Flujos de trabajo agénticos**: Qwen3.5 destaca en el uso de herramientas — combínalo con llamada de funciones para automatización
* **Modelo nuevo = menos caché**: La primera descarga toma tiempo (\~20GB para 35B). Precárgalo antes de que empiece tu carga de trabajo

## Solución de problemas

| Problema                                 | Solución                                                                  |
| ---------------------------------------- | ------------------------------------------------------------------------- |
| 35B se queda sin memoria en 24GB         | Usa `load_in_4bit=True` o reduce `--max-model-len`                        |
| No se encuentra el modelo de Ollama      | Actualiza Ollama: `curl -fsSL https://ollama.com/install.sh \| sh`        |
| Lento en la primera solicitud            | La carga del modelo toma 30-60 s; las solicitudes posteriores son rápidas |
| Las llamadas a herramientas no funcionan | Asegúrate de pasar `tools` parámetro; usa solo la variante instruct       |

## Lecturas adicionales

* [Blog de Qwen](https://qwenlm.github.io/)
* [Modelos de HuggingFace](https://huggingface.co/Qwen)
* [Biblioteca de Ollama](https://ollama.com/library/qwen3.5)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen35.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
