> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md).

# Qwen3.8-27B (VLM denso, una sola tarjeta)

Despliega Qwen3.8-27B en Clore.ai: el modelo denso de visión y lenguaje de 27B de Alibaba que funciona en una sola RTX 4090 en Q4 y una sola RTX 5090 en FP8

{% hint style="info" %}
**Estado (agosto de 2026):** Qwen lanzó **Qwen3.8-27B** el **14 de agosto de 2026** bajo **Apache 2.0**, con un punto de control FP8 oficial un día después. Pesos: [Qwen/Qwen3.8-27B](https://huggingface.co/Qwen/Qwen3.8-27B) y [Qwen/Qwen3.8-27B-FP8](https://huggingface.co/Qwen/Qwen3.8-27B-FP8). Denso de 27B, **visión-lenguaje nativa**, **contexto de 262.144 tokens** extensible hasta **1M con YaRN**, con soporte desde el primer día en vLLM, SGLang y llama.cpp.
{% endhint %}

La mayor parte de lo que se lanzó este verano no se puede alquilar. GLM-5.2 ocupa 756 GB en FP8. MiniMax M3 ocupa 854 GB. Kimi K3 ocupa 1,5 TB y no cabe en ninguna máquina listada en Clore.ai con ninguna cuantización. Qwen3.8-27B es el contrapeso: **27B de parámetros densos, 15,4 GB en Q4, una tarjeta, un contenedor, listo.** Es el modelo para el que realmente está diseñado este mercado: había 677 servidores con una tarjeta de 24 GB o mejor libre en la última instantánea.

Tampoco es un modelo recortado. Procesa imágenes y video de forma nativa, expone un `reasoning_effort` control, y su pila de atención híbrida mantiene la caché KV lo bastante pequeña como para que el contexto largo en una tarjeta de consumo sea algo realista y no teórico.

### Especificaciones clave

| Propiedad                | Valor                                                    |
| ------------------------ | -------------------------------------------------------- |
| Parámetros               | 27B (denso)                                              |
| Arquitectura             | 64 capas, Gated DeltaNet + Gated Attention híbridos, MTP |
| Modalidad                | Texto, imagen, video de entrada → texto de salida        |
| Contexto nativo          | 262,144 tokens                                           |
| Contexto extendido       | 1,000,000 tokens (YaRN)                                  |
| Licencia                 | Apache 2.0                                               |
| Fecha de lanzamiento     | 14 de agosto de 2026                                     |
| Pesos                    | BF16 55,6 GB · FP8 30,9 GB · Q4\_K\_S GGUF 15,4 GB       |
| Herramientas principales | vLLM, SGLang, llama.cpp, Ollama                          |

### Por qué este

* **Cabe.** Q4 en una sola RTX 3090 o 4090 en **$0.07–0.42/hr**; FP8 en una RTX PRO 6000 o 2× tarjetas de 24 GB
* **Apache 2.0** — uso comercial, ajuste fino y redistribución sin cláusula de ingresos, a diferencia de Kimi K3 (licencia personalizada con barrera de ingresos) o MiniMax M3 (licencia comunitaria)
* **Atención híbrida** — 3 de cada 4 bloques de capas son Gated DeltaNet (atención lineal), así que la caché KV crece mucho más despacio con el contexto que en un transformador estándar. Esto es lo que hace que un contexto de 100K+ sea utilizable en 24 GB
* **Visión incorporada** — diagramas, documentos, capturas de pantalla y video de escala de horas, sin VLM separado que desplegar
* **Control del razonamiento** — `reasoning_effort` en `bajo` / `mediano` / `xhigh`, además de `preserve_thinking` para transportar el razonamiento entre turnos para agentes

***

## Requisitos

{% hint style="success" %}
**Una sola tarjeta es el objetivo.** Una sola RTX 4090 en Q4 te da un modelo visión-lenguaje de última generación por aproximadamente el precio de una taza de café al día. Pásate a una RTX 5090 o una RTX PRO 6000 solo si quieres calidad FP8 o un contexto muy largo.
{% endhint %}

|                   | Q4\_K\_S GGUF             | Q8 / FP8                                | BF16                           |
| ----------------- | ------------------------- | --------------------------------------- | ------------------------------ |
| Pesos             | 15,4 GB                   | \~31 GB                                 | 55,6 GB                        |
| GPU               | 1× RTX 3090/4090 de 24 GB | 1× RTX PRO 6000 de 96 GB, o 2× RTX 5090 | 2× RTX PRO 6000, o 4× RTX 5090 |
| Contexto práctico | \~64K                     | \~200K                                  | 262K completo                  |
| RAM del sistema   | 32GB                      | 64GB                                    | 96GB                           |
| Disco             | 25GB                      | 45 GB                                   | 80 GB                          |
| CUDA              | 12.8+                     | 12.8+                                   | 12.8+                          |

{% hint style="warning" %}
**Una sola RTX 5090 (32 GB) no es suficiente para FP8.** Solo los pesos son 30,9 GB. Necesitas margen para la caché KV y las activaciones, así que FP8 requiere o bien una tarjeta de 96 GB o dos GPU. En una sola 5090, ejecuta Q6 o Q4 — consulta [Compatibilidad de CUDA y PyTorch](/guides/guides_v2-es/primeros-pasos/cuda-pytorch-compatibility.md) la imagen base correcta en Blackwell.
{% endhint %}

***

## Opción A — Ollama (ruta más rápida)

```bash
ollama pull qwen3.8:27b
ollama run qwen3.8:27b

# Endpoint compatible con OpenAI
ollama serve &
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "qwen3.8:27b",
    "messages": [{"role": "user", "content": "Refactoriza este controlador para usar context.Context y añadir reintentos."}],
    "temperature": 0.7
  }'
```

La etiqueta predeterminada es Q4\_K\_M (\~16 GB). Usa `qwen3.8:27b-q8_0` si alquilaste una tarjeta de 96 GB.

***

## Opción B — vLLM (producción)

Una sola tarjeta de 24 GB, punto de control AWQ INT4 de la comunidad:

```yaml
# docker-compose.yml
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports: ["8000:8000"]
    volumes: [hf_cache:/root/.cache/huggingface]
    command: >
      --model cyankiwi/Qwen3.8-27B-AWQ-INT4
      --max-model-len 65536
      --gpu-memory-utilization 0.92
      --served-model-name qwen3.8-27b
      --enable-auto-tool-choice
      --tool-call-parser hermes
    deploy:
      resources:
        reservations:
          devices: [{driver: nvidia, count: 1, capabilities: [gpu]}]
    shm_size: "8gb"
volumes:
  hf_cache:
```

Qwen solo distribuye oficialmente BF16 y FP8. Los puntos de control de 4 bits son compilaciones de la comunidad — `cyankiwi/Qwen3.8-27B-AWQ-INT4` y `RedHatAI/Qwen3.8-27B-INT4` son los más descargados, y `unsloth/Qwen3.8-27B-NVFP4` está dirigido específicamente a tarjetas Blackwell.

FP8 en dos GPU:

```bash
vllm serve Qwen/Qwen3.8-27B-FP8 \\
  --tensor-parallel-size 2 \\
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.90 \\
  --enable-chunked-prefill
```

La entrada de video necesita una bandera adicional:

```bash
vllm serve Qwen/Qwen3.8-27B --media-io-kwargs '{"video": {"num_frames": -1}}'
```

Supera la ventana nativa con YaRN:

```bash
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve Qwen/Qwen3.8-27B \\
  --hf-overrides '{"text_config": {"rope_parameters": {"rope_type": "yarn", "factor": 4.0, "original_max_position_embeddings": 262144}}}' \\
  --max-model-len 1000000
```

***

## Opción C — llama.cpp / GGUF (tarjetas de 24 GB)

```bash
# Q4_K_S — 15,4 GB, cómodo en una tarjeta de 24 GB
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \\
  --include "*UD-Q4_K_S*" --local-dir /workspace/qwen38

llama-server -m /workspace/qwen38/*UD-Q4_K_S*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 -c 65536 --flash-attn
```

Cuantizaciones más pequeñas del mismo repositorio, para tarjetas más ajustadas: `UD-Q3_K_XL` 13,1 GB, `UD-Q2_K_XL` 9,8 GB, `UD-IQ2_S` 8,4 GB.

***

## Esfuerzo de razonamiento

```python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="none")

resp = client.chat.completions.create(
    model="qwen3.8-27b",
    messages=[{"role": "user", "content": "Planifica la migración en pasos."}],
    extra_body={"reasoning_effort": "xhigh"},   # xhigh (default) | medium | low
)
```

Baja a `bajo` para clasificación, extracción y enrutamiento — la diferencia de calidad allí es pequeña y la factura de tokens es una fracción. Conserva `xhigh` para agentes y trabajo de código de varios pasos.

***

## Recomendaciones de GPU para Clore.ai

| Configuración   | VRAM   | Modo       | Contexto      | Coste en Clore.ai |
| --------------- | ------ | ---------- | ------------- | ----------------- |
| **1× RTX 3090** | 24GB   | Q4 GGUF    | \~64K         | **$0.07–0.21/h**  |
| **1× RTX 4090** | 24GB   | Q4 AWQ     | \~64K         | **$0.14–0.42/h**  |
| 1× RTX 5090     | 32GB   | Q6 GGUF    | \~96K         | $0.25–0.77/h      |
| 2× RTX 5090     | 64GB   | FP8, TP=2  | \~200K        | $0.50–1.54/h      |
| 1× RTX PRO 6000 | 96GB   | FP8        | 262K completo | $0.92–1.38/h      |
| 4× RTX 5090     | 128 GB | BF16, TP=4 | 262K completo | $1.00–3.08/h      |

{% hint style="success" %}
**Mejor opción:** una sola [RTX 4090 desde $0.14/h](https://clore.ai/rent-4090.html) en Q4. Si el precio del equipo completo parece alto, recuerda que la mayoría de los equipos con varias GPU permiten [alquiler parcial](/guides/guides_v2-es/primeros-pasos/partial-gpu-rental.md) — puedes sacar una tarjeta de una caja de ocho tarjetas.
{% endhint %}

***

## Pruebas comparativas

{% hint style="warning" %}
Las cifras siguientes son las propias de Qwen, de la tarjeta del modelo del 14 de agosto de 2026. Las reproducciones independientes seguían llegando en el momento de escribir esto.
{% endhint %}

Qwen evalúa el 27B frente a modelos mucho más grandes en suites de codificación y agentes (SWE-bench Pro, DeepSWE, QwenSWEBench) usando el entorno Claude Code con contexto de 256K. La afirmación que importa para el despliegue no es una sola puntuación: es que un 27B denso ejecutándose en una sola tarjeta de consumo entra en la misma conversación que modelos MoE que necesitan un rack. Toma la tabla del proveedor como una hipótesis inicial y haz benchmarks en tu propio conjunto de tareas — eso aquí es barato, ya que una hora de tiempo de 4090 cuesta unos veinte centavos.

***

## Casos de uso

* **Asistente de codificación de una sola GPU** — un contenedor, una tarjeta, un punto final compatible con OpenAI
* **Comprensión de documentos y capturas de pantalla** — visión nativa, sin canalización separada
* **Análisis de video** — video de escala de horas en una sola pasada con la bandera de fotogramas de vLLM
* **RAG de contexto largo** — 262K nativo, y la atención híbrida mantiene asequible la caché KV
* **Trabajadores agentes** — `preserve_thinking` mantiene coherente el razonamiento a través de las llamadas a herramientas
* **En local y aislado de la red** — Apache 2.0, no envía datos a casa
* **Ajuste fino LoRA** — el 27B denso es adecuado para [Unsloth](/guides/guides_v2-es/entrenamiento/unsloth-finetune.md) y [LLaMA-Factory](/guides/guides_v2-es/entrenamiento/llama-factory.md) en una sola tarjeta de 24 GB

***

## Solución de problemas

| Problema                                             | Solución                                                                                                                                         |
| ---------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------ |
| `no hay una imagen de kernel disponible` en una 5090 | Compilación antigua de CUDA — usa una imagen cu128, consulta [compatibilidad](/guides/guides_v2-es/primeros-pasos/cuda-pytorch-compatibility.md) |
| OOM en FP8 en una sola RTX 5090                      | Esperado: 30,9 GB de pesos en una tarjeta de 32 GB. Usa Q6/Q4, o TP=2                                                                            |
| OOM con contexto largo en 24 GB                      | Reduce `--max-model-len` a 32768, o baja a `UD-Q3_K_XL`                                                                                          |
| YaRN rechazado                                       | Necesita una versión reciente de vLLM/SGLang; pásalo a través de `--hf-overrides`, no como una bandera independiente                             |
| Entrada de video ignorada                            | Añade `--media-io-kwargs '{"video": {"num_frames": -1}}'` (solo vLLM)                                                                            |
| Se omitieron las llamadas a herramientas             | `--enable-auto-tool-choice --tool-call-parser hermes`                                                                                            |
| La calidad cae más allá de \~600K                    | YaRN extiende posiciones, no comprensión — mantén el contenido crítico cerca del final del prompt                                                |

***

## Siguientes pasos

* **Predecesor:** [Qwen3.6-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen36-27b.md) — el 27B denso de abril que esto reemplaza
* **Hermano multimodal:** [Qwen3.5-Omni](/guides/guides_v2-es/modelos-de-lenguaje/qwen35-omni.md) — añade entrada de audio y salida de voz
* **Sube de nivel:** [GLM-5.2](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md) o [Mistral Small 4](/guides/guides_v2-es/modelos-de-lenguaje/mistral-small4.md) cuando 27B no es suficiente
* **Servir:** [vLLM](/guides/guides_v2-es/modelos-de-lenguaje/vllm.md) · [SGLang](/guides/guides_v2-es/modelos-de-lenguaje/sglang.md) · [Ollama](/guides/guides_v2-es/modelos-de-lenguaje/ollama.md)
* **Ajustarlo:** [Unsloth](/guides/guides_v2-es/entrenamiento/unsloth-finetune.md)

### Enlaces

* [Qwen3.8-27B en Hugging Face](https://huggingface.co/Qwen/Qwen3.8-27B) · [FP8](https://huggingface.co/Qwen/Qwen3.8-27B-FP8) · [GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
* [Receta de vLLM](https://recipes.vllm.ai/Qwen/Qwen3.8-27B) · [Recetario de SGLang](https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B)
* [Blog de Qwen](https://qwenlm.github.io/)
* **Alquila una GPU:** [RTX 4090](https://clore.ai/rent-4090.html) · [RTX 5090](https://clore.ai/rent-5090.html) · [Marketplace](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
