> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md).

# Qwen3.8-27B (плотная VLM, одна карта)

Разверните Qwen3.8-27B на Clore.ai — плотную 27B зрительно-языковую модель Alibaba, которая работает на одной RTX 4090 в Q4 и на одной RTX 5090 в FP8

{% hint style="info" %}
**Статус (август 2026):** Qwen выпустила **Qwen3.8-27B** в **14 августа 2026 г.** под **Apache 2.0**, а официальный FP8-чекпойнт — на следующий день. Веса: [Qwen/Qwen3.8-27B](https://huggingface.co/Qwen/Qwen3.8-27B) и [Qwen/Qwen3.8-27B-FP8](https://huggingface.co/Qwen/Qwen3.8-27B-FP8). Плотная 27B, **нативная зрительно-языковая**, **контекст на 262 144 токена** расширяемый до **1 млн с YaRN**, поддержка с первого дня в vLLM, SGLang и llama.cpp.
{% endhint %}

Большая часть того, что вышло этим летом, не подлежит аренде. GLM-5.2 занимает 756 ГБ в FP8. MiniMax M3 — 854 ГБ. Kimi K3 — 1,5 ТБ и не помещается ни на одну машину, перечисленную на Clore.ai, ни при какой квантизации. Qwen3.8-27B — это противовес: **27 млрд плотных параметров, 15,4 ГБ на Q4, одна карта, один контейнер — и готово.** Это именно та модель, под которую этот маркетплейс и создавался — в последнем снимке было 677 серверов со свободной картой на 24 ГБ или лучше.

Это также не урезанная модель. Она нативно работает с изображениями и видео, предоставляет `reasoning_effort` регулятор, а её гибридный стек внимания делает KV-кэш достаточно маленьким, чтобы длинный контекст на потребительской карте был реалистичным, а не теоретическим.

### Ключевые характеристики

| Параметр             | Значение                                                 |
| -------------------- | -------------------------------------------------------- |
| Параметры            | 27B (плотная)                                            |
| Архитектура          | 64 слоя, гибридный Gated DeltaNet + Gated Attention, MTP |
| Модальность          | Текст, изображение, видео на вход → текст на выход       |
| Нативный контекст    | 262 144 токена                                           |
| Расширенный контекст | 1 000 000 токенов (YaRN)                                 |
| Лицензия             | Apache 2.0                                               |
| Дата выпуска         | 14 августа 2026 г.                                       |
| Веса                 | BF16 55.6GB · FP8 30.9GB · Q4\_K\_S GGUF 15.4GB          |
| Основные инструменты | vLLM, SGLang, llama.cpp, Ollama                          |

### Почему именно эта

* **Она помещается.** Q4 на одной RTX 3090 или 4090 по **$0.07–0.42/ч**; FP8 на RTX PRO 6000 или 2× карты по 24 ГБ
* **Apache 2.0** — коммерческое использование, дообучение и перераспространение без оговорки о выручке, в отличие от Kimi K3 (кастомная лицензия с порогом по выручке) или MiniMax M3 (community-лицензия)
* **Гибридное внимание** — 3 из каждых 4 блоков слоёв — это Gated DeltaNet (линейное внимание), поэтому KV-кэш растёт гораздо медленнее с ростом контекста, чем в стандартном трансформере. Именно это делает контекст 100K+ пригодным для использования на 24 ГБ
* **Визуальная составляющая встроена** — диаграммы, документы, скриншоты и видео длительностью до часа, без отдельного VLM для развёртывания
* **Управление размышлением** — `reasoning_effort` на `низкий` / `средняя` / `xhigh`, плюс `preserve_thinking` чтобы переносить рассуждение между ходами для агентов

***

## Требования

{% hint style="success" %}
**Вся суть в одной карте.** Одна RTX 4090 на Q4 даёт вам мультимодальную модель уровня frontier примерно по цене чашки кофе в день. Переходить на RTX 5090 или RTX PRO 6000 стоит только если вам нужна качество FP8 или очень длинный контекст.
{% endhint %}

|                       | Q4\_K\_S GGUF          | Q8 / FP8                               | BF16                             |
| --------------------- | ---------------------- | -------------------------------------- | -------------------------------- |
| Веса                  | 15.4GB                 | \~31GB                                 | 55.6GB                           |
| GPU                   | 1× RTX 3090/4090 24 ГБ | 1× RTX PRO 6000 96 ГБ, или 2× RTX 5090 | 2× RTX PRO 6000, или 4× RTX 5090 |
| Практический контекст | \~64K                  | \~200K                                 | полные 262K                      |
| Системная RAM         | 32GB                   | 64GB                                   | 96 ГБ                            |
| Диск                  | 25 ГБ                  | 45GB                                   | 80 ГБ                            |
| CUDA                  | 12.8+                  | 12.8+                                  | 12.8+                            |

{% hint style="warning" %}
**Одной RTX 5090 (32 ГБ) недостаточно для FP8.** Сами веса занимают 30,9 ГБ. Нужен запас для KV-кэша и активаций, поэтому для FP8 нужна либо карта на 96 ГБ, либо две GPU. На одной 5090 запускайте Q6 или Q4 — см. [Совместимость CUDA и PyTorch](/guides/guides_v2-ru/nachalo-raboty/cuda-pytorch-compatibility.md) правильный базовый образ для Blackwell.
{% endhint %}

***

## Вариант A — Ollama (самый быстрый путь)

```bash
ollama pull qwen3.8:27b
ollama run qwen3.8:27b

# OpenAI-совместимая конечная точка
ollama serve &
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "qwen3.8:27b",
    "messages": [{"role": "user", "content": "Refactor this handler to use context.Context and add retries."}],
    "temperature": 0.7
  }'
```

Тег по умолчанию — Q4\_K\_M (\~16GB). Используйте `qwen3.8:27b-q8_0` если вы арендовали карту на 96 ГБ.

***

## Вариант B — vLLM (продакшн)

Одна карта 24 ГБ, общественный чекпойнт INT4 AWQ:

```yaml
# docker-compose.yml
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports: ["8000:8000"]
    volumes: [hf_cache:/root/.cache/huggingface]
    command: >
      --model cyankiwi/Qwen3.8-27B-AWQ-INT4
      --max-model-len 65536
      --gpu-memory-utilization 0.92
      --served-model-name qwen3.8-27b
      --enable-auto-tool-choice
      --tool-call-parser hermes
    deploy:
      resources:
        reservations:
          devices: [{driver: nvidia, count: 1, capabilities: [gpu]}]
    shm_size: "8gb"
volumes:
  hf_cache:
```

Официально Qwen поставляет только BF16 и FP8. 4-битные чекпойнты — это сборки сообщества — `cyankiwi/Qwen3.8-27B-AWQ-INT4` и `RedHatAI/Qwen3.8-27B-INT4` — самые загружаемые, а `unsloth/Qwen3.8-27B-NVFP4` нацелен именно на карты Blackwell.

FP8 на двух GPU:

```bash
vllm serve Qwen/Qwen3.8-27B-FP8 \\
  --tensor-parallel-size 2 \
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.90 \
  --enable-chunked-prefill
```

Для видео нужен один дополнительный флаг:

```bash
vllm serve Qwen/Qwen3.8-27B --media-io-kwargs '{"video": {"num_frames": -1}}'
```

Преодолейте нативное окно с YaRN:

```bash
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve Qwen/Qwen3.8-27B \\
  --hf-overrides '{"text_config": {"rope_parameters": {"rope_type": "yarn", "factor": 4.0, "original_max_position_embeddings": 262144}}}' \\
  --max-model-len 1000000
```

***

## Вариант C — llama.cpp / GGUF (карты 24 ГБ)

```bash
# Q4_K_S — 15,4 ГБ, комфортно на карте 24 ГБ
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \\
  --include "*UD-Q4_K_S*" --local-dir /workspace/qwen38

llama-server -m /workspace/qwen38/*UD-Q4_K_S*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 -c 65536 --flash-attn
```

Меньшие кванты из того же репозитория, для более тесных карт: `UD-Q3_K_XL` 13.1GB, `UD-Q2_K_XL` 9.8GB, `UD-IQ2_S` 8.4GB.

***

## Усилие на рассуждение

```python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="none")

resp = client.chat.completions.create(
    model="qwen3.8-27b",
    messages=[{"role": "user", "content": "Plan the migration in steps."}],
    extra_body={"reasoning_effort": "xhigh"},   # xhigh (по умолчанию) | medium | low
)
```

Понизьте до `низкий` для классификации, извлечения и маршрутизации — разница в качестве там невелика, а расход токенов — лишь малая часть. Оставьте `xhigh` для агентов и многокроковой работы с кодом.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация    | VRAM   | Режим      | Контекст    | Стоимость Clore.ai |
| --------------- | ------ | ---------- | ----------- | ------------------ |
| **1× RTX 3090** | 24 ГБ  | Q4 GGUF    | \~64K       | **$0.07–0.21/ч**   |
| **1× RTX 4090** | 24 ГБ  | Q4 AWQ     | \~64K       | **$0.14–0.42/ч**   |
| 1× RTX 5090     | 32GB   | Q6 GGUF    | \~96K       | $0.25–0.77/ч       |
| 2× RTX 5090     | 64GB   | FP8, TP=2  | \~200K      | $0.50–1.54/ч       |
| 1× RTX PRO 6000 | 96 ГБ  | FP8        | полные 262K | $0.92–1.38/ч       |
| 4× RTX 5090     | 128 ГБ | BF16, TP=4 | полные 262K | $1.00–3.08/ч       |

{% hint style="success" %}
**Лучшее соотношение цены и качества:** одна [RTX 4090 от $0.14/ч](https://clore.ai/rent-4090.html) на Q4. Если цена всего комплекса выглядит высокой, помните, что большинство многопроцессорных конфигураций позволяют [частичную аренду](/guides/guides_v2-ru/nachalo-raboty/partial-gpu-rental.md) — можно взять одну карту из восьмикартового блока.
{% endhint %}

***

## Бенчмарки

{% hint style="warning" %}
Приведённые ниже цифры — собственные данные Qwen из карточки модели от 14 августа 2026 года. Независимые воспроизведения на момент написания всё ещё продолжали появляться.
{% endhint %}

Qwen сравнивает 27B с гораздо более крупными моделями на кодинговых и агентных наборах (SWE-bench Pro, DeepSWE, QwenSWEBench) с использованием Claude Code harness при контексте 256K. Важное для развёртывания утверждение — не один-единственный балл: важно, что плотная 27B, работающая на одной потребительской карте, оказывается в той же лиге, что и MoE-модели, которым нужен целый серверный шкаф. Рассматривайте таблицу вендора как стартовую гипотезу и бенчмаркните на своём наборе задач — здесь это дёшево, поскольку час работы 4090 стоит примерно двадцать центов.

***

## Сценарии использования

* **Ассистент для программирования на одной GPU** — один контейнер, одна карта, OpenAI-совместимая конечная точка
* **Понимание документов и скриншотов** — нативное зрение, без отдельного пайплайна
* **Анализ видео** — видео длительностью до часа за один проход с флагом кадров vLLM
* **RAG на длинном контексте** — нативные 262K, а гибридное внимание делает KV-кэш доступным по цене
* **Агентные исполнители** — `preserve_thinking` сохраняет связность рассуждений между вызовами инструментов
* **On-prem и в изолированной среде** — Apache 2.0, ничего не отправляет домой
* **Дообучение LoRA** — плотная 27B хорошо подходит для [Unsloth](/guides/guides_v2-ru/obuchenie/unsloth-finetune.md) и [LLaMA-Factory](/guides/guides_v2-ru/obuchenie/llama-factory.md) на одной карте 24 ГБ

***

## Устранение неполадок

| Проблема                             | Исправьте                                                                                                                            |
| ------------------------------------ | ------------------------------------------------------------------------------------------------------------------------------------ |
| `нет доступного образа ядра` на 5090 | Старая сборка CUDA — используйте образ cu128, см. [совместимость](/guides/guides_v2-ru/nachalo-raboty/cuda-pytorch-compatibility.md) |
| OOM при FP8 на одной RTX 5090        | Ожидается: 30,9 ГБ весов на карте 32 ГБ. Используйте Q6/Q4 или TP=2                                                                  |
| OOM при длинном контексте на 24 ГБ   | Уменьшите `--max-model-len` до 32768, или опустите до `UD-Q3_K_XL`                                                                   |
| YaRN отклонён                        | Требуется свежий vLLM/SGLang; пропустите это через `--hf-overrides`, а не как отдельный флаг                                         |
| Входное видео проигнорировано        | Добавьте `--media-io-kwargs '{"video": {"num_frames": -1}}'` (только vLLM)                                                           |
| Вызовы инструментов отброшены        | `--enable-auto-tool-choice --tool-call-parser hermes`                                                                                |
| Качество падает после \~600K         | YaRN расширяет позиции, а не понимание — держите критически важный контент ближе к концу промпта                                     |

***

## Дальнейшие шаги

* **Предшественник:** [Qwen3.6-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen36-27b.md) — плотную 27B из апреля, которую она заменяет
* **Мультимодальный собрат:** [Qwen3.5-Omni](/guides/guides_v2-ru/yazykovye-modeli/qwen35-omni.md) — добавляет ввод аудио и вывод речи
* **Переходите:** [GLM-5.2](/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md) или [Mistral Small 4](/guides/guides_v2-ru/yazykovye-modeli/mistral-small4.md) когда 27B недостаточно
* **Развёртывание:** [vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) · [SGLang](/guides/guides_v2-ru/yazykovye-modeli/sglang.md) · [компонент](/guides/guides_v2-ru/yazykovye-modeli/ollama.md)
* **Дообучите её:** [Unsloth](/guides/guides_v2-ru/obuchenie/unsloth-finetune.md)

### Ссылки

* [Qwen3.8-27B на Hugging Face](https://huggingface.co/Qwen/Qwen3.8-27B) · [FP8](https://huggingface.co/Qwen/Qwen3.8-27B-FP8) · [GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
* [рецепт vLLM](https://recipes.vllm.ai/Qwen/Qwen3.8-27B) · [Руководство SGLang](https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B)
* [Блог Qwen](https://qwenlm.github.io/)
* **Арендовать GPU:** [RTX 4090](https://clore.ai/rent-4090.html) · [RTX 5090](https://clore.ai/rent-5090.html) · [Маркетплейс](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
