> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/qwen36-27b.md).

# Qwen3.6-27B (плотная, одна GPU)

{% hint style="info" %}
**Статус (апрель 2026):** Qwen3.6-27B был выпущен Alibaba на **21 апреля 2026 года** под **Apache 2.0** лицензии. Веса доступны по адресу [huggingface.co/Qwen/Qwen3.6-27B](https://huggingface.co/Qwen/Qwen3.6-27B). Это **плотная** модель 27B — не MoE — с **нативным контекстом на 262K токенов** , который расширяется до **1M токенов с YaRN**, а также с поддержкой с первого дня в vLLM, SGLang и Ollama.
{% endhint %}

Гигантские MoE-модели 2026 года — DeepSeek V4, GLM-5.1, MiMo-V2.5-Pro — впечатляют на бенчмарках, но в практике оказываются тяжёлыми: сотни ГБ весов, стойки с несколькими GPU, хрупкие ядра маршрутизации экспертов и счета за инференс, от которых финансовые команды вздрагивают. Qwen3.6-27B идёт в противоположном направлении. Это **плотная**, каждый параметр активируется на каждом токене, потребление VRAM предсказуемо до гигабайта, и нет сюрпризов с маршрутизацией экспертов, когда вы переходите за контекст 8K.

Для большинства команд вопрос не в том, «можем ли мы обслуживать MoE на 744B» — а в том, «можем ли мы поставить в кластер одну хорошую карту и обслуживать на ней ассистента для кодинга фронтирного класса?» Qwen3.6-27B создан именно для этого. Q4 помещается на одной **RTX 4090 24GB**, Q8 помещается на одной **RTX 5090 32GB**, BF16 помещается на одной **L40S 48GB** или **A100 40 ГБ**, а Alibaba публикует **77,2% на SWE-Bench Verified** (по утверждению вендора). Одна карта, один контейнер, одна модель.

### Ключевые характеристики

| Параметр             | Значение                           |
| -------------------- | ---------------------------------- |
| Параметры            | 27B (плотная)                      |
| Архитектура          | Плотный трансформер только-декодер |
| Нативный контекст    | 262 144 токена                     |
| Расширенный контекст | 1 000 000 токенов (YaRN)           |
| Лицензия             | Apache 2.0                         |
| Дата выпуска         | 21 апреля 2026 года                |
| Организация          | Alibaba (команда Qwen)             |
| Основные инструменты | vLLM, SGLang, Ollama, llama.cpp    |

### Почему Qwen3.6-27B?

* **Экономика одной GPU** — Q4 на RTX 4090 от **$0.14–0.42/ч** на Clore.ai; не нужно отлаживать оркестрацию тензорного параллелизма
* **Плотная, не MoE** — фиксированное VRAM, без горячих точек у экспертов, без скачков задержки на отдельных запросах
* **Apache 2.0** — полностью коммерческое, поддаётся дообучению, можно перераспределять, без ограничений на использование
* **262K нативного контекста, 1M с YaRN** — целые кодовые базы, полные книги, часы транскриптов за один проход
* **vLLM / SGLang / Ollama с первого дня** — выбирайте стек обслуживания; Qwen выпустила конфигурации для всех трёх на релизе
* **77,2% SWE-Bench Verified** (по утверждению вендора) — конкурентоспособно с гораздо более крупными MoE-моделями на реальных задачах кодинга

***

## Требования

{% hint style="success" %}
**Вся суть в том, что эта модель прощает ошибки.** Одна RTX 4090 с маркетплейса Clore.ai достаточно, чтобы запускать Qwen3.6-27B с качеством уровня продакшена (Q4) или на скоростях «достаточно хорошо для большинства сценариев». Никаких проблем с несколькими GPU.
{% endhint %}

| Компонент          | Q4 (GGUF / AWQ)  | Q8 (GGUF / GPTQ) | BF16                          | Полный FP16                 |
| ------------------ | ---------------- | ---------------- | ----------------------------- | --------------------------- |
| GPU                | 1× RTX 4090 24GB | 1× RTX 5090 32GB | 1× L40S 48GB или 1× A100 40GB | 1× A100 80GB                |
| Использование VRAM | \~16–18GB        | \~28–30GB        | \~54GB                        | \~54GB + запас под KV cache |
| ОЗУ                | 32GB             | 32GB             | 64GB                          | 96 ГБ                       |
| Диск               | 20GB NVMe        | 32GB NVMe        | 60GB NVMe                     | 60GB NVMe                   |
| CUDA               | 12.8+            | 12.8+            | 12.8+                         | 12.8+                       |

**Выбор Clore.ai:** Для 90% команд одна **RTX 4090 24GB** запущенная в Q4 (AWQ или GGUF) — правильный ответ. Вы получаете кодовую модель фронтирного класса по цене пары кофе в день. Переходите на RTX 5090 32GB, если хотите Q8 ради чуть лучшего качества, или на L40S / A100 40GB для полного BF16-продакшен-инференса.

***

## Вариант A — Ollama (квантованная, самый простой)

Ollama — это самый быстрый путь от «у меня есть GPU на Clore.ai» до «у меня есть чат-эндпоинт».

```bash
# Получить Qwen3.6-27B (по умолчанию Q4_K_M, загрузка ~17GB)
ollama pull qwen3.6:27b

# Запустить интерактивно
ollama run qwen3.6:27b

# Или открыть API, совместимый с OpenAI
ollama serve &

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "qwen3.6:27b",
    "messages": [
      {"role": "system", "content": "Вы — старший Go-инженер."},
      {"role": "user", "content": "Рефакторни этот обработчик, чтобы корректно использовать context.Context, и добавь повторные попытки с экспоненциальной задержкой."}
    ],
    "temperature": 0.6
  }'
```

{% hint style="info" %}
Тег по умолчанию `qwen3.6:27b` в Ollama соответствует Q4\_K\_M. Используйте `qwen3.6:27b-q8_0` для Q8, если у вас RTX 5090, или `qwen3.6:27b-fp16` для полной точности (нужен A100 80GB).
{% endhint %}

***

## Вариант B — vLLM (продакшен)

vLLM — рекомендуемый продакшен-сервер. Приведённая ниже конфигурация для одной GPU рассчитана на RTX 4090 с квантованием AWQ. Раздел с несколькими GPU приведён для полноты — но для плотной модели 27B он почти никогда не нужен.

```yaml
# docker-compose.yml — одна RTX 4090, Q4 AWQ
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model Qwen/Qwen3.6-27B-Instruct-AWQ
      --quantization awq
      --max-model-len 65536
      --gpu-memory-utilization 0.92
      --served-model-name qwen3.6-27b
      --enable-auto-tool-choice
      --tool-call-parser hermes
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    shm_size: "8gb"

volumes:
  hf_cache:
```

```bash
# Проверить API
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "qwen3.6-27b",
    "messages": [
      {"role": "user", "content": "Объясни разницу между MoE и плотными моделями в 3 пунктах."}
    ],
    "max_tokens": 512,
    "temperature": 0.7
  }'
```

Для полного **BF16** на одном L40S 48GB или A100 40GB, уберите `--quantization awq` и укажите базовый чекпоинт (`Qwen/Qwen3.6-27B-Instruct`, `--dtype bfloat16`, `--max-model-len 131072`). Для 2× RTX 4090 с тензорным параллелизмом (больший контекст, больший KV cache) добавьте `--tensor-parallel-size 2`.

***

## Вариант C — SGLang

SGLang особенно хорош, когда вы выходите за пределы нативного окна 262K с YaRN. Передайте `--rope-scaling` чтобы расширить до \~1M токенов.

```bash
docker pull lmsysorg/sglang:latest

# Одна GPU, нативный контекст 262K
python3 -m sglang.launch_server \
  --model-path Qwen/Qwen3.6-27B-Instruct \\
  --quantization awq \\
  --context-length 262144 \\
  --mem-fraction-static 0.90 \\
  --served-model-name qwen3.6-27b

# YaRN-расширение до 1M токенов (нужен больший запас VRAM)
python3 -m sglang.launch_server \
  --model-path Qwen/Qwen3.6-27B-Instruct \\
  --dtype bfloat16 \\
  --context-length 1000000 \\
  --json-model-override-args '{"rope_scaling":{"type":"yarn","factor":4.0,"original_max_position_embeddings":262144}}' \\
  --mem-fraction-static 0.85
```

{% hint style="warning" %}
**Стоимость контекста 1M быстро растёт.** Даже с YaRN KV cache для 1M токенов при BF16 составляет примерно **40–60GB** в зависимости от размера батча. Если вы действительно собираетесь заполнять окно, планируйте A100 80GB или H100.
{% endhint %}

***

## Рекомендации по GPU для Clore.ai

| Конфигурация         | VRAM  | Режим       | Ожидаемая производительность          | Стоимость на Clore.ai                       |
| -------------------- | ----- | ----------- | ------------------------------------- | ------------------------------------------- |
| **1× RTX 4090 24GB** | 24 ГБ | Q4 AWQ      | 50–80 ток/с, контекст 64K             | **$0.14–0.42/ч**                            |
| 1× RTX 5090 32GB     | 32GB  | Q8 GPTQ     | 60–90 ток/с, контекст 96K             | $0.25–0.77/ч                                |
| 1× L40S 48GB         | 48 ГБ | BF16        | 35–55 ток/с, контекст 131K            | \~$0.50/ч                                   |
| 1× A100 40GB         | 40 ГБ | BF16        | 40–60 ток/с, контекст 96K             | [голое железо](https://clore.ai/bare-metal) |
| 1× A100 80GB         | 80 ГБ | FP16 + 262K | 40–60 ток/с, полный нативный контекст | [голое железо](https://clore.ai/bare-metal) |
| 2× RTX 4090          | 48 ГБ | BF16 TP=2   | 60–80 ток/с, контекст 262K            | $0.28–0.84/ч                                |

{% hint style="success" %}
**Лучшее соотношение цены и качества, и с большим отрывом:** [1× RTX 4090 от $0.14–0.42/ч](https://clore.ai/rent-4090.html) запущенная в Q4 AWQ через Ollama или vLLM. Вы получаете кодовую модель фронтирного класса на одной потребительской карте дешевле, чем стоит в день подписка Claude Pro.
{% endhint %}

***

## Сценарии использования

* **Продакшен-развёртывания на одной GPU** — один контейнер на одной Clore.ai 4090, и у вас есть настоящий ассистент для кодинга
* **Агенты для кодинга** — 77,2% SWE-Bench Verified (по утверждению вендора) помещает её в категорию «полезно для автономных PR»
* **RAG на длинном контексте** — 262K нативного контекста хватает для целых кодовых баз или недель логов чатов
* **Анализ на 1M токенов** — с YaRN можно поместить целую книгу или многомесячный git-журнал в один промпт
* **Локально / в изолированном контуре** — Apache 2.0 поставляется вместе с продуктом, без зависимости от API
* **Тонкая настройка на периферии** — плотная модель 27B хорошо подходит для LoRA/QLoRA на одной карте
* **Исполнительный агент в системе «agent-of-agents»** — используйте как рабочего агента вместе с более крупным MoE-планировщиком, например [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md)

***

## Бенчмарки

{% hint style="warning" %}
**Утверждения вендора — проверяйте независимо.** Приведённые ниже числа взяты из поста Alibaba от 21 апреля 2026 года. Независимые воспроизведения (Aider, BigCodeBench, таблицы лидеров LiveCodeBench) всё ещё появляются.
{% endhint %}

| Бенчмарк           | Qwen3.6-27B | Qwen3.5-35B | Gemma 3 27B | Llama 4 Scout |
| ------------------ | ----------- | ----------- | ----------- | ------------- |
| SWE-Bench Verified | **77.2%**   | \~71%       | \~58%       | \~54%         |
| HumanEval          | \~93%       | \~92%       | \~90%       | \~88%         |
| LiveCodeBench      | \~68%       | \~65%       | \~55%       | \~52%         |
| MMLU-Pro           | \~78%       | \~76%       | \~74%       | \~72%         |
| MATH               | \~87%       | \~85%       | \~78%       | \~76%         |

Главное число — это **SWE-Bench Verified 77,2%** — это выводит одну плотную модель на одной GPU в область, ранее зарезервированную для систем MoE на нескольких GPU. Считайте это заявлением вендора, пока LMSYS / доски Aider не подтвердят.

***

## Устранение неполадок

| Проблема                               | Решение                                                                                                       |
| -------------------------------------- | ------------------------------------------------------------------------------------------------------------- |
| OOM на RTX 4090 (Q4)                   | Уменьшите `--max-model-len` до 32768; AWQ при 65K ctx находится прямо на грани 24GB                           |
| `qwen3.6:27b` не найден в Ollama       | Обновите Ollama; тег появился в конце апреля 2026 года                                                        |
| Конфигурация YaRN отклонена vLLM       | Требуется vLLM ≥ 0.7.x; передавайте через `--rope-scaling` JSON, а не отдельные флаги                         |
| Вызовы инструментов тихо отбрасываются | Добавьте `--enable-auto-tool-choice --tool-call-parser hermes` в vLLM                                         |
| Медленный prefill на длинном контексте | Добавьте `--enable-chunked-prefill` и уменьшите размер батча                                                  |
| OOM KV cache при 262K                  | Понизьте до Q8 или перейдите на L40S 48GB / A100 80GB                                                         |
| Плохое качество около 1M ctx           | YaRN расширяет позиции, но качество деградирует после \~600K; держите критически важный контент ближе к концу |

***

## Дальнейшие шаги

* **Предшественник:** [Qwen3.5](/guides/guides_v2-ru/yazykovye-modeli/qwen35.md) — Qwen3.6-27B — плотный преемник; та же семья, более точный кодинг, более длинный нативный контекст
* **Мультимодальный собрат:** [Qwen3.5-Omni](/guides/guides_v2-ru/yazykovye-modeli/qwen35-omni.md) — текст + аудио + изображение + видео, если вам нужно больше, чем текст
* **Похожий класс плотных 27B:** [Gemma 3](/guides/guides_v2-ru/yazykovye-modeli/gemma3.md) — 27B плотный конкурент Google, хорошая базовая точка для сравнения
* **MoE-альтернатива:** [Llama 4 Scout](/guides/guides_v2-ru/yazykovye-modeli/llama4.md) — MoE на одной GPU, если хотите сравнить архитектуры
* **Шаг вперёд в сторону frontier MoE:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — когда плотной 27B уже недостаточно и у вас есть бюджет на несколько GPU

### Ссылки

* [Qwen3.6-27B на HuggingFace](https://huggingface.co/Qwen/Qwen3.6-27B)
* [Qwen GitHub](https://github.com/QwenLM/Qwen)
* [Блог Qwen](https://qwenlm.github.io/)
* [Документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)
* [Библиотека Ollama](https://ollama.com/library/qwen3.6)
* **Арендовать GPU:** [RTX 4090 от $0.14–0.42/ч](https://clore.ai/rent-4090.html) · [RTX 5090 32GB](https://clore.ai/rent-5090.html) · [Маркетплейс](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/qwen36-27b.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
