> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/qwen35.md).

# Qwen3.5

Qwen3.5, выпущенная 16 февраля 2026 года, — последняя флагманская модель Alibaba и один из самых горячих open-source релизов 2026 года. The **флагманская MoE-модель 397B** обошла Claude 4.5 Opus в математическом бенчмарке HMMT, тогда как меньшая **плотная модель 35B** помещается на одной RTX 4090. Все модели из коробки поддерживают агентные возможности (использование инструментов, вызов функций, автономное выполнение задач) и мультимодальное понимание.

## Ключевые особенности

* **Три размера**: 9B (dense), 35B (dense), 397B (MoE) — вариант для любой GPU
* **Обходит Claude 4.5 Opus** в математическом бенчмарке HMMT
* **Нативно мультимодальная**: Понимание текста + изображений
* **Агентные возможности**: Использование инструментов, вызов функций, автономные рабочие процессы
* **Контекстное окно 128K**: Обработка больших документов и кодовых баз
* **Лицензия Apache 2.0**: Полное коммерческое использование, без ограничений

## Варианты моделей

| Модель       | Параметры | Тип     | VRAM (Q4) | VRAM (FP16) | Сильная сторона              |
| ------------ | --------- | ------- | --------- | ----------- | ---------------------------- |
| Qwen3.5-9B   | 9B        | Плотная | 6 ГБ      | 18 ГБ       | Быстрая, эффективная         |
| Qwen3.5-35B  | 35B       | Плотная | 22 ГБ     | 70 ГБ       | Лучший вариант для одной GPU |
| Qwen3.5-397B | 397B      | MoE     | \~100 ГБ  | 400 ГБ+     | Уровень frontier-класса      |

## Требования

{% hint style="warning" %}
**Многопроцессорные установки класса 80 ГБ GPU не указаны на маркетплейсе Clore.ai.** Самые крупные доступные сейчас конфигурации — 4× RTX PRO 6000 Blackwell (по 96 ГБ, всего 380 ГБ) и 8–11× RTX 5090 (по 32 ГБ). Возможности A100 / H200 / B200 продаются как [bare metal](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед тем, как подбирать конфигурацию для развёртывания.
{% endhint %}

| Компонент | 9B (Q4)       | 35B (Q4)      | 397B (много GPU) |
| --------- | ------------- | ------------- | ---------------- |
| GPU       | RTX 3080 10GB | RTX 4090 24GB | 4× H100 80GB     |
| VRAM      | 8 ГБ          | 22 ГБ         | 320 ГБ+          |
| ОЗУ       | 16 ГБ         | 32 ГБ         | 128 ГБ           |
| Диск      | 15 ГБ         | 30 ГБ         | 250 ГБ           |

**Рекомендуемая GPU от Clore.ai**: RTX 4090 24GB ($0.14–0.42/ч) для 35B — лучшее качество за свои деньги

## Быстрый старт с Ollama

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 9B — работает на чём угодно (8 ГБ VRAM)
ollama run qwen3.5:9b

# Квантованная 35B — нужна RTX 4090 (24 ГБ)
ollama run qwen3.5:35b

# Как API-сервер
ollama serve &
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:35b",
    "messages": [{"role": "user", "content": "Решите это: если f(x) = x^3 - 3x + 1, найдите все действительные корни"}]
  }'
```

## Настройка vLLM (production)

```bash
pip install vllm

# 35B на одной GPU
vllm serve Qwen/Qwen3.5-35B-Instruct \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.90

# 9B с длинным контекстом
vllm serve Qwen/Qwen3.5-9B-Instruct \
  --max-model-len 65536

# 397B на многопроцессорном кластере
vllm serve Qwen/Qwen3.5-397B-A45B-Instruct \
  --tensor-parallel-size 8 \
  --max-model-len 32768
```

## HuggingFace Transformers

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3.5-35B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True  # Помещает 35B в 24 ГБ
)

messages = [
    {"role": "system", "content": "Вы — полезный преподаватель математики."},
    {"role": "user", "content": "Докажите, что квадратный корень из 2 иррационален."}
]

input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(input_ids, max_new_tokens=2048, temperature=0.7, do_sample=True)
print(tokenizer.decode(output[0][input_ids.shape[-1]:], skip_special_tokens=True))
```

## Пример агентного / инструментального использования

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

tools = [{
    "type": "function",
    "function": {
        "name": "get_gpu_price",
        "description": "Получить текущую цену аренды GPU-модели на Clore.ai",
        "parameters": {
            "type": "object",
            "properties": {
                "gpu_model": {"type": "string", "description": "Название GPU-модели, например RTX 4090"}
            },
            "required": ["gpu_model"]
        }
    }
}]

response = client.chat.completions.create(
    model="qwen3.5:35b",
    messages=[{"role": "user", "content": "Какая самая дешёвая GPU, которую я могу арендовать для запуска модели 7B?"}],
    tools=tools,
    tool_choice="auto"
)

# Qwen3.5 вызовет get_gpu_price с соответствующими параметрами
print(response.choices[0].message)
```

## Почему Qwen3.5 на Clore.ai?

Модель 35B, пожалуй, **лучшая модель, которую можно запустить на одной RTX 4090**:

* Обходит Llama 4 Scout в математике и рассуждениях
* Обходит Gemma 3 27B в агентных задачах
* Использование инструментов / вызов функций работает из коробки
* Apache 2.0 = никаких проблем с лицензией

За $0.14–0.42/ч за RTX 4090 вы получаете ИИ уровня frontier-класса по цене чашки кофе.

## Советы для пользователей Clore.ai

* **35B — золотая середина**: Помещается на RTX 4090 в Q4, превосходит большинство моделей 70B
* **9B для экономного варианта**: Даже RTX 3060 ($0.03–0.07/ч) хорошо запускает модель 9B
* **Используйте Ollama для быстрого старта**: Одна команда для запуска; API, совместимый с OpenAI, включён
* **Агентные рабочие процессы**: Qwen3.5 отлично справляется с использованием инструментов — объединяйте с вызовом функций для автоматизации
* **Свежая модель = меньше в кеше**: Первое скачивание занимает время (\~20 ГБ для 35B). Сделайте предварительную загрузку до начала рабочей нагрузки

## Устранение неполадок

| Проблема                        | Решение                                                                          |
| ------------------------------- | -------------------------------------------------------------------------------- |
| 35B OOM на 24 ГБ                | Используйте `load_in_4bit=True` или уменьшите `--max-model-len`                  |
| Модель Ollama не найдена        | Обновите Ollama: `curl -fsSL https://ollama.com/install.sh \| sh`                |
| Медленно при первом запросе     | Загрузка модели занимает 30–60 с; последующие запросы быстрые                    |
| Вызовы инструментов не работают | Убедитесь, что вы передаёте `tools` параметр; используйте только instruct-версию |

## Дополнительное чтение

* [Блог Qwen](https://qwenlm.github.io/)
* [Модели HuggingFace](https://huggingface.co/Qwen)
* [Библиотека Ollama](https://ollama.com/library/qwen3.5)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/qwen35.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
