> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mistral-small4.md).

# Mistral Small 4 (119B MoE, 6.5B активных)

Разверните Mistral Small 4 (119B MoE, 6.5B активных) на двух потребительских GPU из маркетплейса Clore.ai — Apache 2.0, контекст 256K, зрение и рассуждение в одной модели

{% hint style="info" %}
**Статус (август 2026):** Выпущен Mistral **Small 4** на **16 марта 2026** под **Apache 2.0**. Веса: [mistralai/Mistral-Small-4-119B-2603](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603). **119B параметров всего, из них активны только 6,5B** (128 экспертов, 4 активных на токен), **контекст 256K**, нативный **зрение**, и переключатель рассуждений для каждого запроса. Это объединяет три предыдущие линии Mistral — Instruct, рассуждения Magistral и кодирование Devstral — в один чекпоинт.
{% endhint %}

«Small» — неудачное название по числу параметров и абсолютно точное по стоимости. Только **6,5B параметров активируются на токен**, поэтому скорость декодирования ощущается как у модели 7B, а качество приходит из пула на 119B. При квантизации до Q2 это **40 ГБ** — две RTX 4090, для которых на маркетплейсе Clore.ai есть свободная ёмкость на 322 сервера. При Q3–Q4 это 54–59 ГБ, комфортно на двух RTX 5090.

Если вам нужна одна открытая модель, которая мгновенно отвечает на простые запросы, думает глубже, когда её просят, читает изображения и пишет код, то сейчас это лучший вариант для железа, которое реально можно арендовать по минутам.

### Ключевые характеристики

| Параметр             | Значение                                                                               |
| -------------------- | -------------------------------------------------------------------------------------- |
| Параметры            | 119B всего, 6,5B активны (128 экспертов, 4 активных)                                   |
| Модальность          | Текст + изображение на входе → текст на выходе                                         |
| Контекст             | 262 144 токена (256K)                                                                  |
| Лицензия             | Apache 2.0                                                                             |
| Дата выпуска         | 16 марта 2026                                                                          |
| Веса                 | Официальная \~242 ГБ · Q3\_K\_M GGUF 54 ГБ · Q2\_K\_XL GGUF 40 ГБ                      |
| Рассуждение          | `reasoning_effort`: `нет` (мгновенно) или `высокий` (вычисления во время тестирования) |
| Основные инструменты | vLLM, llama.cpp, Transformers                                                          |

***

## Требования

| Сборка               | Размер  | Настройка Clore.ai                                             |
| -------------------- | ------- | -------------------------------------------------------------- |
| `UD-IQ1_M`           | 32GB    | 1× RTX PRO 6000 96GB или 2× RTX 4090                           |
| `UD-Q2_K_XL`         | 40 ГБ   | **2× RTX 4090 / 3090 (48GB)** — свободно 322 сервера при ≥48GB |
| `UD-Q3_K_M`          | 54GB    | 2× RTX 5090 (64GB)                                             |
| `UD-IQ4_NL`          | 59GB    | 2× RTX 5090 (64GB)                                             |
| Официальный чекпоинт | \~242GB | 8× RTX 5090 (248GB)                                            |

Добавьте запас для KV-кэша: при контексте 256K он значителен даже при таком разреженном MoE. Начните с 32–64K и увеличьте после того, как увидите реальное использование.

***

## Развертывание с llama.cpp (две потребительские карты)

```bash
huggingface-cli download unsloth/Mistral-Small-4-119B-2603-GGUF \
  --include "*UD-Q2_K_XL*" --local-dir /workspace/ms4

llama-server -m /workspace/ms4/*UD-Q2_K_XL*-00001-of-*.gguf \
  --host 0.0.0.0 --port 8080 \
  -ngl 999 --split-mode layer \
  -c 65536 --flash-attn
```

## Развертывание с vLLM

```bash
vllm serve mistralai/Mistral-Small-4-119B-2603 \
  --tensor-parallel-size 8 \
  --tokenizer-mode mistral \
  --config-format mistral \
  --load-format mistral \
  --max-model-len 262144 \
  --enable-expert-parallel
```

Официальная сборка NVFP4 ([`mistralai/Mistral-Small-4-119B-2603-NVFP4`](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603-NVFP4)) ориентирована на карты Blackwell — полезно на системах с RTX серии 50 и RTX PRO 6000.

## Рассуждение по запросу

```python
client.chat.completions.create(
    model="mistral-small-4",
    messages=[{"role": "user", "content": "Найдите взаимную блокировку в этом планировщике."}],
    extra_body={"reasoning_effort": "high"},   # "none" для мгновенных ответов
    temperature=0.7,                            # 0.0–0.7, когда рассуждение отключено
)
```

Mistral рекомендует temperature 0.7 при включённом рассуждении. Когда рассуждение выключено, держитесь между 0.0 и 0.7 в зависимости от того, насколько детерминированным должен быть вывод.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация    | VRAM  | Сборка               | Контекст    | Стоимость Clore.ai |
| --------------- | ----- | -------------------- | ----------- | ------------------ |
| **2× RTX 4090** | 48 ГБ | Q2\_K\_XL            | \~64K       | **$0.28–0.84/ч**   |
| 2× RTX 3090     | 48 ГБ | Q2\_K\_XL            | \~64K       | $0.14–0.42/ч       |
| **2× RTX 5090** | 64GB  | Q3\_K\_M / IQ4\_NL   | \~96K       | **$0.50–1.54/ч**   |
| 1× RTX PRO 6000 | 96 ГБ | Q3\_K\_M, одна карта | \~131K      | $0.92–1.38/ч       |
| 8× RTX 5090     | 248GB | официальный чекпоинт | полные 256K | \~$2.00–3.50/ч     |

{% hint style="success" %}
**Пара RTX 3090 — это самый выгодный вариант** — 48GB видеопамяти примерно за $0.14–0.42/ч всего, при запуске модели 119B. Используйте [частичную аренду GPU](/guides/guides_v2-ru/nachalo-raboty/partial-gpu-rental.md) чтобы взять две карты из более крупной системы вместо того, чтобы искать отдельную двухпроцессорную конфигурацию с 3090.
{% endhint %}

***

## Сценарии использования

* **Одна модель для всего продукта** — чат, кодирование и рассуждение без трёх отдельных развёртываний
* **Извлечение из документов и изображений** — зрение плюс контекст 256K позволяют работать с длинными отсканированными документами
* **Кодирующие агенты с ограниченным бюджетом** — наследник Devstral, с 6,5B активных параметров на токен
* **Сервинг с градацией по задержке** — `reasoning_effort: none` для быстрого пути, `высокий` для сложного пути, тот же эндпоинт
* **Коммерческие продукты** — Apache 2.0, без оговорки о доходах и без региональных ограничений

***

## Устранение неполадок

| Проблема                           | Исправьте                                                                                                                 |
| ---------------------------------- | ------------------------------------------------------------------------------------------------------------------------- |
| Ошибки токенизатора vLLM           | Моделям Mistral нужны `--tokenizer-mode mistral --config-format mistral --load-format mistral`                            |
| OOM при 256K                       | Причина — KV-кэш, а не веса — уменьшите `--max-model-len`                                                                 |
| Рассуждение никогда не запускается | `reasoning_effort` задаётся для каждого запроса; проверьте, что ваш клиент передаёт `extra_body`                          |
| Медленный первый токен на 2 картах | Разделение слоёв GGUF через PCIe добавляет задержку; предпочитайте системы с линиями x8/x16                               |
| Сборка NVFP4 не загружается        | Требует Blackwell — см. [Совместимость CUDA и PyTorch](/guides/guides_v2-ru/nachalo-raboty/cuda-pytorch-compatibility.md) |

***

## Дальнейшие шаги

* **Младший собрат:** [Mistral Small 3.1](/guides/guides_v2-ru/yazykovye-modeli/mistral-small.md) — плотная 24B, одна карта
* **Старший собрат:** [Mistral Large 3](/guides/guides_v2-ru/yazykovye-modeli/mistral-large3.md) — 675B MoE
* **Плотная альтернатива:** [Qwen3.8-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md) — 27B, одна карта, Apache 2.0
* **Дообучите его:** [Unsloth](/guides/guides_v2-ru/obuchenie/unsloth-finetune.md) · [LLaMA-Factory](/guides/guides_v2-ru/obuchenie/llama-factory.md)

### Ссылки

* [Mistral Small 4 на Hugging Face](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603) · [GGUF](https://huggingface.co/unsloth/Mistral-Small-4-119B-2603-GGUF)
* [Анонс Mistral](https://mistral.ai/news/mistral-small-4/)
* **Арендовать GPU:** [RTX 4090](https://clore.ai/rent-4090.html) · [RTX 5090](https://clore.ai/rent-5090.html) · [Маркетплейс](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mistral-small4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
