> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mistral-medium35.md).

# Mistral Medium 3.5 (128B, плотная, 256K)

{% hint style="info" %}
**Статус (апрель 2026):** Mistral Medium 3.5 был выпущен **29 апреля 2026 года** компанией Mistral AI как преемник Mistral Medium 3. Весы доступны по адресу [huggingface.co/mistralai/Mistral-Medium-3.5](https://huggingface.co/mistralai/Mistral-Medium-3.5) под **Лицензия Mistral Research License (MRL)** для исследований;  **Лицензия Mistral Commercial License** требуется для использования в production за пределами оценки. vLLM (≥ 0.8.x) и SGLang поддерживают его с первого дня.
{% endhint %}

Mistral Medium 3.5 — это **плотный трансформер на 128B** с **контекстным окном на 256K токенов** и **встроенным переключателем режима рассуждения** который переключается между быстрыми ответами «instant» и более длинными цепочками рассуждений «deep» в одной и той же контрольной точке. Релиз объединяет три ранее отдельных линейки Mistral — **Medium 3** (общие инструкции), **Codestral** (код) и превью рассуждений Mistral — в одну переключаемую модель, что и является главным изменением для инженерных команд, которым приходилось управлять несколькими весами.

Для пользователей Clore.ai практическое следствие — размер модели. Плотная модель 128B в FP8 весит примерно **128 ГБ** до KV-кэша, так что **не** не помещается на одной GPU на 80 ГБ в полной точности — вам нужны **4× H100 80 ГБ** (FP8) или **2× H200 141 ГБ** чтобы обслуживать её корректно через vLLM. На маркетплейсе это выходит примерно [**голое железо**](https://clore.ai/bare-metal) за конфигурацию 4× H100 или **\~$4.16/ч** за 2× H200, что является оптимальным вариантом для большинства команд. Развёртывания на одном H100 работают только с агрессивной квантизацией Q4 GGUF (\~70 tok/s через llama.cpp), и контекст 256K — первое, что исчезает при сжатии.

## Ключевые особенности

* **Плотные параметры 128B** — никаких трюков с маршрутизацией MoE, предсказуемый профиль VRAM и задержки, легче дообучать, чем разреженные модели
* **контекстное окно 256K** — полный анализ кодовой базы, RAG по длинным документам, многоходовые циклы агента без обрезки
* **Два режима рассуждения** — переключатель `reasoning_mode=instant` для задержки уровня чата или `reasoning_mode=deep` чтобы показать `<think>` трассировку перед ответом
* **Объединённые инструкции + код + рассуждение** — один набор весов заменяет Medium 3 + Codestral + превью рассуждений
* **Вызов функций и структурированные ответы** — нативное соблюдение JSON-схемы, формат вызова инструментов, совместимый с OpenAI
* **Открытые веса** — MRL для исследований, коммерческая лицензия доступна; веса остаются у вас и никогда не ходят туда-обратно через API вендора
* **Поддержка vLLM и SGLang с первого дня** — готовые к production пути FP8, тензорный параллелизм, chunked prefill, непрерывная пакетная обработка

## Режимы рассуждения

Medium 3.5 — первая модель Mistral, которая поставляется с одной контрольной точкой, обслуживающей как быстрые, так и «думающие» ответы. Переключатель управляется во время запроса, а не при загрузке, поэтому один процесс vLLM обслуживает оба режима для одного и того же клиента.

| Режим                    | Когда использовать                                                                             | Типичный TTFT                  | Форма вывода                                            |
| ------------------------ | ---------------------------------------------------------------------------------------------- | ------------------------------ | ------------------------------------------------------- |
| `instant` (по умолчанию) | Чат, автодополнение, классификация, вызовы функций, где важна задержка                         | 50–250 мс                      | Только ответ                                            |
| `deep`                   | Проверка кода, многошаговое планирование, математика, сложная отладка, шаг планирования агента | 1–6 с до первого токена ответа | `<think>...</think>` трассировка, затем финальный ответ |

В `deep` в этом режиме модель выдаёт скрытый фрагмент рассуждений (обёрнутый в `<think>...</think>` шаблоном чата) перед видимым ответом. Это стоит от нескольких сотен до нескольких тысяч дополнительных токенов за ход, поэтому **не включайте это для каждого запроса** — используйте это только для задач, где иначе вы бы попросили меньшую модель «подумать шаг за шагом». Разумный подход — оставить `instant` как значение по умолчанию и повышать только до `deep` для шагов планирования вызова инструментов или синтеза финального ответа.

{% hint style="warning" %}
**Сэмплинг, рекомендованный вендором.** Mistral рекомендует `temperature=0.15` для `instant` и `temperature=0.7` с `top_p=0.95` для `deep` режима. Сэмплинг с нулевой температурой обычно преждевременно обрезает трассы рассуждений.
{% endhint %}

## Выберите свой вариант развёртывания

Три реалистичные конфигурации на маркетплейсе Clore.ai. Сначала выбирайте по бюджету VRAM, затем по пропускной способности.

| Конфигурация                                                                                                        | Точность            | Общий объём VRAM | Контекст (практический) | Пропускная способность | Рекомендуемый уровень Clore                 | Примечания                                                         |
| ------------------------------------------------------------------------------------------------------------------- | ------------------- | ---------------- | ----------------------- | ---------------------- | ------------------------------------------- | ------------------------------------------------------------------ |
| 1× H100 80 ГБ                                                                                                       | Q4 GGUF (llama.cpp) | 80 ГБ            | 32K–64K                 | \~50–70 tok/s          | Одна GPU, оценка/разработка                 | Агрессивная квантизация; качество на длинном коде немного теряется |
| 4× [H100](https://clore.ai/rent-h100.html?utm_source=docs\&utm_medium=guide\&utm_campaign=mistral-medium-35) 80 ГБ  | FP8 (vLLM)          | 320 ГБ           | Полные 256K             | \~80–140 tok/s         | **Оптимальный вариант для production**      | TP=4, лучший tok/$ для стабильного трафика                         |
| 2× [H200](https://clore.ai/rent-h200.html?utm_source=docs\&utm_medium=guide\&utm_campaign=mistral-medium-35) 141 ГБ | FP8 или BF16        | 282 ГБ           | Полные 256K             | \~90–130 tok/s         | Высокий контекст, меньше GPU для управления | Проще топология, запас для KV-кэша на 256K                         |

{% hint style="success" %}
**Выбор по умолчанию:** **4× H100 80 ГБ FP8** через vLLM. Вы получаете полный контекст 256K, \~100 tok/s в устойчивом режиме, API, совместимый с OpenAI, и аккуратное масштабирование тензорного параллелизма — примерно за дневную стоимость одного дорогого места Claude Opus.
{% endhint %}

## Требования к серверу

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

| Компонент     | Минимум (Q4, одна GPU)       | Рекомендуется (FP8, 4× H100)            | Высокий контекст (2× H200) |
| ------------- | ---------------------------- | --------------------------------------- | -------------------------- |
| VRAM GPU      | 80 ГБ (1× H100)              | 4× 80 ГБ = 320 ГБ                       | 2× 141 ГБ = 282 ГБ         |
| Системная RAM | 128 ГБ                       | 256 ГБ                                  | 256 ГБ                     |
| Диск (NVMe)   | 200 ГБ                       | 400 ГБ                                  | 400 ГБ                     |
| Сеть          | 1 Гбит/с+ для загрузки из HF | 1 Гбит/с+                               | 1 Гбит/с+                  |
| CUDA          | 12.8+                        | 12.8+                                   | 12.8+                      |
| Драйвер       | ≥ 555                        | ≥ 555                                   | ≥ 555                      |
| Время запуска | 3–6 мин (холодная загрузка)  | 6–12 мин (холодная загрузка, 4 shard'а) | 5–10 мин                   |

Первый холодный запуск в основном зависит от загрузки с HuggingFace — веса FP8 весят примерно **128 ГБ**, а BF16 ближе к **256 ГБ**. Смонтируйте постоянный том на `/root/.cache/huggingface` так вы заплатите за эту полосу пропускания только один раз на сервер.

## Быстрое развертывание на CLORE.AI

Самый быстрый путь — официальный `vllm/vllm-openai` образ с тензорным параллелизмом, выставленным в число ваших GPU. Пример ниже предполагает инстанс 4× H100.

**Docker-образ:**

```
vllm/vllm-openai:latest
```

**Порты:**

```
22/tcp
8000/http
```

**Команда запуска (4× H100, FP8):**

```bash
vllm serve mistralai/Mistral-Medium-3.5-FP8 \
    --tensor-parallel-size 4 \
    --max-model-len 65536 \\
    --gpu-memory-utilization 0.90 \
    --enable-chunked-prefill \
    --enable-auto-tool-choice \
    --tool-call-parser mistral \\
    --reasoning-parser mistral \
    --tokenizer-mode mistral \\
    --config-format mistral \\
    --load-format mistral \\
    --served-model-name mistral-medium-3.5 \
    --host 0.0.0.0 \
    --port 8000
```

**Альтернатива — 2× H200 BF16:**

```bash
vllm serve mistralai/Mistral-Medium-3.5 \
    --tensor-parallel-size 2 \
    --max-model-len 131072 \
    --gpu-memory-utilization 0.92 \\
    --enable-chunked-prefill \
    --enable-auto-tool-choice \
    --tool-call-parser mistral \\
    --reasoning-parser mistral \
    --tokenizer-mode mistral \\
    --config-format mistral \\
    --load-format mistral \\
    --served-model-name mistral-medium-3.5 \
    --host 0.0.0.0 \
    --port 8000
```

{% hint style="info" %}
Начните с `--max-model-len 65536` даже на оборудовании, которое могло бы вместить больше. Память KV-кэша растёт линейно с контекстом, и большинство нагрузок никогда не доходят до 256K. Повышайте это только после подтверждения смешения запросов.
{% endhint %}

**Альтернатива SGLang** (часто быстрее на Hopper для длинных prefill):

```bash
python3 -m sglang.launch_server \
    --model-path mistralai/Mistral-Medium-3.5-FP8 \
    --tp-size 4 \
    --tool-call-parser mistral \\
    --reasoning-parser mistral \
    --mem-fraction-static 0.88 \
    --context-length 65536 \
    --served-model-name mistral-medium-3.5 \
    --host 0.0.0.0 \
    --port 8000
```

## Примеры использования

После развертывания найдите свой `http_pub` URL в **Мои заказы** на Clore.ai (например, `abc123.clorecloud.net`). Замените `localhost:8000` с `https://YOUR_HTTP_PUB_URL` в примерах ниже при вызове снаружи сервера.

### 1. Чат — мгновенный режим (по умолчанию)

Ответ с низкой задержкой, без видимой трассировки рассуждений. Подходит для чат-интерфейсов, автодополнения, классификации.

```bash
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mistral-medium-3.5",
    "messages": [
      {"role": "system", "content": "Вы — senior backend engineer."},
      {"role": "user", "content": "Напишите Go middleware для HTTP, которое ограничивает скорость по API-ключу с помощью token bucket."}
    ],
    "temperature": 0.15,
    "max_tokens": 1024,
    "extra_body": {"reasoning_mode": "instant"}
  }'
```

### 2. Чат — глубокий режим (переключатель рассуждения)

Включает `<think>` трассировку перед финальным ответом. Используйте для сложной отладки, планирования, математики.

```bash
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mistral-medium-3.5",
    "messages": [
      {"role": "user", "content": "Пользователь сообщает, что наш webhook для платежей срабатывает дважды для 1% заказов. Пройдите по наиболее вероятным причинам в порядке вероятности и предложите план диагностики."}
    ],
    "temperature": 0.7,
    "top_p": 0.95,
    "max_tokens": 4096,
    "extra_body": {"reasoning_mode": "deep"}
  }'
```

В ответе будет `поле reasoning_content` (vLLM извлекает `<think>...</think>` фрагмент из видимого сообщения) вместе с `content`. Уберите трассировку или показывайте её в зависимости от вашего продукта.

### 3. Python — клиент, совместимый с OpenAI

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

# Мгновенный режим — чат
response = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[
        {"role": "system", "content": "Вы полезный помощник по программированию."},
        {"role": "user", "content": "Рефакторите эту Python-функцию для повышения читаемости."}
    ],
    temperature=0.15,
    max_tokens=1024,
    extra_body={"reasoning_mode": "instant"}
)
print(response.choices[0].message.content)

# Глубокий режим — шаг планирования
plan = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[
        {"role": "user", "content": "Спланируйте миграцию с MongoDB на PostgreSQL для таблицы заказов на 2 ТБ без простоя."}
    ],
    temperature=0.7,
    max_tokens=4096,
    extra_body={"reasoning_mode": "deep"}
)

msg = plan.choices[0].message
print("РАЗМЫШЛЕНИЯ:\n", getattr(msg, "reasoning_content", ""))
print("\nОТВЕТ:\n", msg.content)
```

### 4. Структурированные ответы — JSON Schema

Medium 3.5 поддерживает декодирование, управляемое JSON-схемой, через `response_format`. Полезно, когда получатель результата — парсер, а не человек.

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="x")

schema = {
    "type": "object",
    "properties": {
        "severity": {"type": "string", "enum": ["low", "medium", "high", "critical"]},
        "categories": {
            "type": "array",
            "items": {"type": "string", "enum": ["auth", "payments", "db", "ui", "infra"]}
        },
        "summary": {"type": "string", "maxLength": 240},
        "next_action": {"type": "string"}
    },
    "required": ["severity", "categories", "summary", "next_action"],
    "additionalProperties": False
}

response = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[
        {"role": "system", "content": "Классифицируйте входящий отчёт об ошибке. Верните строгий JSON."},
        {"role": "user", "content": "Вход в систему не работает для пользователей с апострофами в email, возвращается 500 от /webapi/login."}
    ],
    temperature=0.0,
    response_format={
        "type": "json_schema",
        "json_schema": {"name": "triage", "schema": schema, "strict": True}
    },
    extra_body={"reasoning_mode": "instant"}
)

import json
print(json.loads(response.choices[0].message.content))
```

### 5. Вызов функций

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="x")

tools = [{
    "type": "function",
    "function": {
        "name": "search_orders",
        "description": "Ищите базу заказов по user ID и необязательному диапазону дат",
        "parameters": {
            "type": "object",
            "properties": {
                "user_id": {"type": "string"},
                "start_date": {"type": "string", "format": "date"},
                "end_date": {"type": "string", "format": "date"}
            },
            "required": ["user_id"]
        }
    }
}]

response = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[{"role": "user", "content": "Найдите все заказы для пользователя u_4821 в апреле 2026 года."}],
    tools=tools,
    tool_choice="auto",
    temperature=0.1
)

for call in response.choices[0].message.tool_calls or []:
    print(call.function.name, call.function.arguments)
```

## Советы по производительности

1. **Предпочитайте FP8 checkpoint на Hopper.** `Mistral-Medium-3.5-FP8` — это предоставляемая вендором FP8-сборка, и она примерно в 2 раза легче BF16 при практически нулевой потере качества на оборудовании класса Hopper. Это правильный вариант по умолчанию как для 4× H100, так и для 2× H200.
2. **Тензорный параллелизм = число GPU.** Для 4× H100 используйте `--tensor-parallel-size 4`; для 2× H200 используйте `--tensor-parallel-size 2`. Pipeline parallelism на одном узле обычно снижает пропускную способность для плотной модели 128B.
3. **Ограничьте `max-model-len` тем, что вы действительно используете.** KV-кэш на 256K огромен — одна последовательность на полном контексте может съесть 30–50 ГБ. Установите `--max-model-len 65536` (или 32768), если у вас нет подтверждённой необходимости в большем, и повышайте только после профилирования.
4. **Включите chunked prefill.** `--enable-chunked-prefill` поддерживает поток decode-токенов, пока большие промпты всё ещё обрабатываются. Для промптов 100K+ это разница между «отзывчиво» и «тайм-аут».
5. **Кэшируйте веса.** Смонтируйте Docker-том на `/root/.cache/huggingface` и используйте его повторно между перезапусками. Перекачивать 128 ГБ при каждом холодном старте — самая частая причина того, что «vLLM слишком медленно запускается».
6. **Квантизация KV-кэша для небольшой дополнительной ёмкости.** На 4× H100 можно выжать больше одновременных сессий с помощью `--kv-cache-dtype fp8`. Вендор сообщает о почти без потерь в качестве; проверьте на своём наборе оценки перед включением в production.
7. **Не используйте `deep` режим для каждого запроса.** Трассировки рассуждений стоят реальных токенов и реальной задержки. Маршрутизируйте по типу задачи: классификация, автодополнение и генерация аргументов для инструментов остаются в `instant`; шаги планирования и проверки переходят в `deep`.
8. **Спекулятивное декодирование помогает.** vLLM и SGLang оба поддерживают спекулятивное декодирование с draft-моделью (например, с draft из Ministral 3B). На длинных кодовых completions это обычно даёт прирост пропускной способности 1.3–1.7× без потери качества.

## Бенчмарки

{% hint style="warning" %}
**Числа, опубликованные вендором, — проверяйте независимо.** Таблица ниже взята из анонса Mistral AI от 29 апреля 2026 года. Независимые воспроизведения от третьих сторон (LMSys, EQ-Bench, лидерборд SWE-Bench) всё ещё поступают. Воспринимайте это как ориентир, а не как авторитетный источник.
{% endhint %}

| Бенчмарк                               | Mistral Medium 3.5 (вендор) | Опорные точки (по данным вендора)     |
| -------------------------------------- | --------------------------- | ------------------------------------- |
| MMLU-Pro                               | \~78%                       | Llama 4 Maverick \~76%, GPT-5.4 \~81% |
| HumanEval                              | \~92%                       | Codestral 25.01 \~88%, GLM-5.1 \~94%  |
| LiveCodeBench (апр. 2026)              | \~68%                       | GLM-5.1 \~72%, Llama 4 Maverick \~64% |
| AIME 2025 (deep mode)                  | \~62%                       | GPT-5.4 \~73%, GLM-5.1 \~58%          |
| GPQA Diamond (deep mode)               | \~59%                       | Claude Opus 4.6 \~63%, GLM-5.1 \~57%  |
| Долгий контекст, восстановление (128K) | \~95%                       | Llama 4 Maverick \~93%                |

Позиционирование, на которое нацелен Mistral: **примерно уровень Llama 4 Maverick / GLM-5.1 в общих задачах, более узкий разрыв в кодинге, отдельный переключатель рассуждения**. Его не позиционируют как конкурента GPT-5.4 / Claude Opus 4.6.

## Устранение неполадок

| Проблема                                                       | Решение                                                                                                                                                                  |
| -------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| `CUDA out of memory` при загрузке (4× H100)                    | Вы, вероятно, по ошибке загружаете BF16. Используйте checkpoint FP8 (`Mistral-Medium-3.5-FP8`) или перейдите на `--max-model-len 32768`.                                 |
| `CUDA out of memory` во время запроса при контексте 256K       | KV-кэш разросся. Уменьшите `--max-model-len`, включите `--kv-cache-dtype fp8`или ограничьте `--max-num-seqs` (попробуйте 8).                                             |
| Глубокий режим выдаёт пустой `поле reasoning_content`          | Проверьте `--reasoning-parser mistral` установлен в vLLM и что `temperature ≥ 0.5`. Сэмплинг с нулевой температурой обрезает трассу.                                     |
| Медленное время до первого токена в глубоком режиме            | Ожидаемо — глубокий режим выдаёт `<think>` фрагмент до любого видимого вывода. Поток отправляйте клиенту с помощью `stream=true` и показывайте UI-состояние «thinking…». |
| `403 Forbidden` при загрузке с HuggingFace                     | Mistral Medium 3.5 **ограничен**. Примите MRL на карточке модели и установите `HF_TOKEN` в переменных окружения контейнера.                                              |
| `tokenizer_mode mistral` ошибки                                | Все три флага нужны вместе: `--tokenizer-mode mistral --config-format mistral --load-format mistral`.                                                                    |
| Вызовы инструментов тихо отбрасываются                         | Установите оба `--enable-auto-tool-choice` и `--tool-call-parser mistral`. Без парсера vLLM возвращает аргументы инструментов как обычный текст.                         |
| Пропускная способность рушится после \~32 одновременных сессий | Вы упёрлись в вытеснение KV-кэша. Уменьшите `--max-model-len`, увеличьте `--gpu-memory-utilization` до 0.92 или масштабируйте на второй реплике.                         |
| Ошибка лицензии, блокирующая коммерческое использование        | MRL только для исследований. Свяжитесь с отделом продаж Mistral за коммерческой лицензией до обслуживания платящих пользователей.                                        |

## FAQ

**В: Mistral Medium 3.5 или Llama 4 Maverick — что выбрать?**

Оба находятся в похожем классе по размеру (Maverick — MoE с 17B активных параметров из 400B всего; Medium 3.5 — плотная модель 128B). Выберите **Medium 3.5** если вам нужна предсказуемая VRAM/latency, переключатель двух режимов рассуждения в одной контрольной точке и более сильная производительность в коде. Выберите **Llama 4 Maverick** если вам нужна permissive-лицензия для безусловного коммерческого использования (у Llama 4 community-лицензия, для production у Medium 3.5 нужна коммерческая лицензия Mistral) или если вам важна более низкая стоимость инференса за токен, которую MoE даёт вам на запрос.

**В: Как включить режим рассуждения?**

Передайте `extra_body={"reasoning_mode": "deep"}` в Python-клиенте OpenAI или укажите `"reasoning_mode": "deep"` на верхнем уровне вашего HTTP JSON-тела. Значение по умолчанию — `"мгновенный"`. На стороне сервера убедитесь, что vLLM был запущен с `--reasoning-parser mistral` чтобы `<think>` тег span разбирается в `поле reasoning_content` поле, а не попадает в `content`.

**В: Почему 4× H100, а не 2× H100?**

Весы FP8 занимают \~128 ГБ до KV-кэша. 2× H100 80 ГБ дают вам всего 160 ГБ — этого достаточно, чтобы загрузить веса, но почти не остается запаса для KV-кэша, активаций или даже умеренного окна контекста. На практике 2× H100 немедленно уходят в OOM за пределами контекста 8K. **4× H100 — это минимум для пригодного к использованию развертывания с поддержкой 256K**; 2× H200 (282 ГБ) — альтернатива, если вы предпочитаете управлять меньшим числом GPU при немного более высокой цене за GPU.

**В: Могу ли я использовать Mistral Medium 3.5 коммерчески?**

Стандартная лицензия Mistral Research License (MRL) разрешает исследования и внутреннюю оценку, но **не** коммерческое производство. Для развертываний, ориентированных на платящих клиентов, вам нужна **Лицензия Mistral Commercial License** — обратитесь в отдел продаж Mistral. Это тот же самый барьер, который ранее применялся к Medium 3 и Codestral. Если наличие коммерчески дружественной лицензии для вас критически важно, обратите внимание на [Mistral Small 3.1](/guides/guides_v2-ru/yazykovye-modeli/mistral-small.md) (Apache 2.0) или [Llama 4](/guides/guides_v2-ru/yazykovye-modeli/llama4.md) (лицензия сообщества Llama).

**В: Поддерживает ли Medium 3.5 зрение или аудио?**

Нет. Medium 3.5 — только текстовая модель. Для мультимодального Mistral используйте [Mistral Large 3](/guides/guides_v2-ru/yazykovye-modeli/mistral-large3.md), которая поставляется с 2.5-миллиардным визуальным энкодером. Для других мультимодальных вариантов на Clore.ai см. Qwen3.5-Omni или Gemma 3.

## Связанные руководства

* [Mistral Large 3](/guides/guides_v2-ru/yazykovye-modeli/mistral-large3.md) — мультимодальная MoE-фронтирная модель на 675B, Apache 2.0, когда вам нужны зрение и максимальное качество
* [Mistral и Mixtral](/guides/guides_v2-ru/yazykovye-modeli/mistral-mixtral.md) — более старые Mistral 7B и Mixtral 8x7B/8x22B для развертываний на одном GPU
* [vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) — фреймворк продакшен-обслуживания, рекомендуемый backend для Medium 3.5
* [Llama 4](/guides/guides_v2-ru/yazykovye-modeli/llama4.md) — ближайший аналог с открытыми весами такого масштаба, альтернатива с либеральной лицензией

### Внешние ссылки

* [Mistral Medium 3.5 на HuggingFace](https://huggingface.co/mistralai/Mistral-Medium-3.5)
* [контрольная точка FP8 Mistral Medium 3.5](https://huggingface.co/mistralai/Mistral-Medium-3.5-FP8)
* [анонс Mistral AI (29 апреля 2026)](https://mistral.ai/news/mistral-medium-3-5)
* [Лицензия Mistral Research](https://mistral.ai/licenses/MRL-0.1.md)
* [документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)
* [Маркетплейс Clore.ai](https://clore.ai/marketplace) — арендуйте H100 / H200 у [голое железо](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mistral-medium35.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
