> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mistral-large3.md).

# Mistral Large 3 (675B MoE)

Запустите Mistral Large 3 — frontier-модель с 675B параметров и 41B активных параметров на GPU Clore.ai

Mistral Large 3 — самая мощная модель Mistral AI с открытыми весами, выпущенная в декабре 2025 года под **лицензии Apache 2.0**. Это модель Mixture-of-Experts (MoE) с 675B общими параметрами, но только 41B активными на токен — обеспечивает производительность уровня передовых моделей при доле вычислительных затрат по сравнению с плотной моделью на 675B параметров. Благодаря нативной мультимодальной поддержке (текст + изображения), окну контекста 256K и лучшим в классе агентным возможностям она напрямую конкурирует с GPT-4o и моделями класса Claude, при этом полностью может размещаться на собственных серверах.

**HuggingFace:** [mistralai/Mistral-Large-3-675B-Instruct-2512](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512) **Ollama:** [mistral-large-3:675b](https://ollama.com/library/mistral-large-3) **Лицензия:** Apache 2.0

## Ключевые особенности

* **675B всего / 41B активных параметров** — эффективность MoE означает, что вы получаете производительность передового уровня без активации каждого параметра
* **лицензии Apache 2.0** — полностью открыта для коммерческого и личного использования, без ограничений
* **Изначально мультимодальная** — понимает и текст, и изображения благодаря визуальному энкодеру на 2.5B параметров
* **контекстное окно 256K** — обрабатывает огромные документы, кодовые базы и длинные разговоры
* **Лучшие в классе агентные возможности** — нативный вызов функций, режим JSON, использование инструментов
* **Несколько вариантов развертывания** — FP8 на H200/B200, NVFP4 на H100/A100, GGUF-квантизация для потребительских GPU

## Архитектура модели

| Компонент              | Подробности                          |
| ---------------------- | ------------------------------------ |
| Архитектура            | Гранулярная Mixture-of-Experts (MoE) |
| Общее число параметров | 675B                                 |
| Активные параметры     | 41B (на токен)                       |
| Визуальный энкодер     | 2.5B параметра                       |
| Окно контекста         | 256K токенов                         |
| Обучение               | 3,000× H200 GPU                      |
| Выпуск                 | Декабрь 2025                         |

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

| Конфигурация | Бюджетный вариант (Q4 GGUF) | Стандартный (NVFP4) | Полный (FP8)   |
| ------------ | --------------------------- | ------------------- | -------------- |
| GPU          | 4× RTX 4090                 | 8× A100 80GB        | 8× H100/H200   |
| VRAM         | 4×24GB (96GB)               | 8×80GB (640GB)      | 8×80GB (640GB) |
| ОЗУ          | 128 ГБ                      | 256 ГБ              | 256 ГБ         |
| Диск         | 400GB                       | 700GB               | 1.4TB          |
| CUDA         | 12.8+                       | 12.8+               | 12.8+          |

**Рекомендуемая конфигурация Clore.ai:**

* **Лучшее соотношение цены и качества:** 4× RTX 4090 ($0.56–1.68/ч) — запускайте квантизацию Q4 GGUF через llama.cpp или Ollama
* **Качество для продакшена:** 8× A100 80GB ([голое железо](https://clore.ai/bare-metal)) — NVFP4 с полным контекстом через vLLM
* **Максимальная производительность:** 8× H100 (\~$8.32/ч) — FP8, полный контекст 256K

## Быстрый старт с Ollama

Самый быстрый способ запустить Mistral Large 3 на многопроцессорном экземпляре Clore.ai:

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Запустите модель 675B (требуется несколько GPU, ~96GB+ VRAM для Q4)
ollama run mistral-large-3:675b

# Для меньших плотных вариантов (одна GPU):
ollama run mistral3:14b    # 14B плотная — помещается на RTX 3060+
ollama run mistral3:8b     # 8B плотная — помещается на любой GPU
```

## Быстрый старт с vLLM (продакшен)

Для обслуживания уровня продакшена с API, совместимым с OpenAI:

```bash
# Установить vLLM
pip install vllm

# Разверните с квантизацией NVFP4 на 8× A100/H100
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4 \
    --tensor-parallel-size 8 \
    --tokenizer-mode mistral \\
    --config-format mistral \\
    --load-format mistral \\
    --max-model-len 65536 \\
    --gpu-memory-utilization 0.90 \
    --enable-auto-tool-choice \
    --tool-call-parser mistral \\
    --host 0.0.0.0 \
    --port 8000

# Для FP8 (исходные веса, высочайшее качество):
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512 \
    --tensor-parallel-size 8 \
    --tokenizer-mode mistral \\
    --config-format mistral \\
    --load-format mistral \\
    --max-model-len 131072 \
    --host 0.0.0.0 \
    --port 8000
```

## Примеры использования

### 1. Завершение чата (API, совместимый с OpenAI)

Когда vLLM запущен, используйте любой клиент, совместимый с OpenAI:

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[
        {"role": "system", "content": "Вы полезный помощник по программированию."},
        {"role": "user", "content": "Напиши асинхронный Python-скрейпер веб-страниц с использованием aiohttp и BeautifulSoup."}
    ],
    temperature=0.1,
    max_tokens=4096
)

print(response.choices[0].message.content)
```

### 2. Вызов функций / Использование инструментов

Mistral Large 3 отлично справляется со структурированным вызовом инструментов:

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

tools = [
    {
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "Получить текущую погоду для местоположения",
            "parameters": {
                "type": "object",
                "properties": {
                    "location": {"type": "string", "description": "Название города"},
                    "unit": {"type": "string", "enum": ["celsius", "fahrenheit"]}
                },
                "required": ["location"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[{"role": "user", "content": "Какая сейчас погода в Токио?"}],
    tools=tools,
    tool_choice="auto"
)

tool_call = response.choices[0].message.tool_calls[0]
print(f"Function: {tool_call.function.name}")
print(f"Args: {tool_call.function.arguments}")
```

### 3. Зрение — анализ изображений

Mistral Large 3 изначально понимает изображения:

```python
import base64
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

# Закодируйте изображение
with open("diagram.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Опишите эту архитектурную схему подробно."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_b64}"}}
        ]
    }],
    max_tokens=2048
)

print(response.choices[0].message.content)
```

## Советы для пользователей Clore.ai

1. **Начните с NVFP4 на A100** —  `Mistral-Large-3-675B-Instruct-2512-NVFP4` чекпойнт специально разработан для узлов A100/H100 и обеспечивает качество почти без потерь при вдвое меньшем расходе памяти, чем FP8.
2. **Используйте Ollama для быстрых экспериментов** — Если у вас экземпляр 4× RTX 4090, Ollama автоматически обрабатывает GGUF-квантизацию. Идеально для тестирования перед переходом к продакшен-настройке vLLM.
3. **Безопасно откройте API** — При запуске vLLM на экземпляре Clore.ai используйте SSH-туннелирование (`ssh -L 8000:localhost:8000 root@<ip>`) вместо прямого открытия порта 8000.
4. **Уменьшите `max-model-len` чтобы сэкономить VRAM** — Если вам не нужен полный контекст 256K, установите `--max-model-len 32768` или `65536` чтобы значительно сократить использование памяти KV-кэша.
5. **Рассмотрите плотные альтернативы** — Для однопроцессорных GPU-конфигураций Mistral 3 14B (`mistral3:14b` в Ollama) обеспечивает отличную производительность на одной RTX 4090 и принадлежит к тому же семейству моделей.

## Устранение неполадок

| Проблема                         | Решение                                                                                                                             |
| -------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------- |
| `CUDA out of memory` в vLLM      | Уменьшите `--max-model-len` (попробуйте 32768), увеличьте `--tensor-parallel-size`, или используйте чекпойнт NVFP4                  |
| Низкая скорость генерации        | Убедитесь, что `--tensor-parallel-size` соответствует количеству ваших GPU; включите спекулятивное декодирование с чекпойнтом Eagle |
| Ollama не удаётся загрузить 675B | Убедитесь, что суммарно на GPU у вас 96GB+ VRAM; Ollama требует `OLLAMA_NUM_PARALLEL=1` для больших моделей                         |
| `tokenizer_mode mistral` ошибки  | Вы должны указать все три флага: `--tokenizer-mode mistral --config-format mistral --load-format mistral`                           |
| Зрение не работает               | Убедитесь, что изображения близки к соотношению сторон 1:1; для лучших результатов избегайте очень широких/тонких изображений       |
| Скачивание слишком медленное     | Используйте `huggingface-cli download mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4` с `HF_TOKEN` установите                   |

## Дополнительное чтение

* [Блог-анонс Mistral 3](https://mistral.ai/news/mistral-3) — Официальный пост о запуске с бенчмарками
* [Карточка модели HuggingFace](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512) — Инструкции по развёртыванию и результаты бенчмарков
* [Версия с квантизацией NVFP4](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4) — Оптимизировано для A100/H100
* [GGUF с квантизацией (Unsloth)](https://huggingface.co/unsloth/Mistral-Large-3-675B-Instruct-2512-GGUF) — Для llama.cpp и Ollama
* [Документация vLLM](https://docs.vllm.ai/) — Фреймворк для продакшен-обслуживания
* [Руководство Red Hat Day-0](https://developers.redhat.com/articles/2025/12/02/run-mistral-large-3-ministral-3-vllm-red-hat-ai) — Пошаговое развёртывание vLLM


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/mistral-large3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
