For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral Small 3.1

Разверните Mistral Small 3.1 (24B) на Clore.ai — идеальная производственная модель для одной GPU

Mistral Small 3.1, выпущенная в марте 2025 года компанией Mistral AI, — это плотная модель с 24 миллиардами параметров которая значительно превосходит свои размеры. Благодаря окну контекста 128K, нативным возможностям работы с изображениями, лучшему в классе вызову функций и лицензии Apache 2.0её, пожалуй, можно назвать лучшей моделью, которую можно запустить на одной RTX 4090. Она превосходит GPT-4o Mini и Claude 3.5 Haiku по большинству бенчмарков, при этом комфортно помещается на потребительском железе в квантизированном виде.

Ключевые особенности

  • 24B плотных параметров — без сложности MoE, простое развёртывание

  • Контекстное окно 128K — результат RULER 128K: 81,2%, превосходит GPT-4o Mini (65,8%)

  • Нативное зрение — анализируйте изображения, графики, документы и скриншоты

  • лицензии Apache 2.0 — полностью открыта для коммерческого и личного использования

  • Элитный вызов функций — нативное использование инструментов с JSON-выводом, идеально для агентных рабочих процессов

  • Многоязычность — более 25 языков, включая CJK, арабский, хинди и европейские языки

Требования

Компонент
Квантизированная (Q4)
Полная точность (BF16)

GPU

1× RTX 4090 24GB

2× RTX 4090 или 1× H100

VRAM

~16 ГБ

~55 ГБ

ОЗУ

32GB

64GB

Диск

20 ГБ

50 ГБ

CUDA

12.8+

12.8+

Рекомендация Clore.ai: RTX 4090 ($0.14–0.42/ч) для квантизированного инференса — лучшее соотношение цены и производительности

Быстрый старт с Ollama

Самый быстрый способ запустить Mistral Small 3.1:

Ollama как API, совместимый с OpenAI

Ollama с поддержкой Vision

Настройка vLLM (продакшн)

Для production-нагрузок с высокой пропускной способностью и одновременными запросами:

Запуск на одной GPU (только текст)

Запуск с Vision (рекомендуется 2 GPU)

Обратиться к серверу

HuggingFace Transformers

Для прямой интеграции и экспериментов на Python:

Пример вызова функций

Mistral Small 3.1 — одна из лучших небольших моделей для работы с инструментами:

Быстрый старт с Docker

Советы для пользователей Clore.ai

  • RTX 4090 — идеальный вариант: При $0.14–0.42/ч одна RTX 4090 запускает Mistral Small 3.1 в квантизированном виде с запасом. Лучшее соотношение цены и производительности на Clore.ai для универсальной LLM.

  • Используйте низкую температуру: Mistral AI рекомендует temperature=0.15 для большинства задач. Более высокие температуры вызывают нестабильный вывод у этой модели.

  • RTX 3090 тоже подходит: При $0.07–0.21/ч RTX 3090 (24 ГБ) отлично запускает Q4-квантизированную модель с Ollama. Немного медленнее, чем 4090, но вдвое дешевле.

  • Ollama для быстрого запуска, vLLM для production: Ollama даёт рабочую модель за 60 секунд. Для одновременных API-запросов и более высокой пропускной способности переключитесь на vLLM.

  • Вызов функций делает её особенной: Многие модели 24B могут вести диалог — немногие надёжно вызывают инструменты. Вызов функций у Mistral Small 3.1 сопоставим с GPT-4o Mini. Создавайте агентов, бэкенды API и пайплайны автоматизации с уверенностью.

Устранение неполадок

Проблема
Решение

OutOfMemoryError на RTX 4090

Используйте квантизированную модель через Ollama или load_in_4bit=True в Transformers. Полный BF16 требует около 55 ГБ.

Модель Ollama не найдена

Используйте ollama run mistral-small3.1 (официальное название библиотеки).

Ошибки токенизатора vLLM

Всегда передавайте --tokenizer-mode mistral --config-format mistral --load-format mistral.

Низкое качество вывода

Установите temperature=0.15. Добавьте системный prompt. Mistral Small чувствительна к температуре.

Vision не работает на 1 GPU

Для функций vision требуется больше VRAM. Используйте --tensor-parallel-size 2 или уменьшите --max-model-len.

Вызовы функций возвращают пустой результат

Добавьте --tool-call-parser mistral --enable-auto-tool-choice в vLLM serve.

Дополнительное чтение

Последнее обновление

Это было полезно?