Mistral Small 3.1
Разверните Mistral Small 3.1 (24B) на Clore.ai — идеальная производственная модель для одной GPU
Mistral Small 3.1, выпущенная в марте 2025 года компанией Mistral AI, — это плотная модель с 24 миллиардами параметров которая значительно превосходит свои размеры. Благодаря окну контекста 128K, нативным возможностям работы с изображениями, лучшему в классе вызову функций и лицензии Apache 2.0её, пожалуй, можно назвать лучшей моделью, которую можно запустить на одной RTX 4090. Она превосходит GPT-4o Mini и Claude 3.5 Haiku по большинству бенчмарков, при этом комфортно помещается на потребительском железе в квантизированном виде.
Ключевые особенности
24B плотных параметров — без сложности MoE, простое развёртывание
Контекстное окно 128K — результат RULER 128K: 81,2%, превосходит GPT-4o Mini (65,8%)
Нативное зрение — анализируйте изображения, графики, документы и скриншоты
лицензии Apache 2.0 — полностью открыта для коммерческого и личного использования
Элитный вызов функций — нативное использование инструментов с JSON-выводом, идеально для агентных рабочих процессов
Многоязычность — более 25 языков, включая CJK, арабский, хинди и европейские языки
Требования
GPU
1× RTX 4090 24GB
2× RTX 4090 или 1× H100
VRAM
~16 ГБ
~55 ГБ
ОЗУ
32GB
64GB
Диск
20 ГБ
50 ГБ
CUDA
12.8+
12.8+
Рекомендация Clore.ai: RTX 4090 ($0.14–0.42/ч) для квантизированного инференса — лучшее соотношение цены и производительности
Быстрый старт с Ollama
Самый быстрый способ запустить Mistral Small 3.1:
Ollama как API, совместимый с OpenAI
Ollama с поддержкой Vision
Настройка vLLM (продакшн)
Для production-нагрузок с высокой пропускной способностью и одновременными запросами:
Запуск на одной GPU (только текст)
Запуск с Vision (рекомендуется 2 GPU)
Обратиться к серверу
HuggingFace Transformers
Для прямой интеграции и экспериментов на Python:
Пример вызова функций
Mistral Small 3.1 — одна из лучших небольших моделей для работы с инструментами:
Быстрый старт с Docker
Советы для пользователей Clore.ai
RTX 4090 — идеальный вариант: При $0.14–0.42/ч одна RTX 4090 запускает Mistral Small 3.1 в квантизированном виде с запасом. Лучшее соотношение цены и производительности на Clore.ai для универсальной LLM.
Используйте низкую температуру: Mistral AI рекомендует
temperature=0.15для большинства задач. Более высокие температуры вызывают нестабильный вывод у этой модели.RTX 3090 тоже подходит: При $0.07–0.21/ч RTX 3090 (24 ГБ) отлично запускает Q4-квантизированную модель с Ollama. Немного медленнее, чем 4090, но вдвое дешевле.
Ollama для быстрого запуска, vLLM для production: Ollama даёт рабочую модель за 60 секунд. Для одновременных API-запросов и более высокой пропускной способности переключитесь на vLLM.
Вызов функций делает её особенной: Многие модели 24B могут вести диалог — немногие надёжно вызывают инструменты. Вызов функций у Mistral Small 3.1 сопоставим с GPT-4o Mini. Создавайте агентов, бэкенды API и пайплайны автоматизации с уверенностью.
Устранение неполадок
OutOfMemoryError на RTX 4090
Используйте квантизированную модель через Ollama или load_in_4bit=True в Transformers. Полный BF16 требует около 55 ГБ.
Модель Ollama не найдена
Используйте ollama run mistral-small3.1 (официальное название библиотеки).
Ошибки токенизатора vLLM
Всегда передавайте --tokenizer-mode mistral --config-format mistral --load-format mistral.
Низкое качество вывода
Установите temperature=0.15. Добавьте системный prompt. Mistral Small чувствительна к температуре.
Vision не работает на 1 GPU
Для функций vision требуется больше VRAM. Используйте --tensor-parallel-size 2 или уменьшите --max-model-len.
Вызовы функций возвращают пустой результат
Добавьте --tool-call-parser mistral --enable-auto-tool-choice в vLLM serve.
Дополнительное чтение
Последнее обновление
Это было полезно?