For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral Small 3.1

在 Clore.ai 上部署 Mistral Small 3.1(24B)——理想的单 GPU 生产级模型

Mistral Small 3.1,由 Mistral AI 于 2025 年 3 月发布,是一款 240 亿参数的稠密模型 其性能远超同级。拥有 128K 上下文窗口、原生视觉能力、一流的函数调用能力,以及 Apache 2.0 许可证,它可以说是你能在单张 RTX 4090 上运行的最佳模型。在大多数基准测试中,它的表现优于 GPT-4o Mini 和 Claude 3.5 Haiku,而且量化后在消费级硬件上也能轻松运行。

主要特性

  • 240亿稠密参数 —— 无 MoE 复杂性,部署直接

  • 128K 上下文窗口 —— RULER 128K 得分 81.2%,优于 GPT-4o Mini(65.8%)

  • 原生视觉 —— 分析图像、图表、文档和截图

  • Apache 2.0 许可证 —— 可完全开放用于商业和个人用途

  • 顶级函数调用 —— 使用 JSON 输出进行原生工具调用,非常适合智能体工作流

  • 多语言 —— 支持 25+ 种语言,包括中日韩文字、阿拉伯语、印地语和欧洲语言

需求

组件
量化版(Q4)
全精度(BF16)

GPU

1× RTX 4090 24GB

2× RTX 4090 或 1× H100

显存

~16GB

~55GB

内存

32GB

64GB

磁盘

20GB

50GB

CUDA

12.8+

12.8+

Clore.ai 推荐: RTX 4090($0.14–0.42/小时)适用于量化推理——最佳性价比

使用 Ollama 快速开始

让 Mistral Small 3.1 运行起来最快的方法:

作为 OpenAI 兼容 API 的 Ollama

带视觉的 Ollama

vLLM 配置(生产环境)

对于高吞吐量和并发请求的生产工作负载:

在单 GPU 上提供服务(仅文本)

带视觉能力提供服务(推荐 2 张 GPU)

查询服务器

HuggingFace Transformers

用于直接的 Python 集成和实验:

函数调用示例

Mistral Small 3.1 是最适合工具使用的小型模型之一:

Docker 快速开始

给 Clore.ai 用户的建议

  • RTX 4090 是最佳选择:以 $0.14–0.42/小时 的价格,单张 RTX 4090 就能运行量化版 Mistral Small 3.1,而且还有余量。对于通用 LLM 来说,这是 Clore.ai 上最佳的成本/性能比。

  • 使用低温度:Mistral AI 建议 temperature=0.15 用于大多数任务。更高的温度会导致该模型输出不稳定。

  • RTX 3090 也可以:以 $0.07–0.21/小时 的价格,RTX 3090(24GB)也能很好地运行 Q4 量化版和 Ollama。比 4090 略慢,但价格只有一半。

  • Ollama 适合快速部署,vLLM 适合生产环境:Ollama 可在 60 秒内为你提供一个可用模型。对于并发 API 请求和更高吞吐量,请切换到 vLLM。

  • 函数调用使它与众不同:许多 24B 模型可以聊天——但能可靠调用工具的却很少。Mistral Small 3.1 的函数调用能力可与 GPT-4o Mini 相媲美。可自信构建智能体、API 后端和自动化流水线。

故障排查

问题
解决方案

OutOfMemoryError 在 RTX 4090 上

通过 Ollama 使用量化模型,或者 load_in_4bit=True 在 Transformers 中。完整 BF16 需要约 55GB。

未找到 Ollama 模型

使用 ollama run mistral-small3.1 (官方库名称)。

vLLM 分词器错误

务必传入 --tokenizer-mode mistral --config-format mistral --load-format mistral.

输出质量较差

设置 temperature=0.15。添加系统提示。Mistral Small 对温度很敏感。

在 1 张 GPU 上无法使用视觉功能

视觉功能需要更多显存。请使用 --tensor-parallel-size 2 或降低 --max-model-len.

函数调用返回空

--tool-call-parser mistral --enable-auto-tool-choice 到 vLLM serve 中。

延伸阅读

最后更新于

这有帮助吗?