Mistral Small 3.1
在 Clore.ai 上部署 Mistral Small 3.1(24B)——理想的单 GPU 生产级模型
Mistral Small 3.1,由 Mistral AI 于 2025 年 3 月发布,是一款 240 亿参数的稠密模型 其性能远超同级。拥有 128K 上下文窗口、原生视觉能力、一流的函数调用能力,以及 Apache 2.0 许可证,它可以说是你能在单张 RTX 4090 上运行的最佳模型。在大多数基准测试中,它的表现优于 GPT-4o Mini 和 Claude 3.5 Haiku,而且量化后在消费级硬件上也能轻松运行。
主要特性
240亿稠密参数 —— 无 MoE 复杂性,部署直接
128K 上下文窗口 —— RULER 128K 得分 81.2%,优于 GPT-4o Mini(65.8%)
原生视觉 —— 分析图像、图表、文档和截图
Apache 2.0 许可证 —— 可完全开放用于商业和个人用途
顶级函数调用 —— 使用 JSON 输出进行原生工具调用,非常适合智能体工作流
多语言 —— 支持 25+ 种语言,包括中日韩文字、阿拉伯语、印地语和欧洲语言
需求
GPU
1× RTX 4090 24GB
2× RTX 4090 或 1× H100
显存
~16GB
~55GB
内存
32GB
64GB
磁盘
20GB
50GB
CUDA
12.8+
12.8+
Clore.ai 推荐: RTX 4090($0.14–0.42/小时)适用于量化推理——最佳性价比
使用 Ollama 快速开始
让 Mistral Small 3.1 运行起来最快的方法:
作为 OpenAI 兼容 API 的 Ollama
带视觉的 Ollama
vLLM 配置(生产环境)
对于高吞吐量和并发请求的生产工作负载:
在单 GPU 上提供服务(仅文本)
带视觉能力提供服务(推荐 2 张 GPU)
查询服务器
HuggingFace Transformers
用于直接的 Python 集成和实验:
函数调用示例
Mistral Small 3.1 是最适合工具使用的小型模型之一:
Docker 快速开始
给 Clore.ai 用户的建议
RTX 4090 是最佳选择:以 $0.14–0.42/小时 的价格,单张 RTX 4090 就能运行量化版 Mistral Small 3.1,而且还有余量。对于通用 LLM 来说,这是 Clore.ai 上最佳的成本/性能比。
使用低温度:Mistral AI 建议
temperature=0.15用于大多数任务。更高的温度会导致该模型输出不稳定。RTX 3090 也可以:以 $0.07–0.21/小时 的价格,RTX 3090(24GB)也能很好地运行 Q4 量化版和 Ollama。比 4090 略慢,但价格只有一半。
Ollama 适合快速部署,vLLM 适合生产环境:Ollama 可在 60 秒内为你提供一个可用模型。对于并发 API 请求和更高吞吐量,请切换到 vLLM。
函数调用使它与众不同:许多 24B 模型可以聊天——但能可靠调用工具的却很少。Mistral Small 3.1 的函数调用能力可与 GPT-4o Mini 相媲美。可自信构建智能体、API 后端和自动化流水线。
故障排查
OutOfMemoryError 在 RTX 4090 上
通过 Ollama 使用量化模型,或者 load_in_4bit=True 在 Transformers 中。完整 BF16 需要约 55GB。
未找到 Ollama 模型
使用 ollama run mistral-small3.1 (官方库名称)。
vLLM 分词器错误
务必传入 --tokenizer-mode mistral --config-format mistral --load-format mistral.
输出质量较差
设置 temperature=0.15。添加系统提示。Mistral Small 对温度很敏感。
在 1 张 GPU 上无法使用视觉功能
视觉功能需要更多显存。请使用 --tensor-parallel-size 2 或降低 --max-model-len.
函数调用返回空
在 --tool-call-parser mistral --enable-auto-tool-choice 到 vLLM serve 中。
延伸阅读
最后更新于
这有帮助吗?