For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral Small 3.1

Deploye Mistral Small 3.1 (24B) auf Clore.ai — das ideale Single-GPU-Produktionsmodell

Mistral Small 3.1, veröffentlicht im März 2025 von Mistral AI, ist ein 24-Milliarden-Parameter-dichtes Modell das weit über sein Gewicht hinaus schlägt. Mit einem 128K-Kontextfenster, nativen Vision-Funktionen, erstklassigem Function Calling und einer Apache-2.0-Lizenz, ist es wohl das beste Modell, das Sie auf einer einzelnen RTX 4090 ausführen können. Es übertrifft GPT-4o Mini und Claude 3.5 Haiku in den meisten Benchmarks und passt quantisiert bequem auf Consumer-Hardware.

Hauptfunktionen

  • 24B dichte Parameter — keine MoE-Komplexität, unkomplizierte Bereitstellung

  • 128K-Kontextfenster — RULER-128K-Score von 81,2 %, schlägt GPT-4o Mini (65,8 %)

  • Native Vision — Bilder, Diagramme, Dokumente und Screenshots analysieren

  • Apache-2.0-Lizenz — vollständig offen für kommerzielle und persönliche Nutzung

  • Erstklassiges Function Calling — native Tool-Nutzung mit JSON-Ausgabe, ideal für agentische Workflows

  • Mehrsprachig — 25+ Sprachen einschließlich CJK, Arabisch, Hindi und europäischer Sprachen

Anforderungen

Komponente
Quantisiert (Q4)
Volle Präzision (BF16)

GPU

1× RTX 4090 24GB

2× RTX 4090 oder 1× H100

VRAM

~16GB

~55 GB

RAM

32 GB

64 GB

Festplatte

20 GB

50GB

CUDA

12.8+

12.8+

Clore.ai-Empfehlung: RTX 4090 (0,14–0,42 $/Std.) für quantisierte Inferenz — bestes Preis-Leistungs-Verhältnis

Schnellstart mit Ollama

Der schnellste Weg, Mistral Small 3.1 zum Laufen zu bringen:

Ollama als OpenAI-kompatible API

Ollama mit Vision

vLLM-Einrichtung (Produktion)

Für Produktions-Workloads mit hohem Durchsatz und gleichzeitigen Anfragen:

Auf einer einzelnen GPU bereitstellen (nur Text)

Mit Vision bereitstellen (2 GPUs empfohlen)

Den Server abfragen

HuggingFace Transformers

Für die direkte Python-Integration und zum Experimentieren:

Beispiel für Function Calling

Mistral Small 3.1 ist eines der besten kleinen Modelle für die Tool-Nutzung:

Docker-Schnellstart

Tipps für Clore.ai-Nutzer

  • Die RTX 4090 ist der Sweet Spot: Bei 0,14–0,42 $/Std. läuft Mistral Small 3.1 auf einer einzelnen RTX 4090 quantisiert mit reichlich Reserven. Bestes Kosten-/Leistungsverhältnis auf Clore.ai für ein universelles LLM.

  • Niedrige Temperatur verwenden: Mistral AI empfiehlt temperature=0.15 für die meisten Aufgaben. Höhere Temperaturen verursachen mit diesem Modell inkonsistente Ausgaben.

  • Auch die RTX 3090 funktioniert: Bei 0,07–0,21 $/Std. läuft die RTX 3090 (24 GB) mit Q4-Quantisierung in Ollama problemlos. Etwas langsamer als die 4090, aber halb so teuer.

  • Ollama für schnelle Setups, vLLM für Produktion: Mit Ollama haben Sie in 60 Sekunden ein funktionierendes Modell. Für gleichzeitige API-Anfragen und höheren Durchsatz wechseln Sie zu vLLM.

  • Function Calling macht es besonders: Viele 24B-Modelle können chatten — nur wenige können zuverlässig Tools aufrufen. Das Function Calling von Mistral Small 3.1 ist auf Augenhöhe mit GPT-4o Mini. Erstellen Sie Agenten, API-Backends und Automatisierungspipelines mit Zuversicht.

Fehlerbehebung

Problem
Lösung

OutOfMemoryError auf einer RTX 4090

Verwenden Sie ein quantisiertes Modell über Ollama oder load_in_4bit=True in Transformers. Vollständiges BF16 benötigt ~55 GB.

Ollama-Modell nicht gefunden

Verwende ollama run mistral-small3.1 (offizieller Bibliotheksname).

vLLM-Tokenizer-Fehler

Immer --tokenizer-mode mistral --config-format mistral --load-format mistral.

Schlechte Ausgabequalität

Setze temperature=0.15. Fügen Sie einen System-Prompt hinzu. Mistral Small reagiert empfindlich auf die Temperatur.

Vision funktioniert nicht auf 1 GPU

Vision-Funktionen benötigen mehr VRAM. Verwenden Sie --tensor-parallel-size 2 oder reduzieren Sie --max-model-len.

Function Calls geben leer zurück

Fügen Sie --tool-call-parser mistral --enable-auto-tool-choice für vLLM serve.

Weiterführende Lektüre

Zuletzt aktualisiert

War das hilfreich?