Mistral Small 3.1
Deploye Mistral Small 3.1 (24B) auf Clore.ai — das ideale Single-GPU-Produktionsmodell
Mistral Small 3.1, veröffentlicht im März 2025 von Mistral AI, ist ein 24-Milliarden-Parameter-dichtes Modell das weit über sein Gewicht hinaus schlägt. Mit einem 128K-Kontextfenster, nativen Vision-Funktionen, erstklassigem Function Calling und einer Apache-2.0-Lizenz, ist es wohl das beste Modell, das Sie auf einer einzelnen RTX 4090 ausführen können. Es übertrifft GPT-4o Mini und Claude 3.5 Haiku in den meisten Benchmarks und passt quantisiert bequem auf Consumer-Hardware.
Hauptfunktionen
24B dichte Parameter — keine MoE-Komplexität, unkomplizierte Bereitstellung
128K-Kontextfenster — RULER-128K-Score von 81,2 %, schlägt GPT-4o Mini (65,8 %)
Native Vision — Bilder, Diagramme, Dokumente und Screenshots analysieren
Apache-2.0-Lizenz — vollständig offen für kommerzielle und persönliche Nutzung
Erstklassiges Function Calling — native Tool-Nutzung mit JSON-Ausgabe, ideal für agentische Workflows
Mehrsprachig — 25+ Sprachen einschließlich CJK, Arabisch, Hindi und europäischer Sprachen
Anforderungen
GPU
1× RTX 4090 24GB
2× RTX 4090 oder 1× H100
VRAM
~16GB
~55 GB
RAM
32 GB
64 GB
Festplatte
20 GB
50GB
CUDA
12.8+
12.8+
Clore.ai-Empfehlung: RTX 4090 (0,14–0,42 $/Std.) für quantisierte Inferenz — bestes Preis-Leistungs-Verhältnis
Schnellstart mit Ollama
Der schnellste Weg, Mistral Small 3.1 zum Laufen zu bringen:
Ollama als OpenAI-kompatible API
Ollama mit Vision
vLLM-Einrichtung (Produktion)
Für Produktions-Workloads mit hohem Durchsatz und gleichzeitigen Anfragen:
Auf einer einzelnen GPU bereitstellen (nur Text)
Mit Vision bereitstellen (2 GPUs empfohlen)
Den Server abfragen
HuggingFace Transformers
Für die direkte Python-Integration und zum Experimentieren:
Beispiel für Function Calling
Mistral Small 3.1 ist eines der besten kleinen Modelle für die Tool-Nutzung:
Docker-Schnellstart
Tipps für Clore.ai-Nutzer
Die RTX 4090 ist der Sweet Spot: Bei 0,14–0,42 $/Std. läuft Mistral Small 3.1 auf einer einzelnen RTX 4090 quantisiert mit reichlich Reserven. Bestes Kosten-/Leistungsverhältnis auf Clore.ai für ein universelles LLM.
Niedrige Temperatur verwenden: Mistral AI empfiehlt
temperature=0.15für die meisten Aufgaben. Höhere Temperaturen verursachen mit diesem Modell inkonsistente Ausgaben.Auch die RTX 3090 funktioniert: Bei 0,07–0,21 $/Std. läuft die RTX 3090 (24 GB) mit Q4-Quantisierung in Ollama problemlos. Etwas langsamer als die 4090, aber halb so teuer.
Ollama für schnelle Setups, vLLM für Produktion: Mit Ollama haben Sie in 60 Sekunden ein funktionierendes Modell. Für gleichzeitige API-Anfragen und höheren Durchsatz wechseln Sie zu vLLM.
Function Calling macht es besonders: Viele 24B-Modelle können chatten — nur wenige können zuverlässig Tools aufrufen. Das Function Calling von Mistral Small 3.1 ist auf Augenhöhe mit GPT-4o Mini. Erstellen Sie Agenten, API-Backends und Automatisierungspipelines mit Zuversicht.
Fehlerbehebung
OutOfMemoryError auf einer RTX 4090
Verwenden Sie ein quantisiertes Modell über Ollama oder load_in_4bit=True in Transformers. Vollständiges BF16 benötigt ~55 GB.
Ollama-Modell nicht gefunden
Verwende ollama run mistral-small3.1 (offizieller Bibliotheksname).
vLLM-Tokenizer-Fehler
Immer --tokenizer-mode mistral --config-format mistral --load-format mistral.
Schlechte Ausgabequalität
Setze temperature=0.15. Fügen Sie einen System-Prompt hinzu. Mistral Small reagiert empfindlich auf die Temperatur.
Vision funktioniert nicht auf 1 GPU
Vision-Funktionen benötigen mehr VRAM. Verwenden Sie --tensor-parallel-size 2 oder reduzieren Sie --max-model-len.
Function Calls geben leer zurück
Fügen Sie --tool-call-parser mistral --enable-auto-tool-choice für vLLM serve.
Weiterführende Lektüre
Zuletzt aktualisiert
War das hilfreich?