> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/mistral-large3.md).

# Mistral Large 3 (675B MoE)

Führe Mistral Large 3 aus — ein 675B MoE-Frontier-Modell mit 41B aktiven Parametern auf Clore.ai-GPUs

Mistral Large 3 ist Mistral AIs leistungsstärkstes Open-Weight-Modell, veröffentlicht im Dezember 2025 unter der **Apache-2.0-Lizenz**. Es ist ein Mixture-of-Experts-(MoE)-Modell mit insgesamt 675B Parametern, aber nur 41B aktiven pro Token — und liefert Spitzenklasse-Performance bei einem Bruchteil des Compute-Aufwands eines dichten 675B-Modells. Mit nativer multimodaler Unterstützung (Text + Bilder), einem Kontextfenster von 256K und agentischen Fähigkeiten der Spitzenklasse konkurriert es direkt mit GPT-4o und Claude-Klasse-Modellen, während es vollständig selbst hostbar ist.

**HuggingFace:** [mistralai/Mistral-Large-3-675B-Instruct-2512](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512) **Ollama:** [mistral-large-3:675b](https://ollama.com/library/mistral-large-3) **Lizenz:** Apache 2.0

## Hauptfunktionen

* **675B insgesamt / 41B aktive Parameter** — MoE-Effizienz bedeutet, dass Sie Spitzenleistung erhalten, ohne jeden Parameter zu aktivieren
* **Apache-2.0-Lizenz** — vollständig offen für kommerzielle und private Nutzung, ohne Einschränkungen
* **Nativ multimodal** — versteht sowohl Text als auch Bilder über einen 2,5B Vision-Encoder
* **256K-Kontextfenster** — verarbeitet massive Dokumente, Codebasen und lange Gespräche
* **Agentische Fähigkeiten der Spitzenklasse** — natives Function Calling, JSON-Modus, Tool-Nutzung
* **Mehrere Bereitstellungsoptionen** — FP8 auf H200/B200, NVFP4 auf H100/A100, GGUF quantisiert für Consumer-GPUs

## Modellarchitektur

| Komponente       | Details                           |
| ---------------- | --------------------------------- |
| Architektur      | Granular Mixture-of-Experts (MoE) |
| Gesamtparameter  | 675B                              |
| Aktive Parameter | 41B (pro Token)                   |
| Vision-Encoder   | 2,5B Parameter                    |
| Kontextfenster   | 256K Tokens                       |
| Training         | 3.000× H200-GPUs                  |
| Veröffentlichung | Dezember 2025                     |

## Anforderungen

{% hint style="warning" %}
**Multi-GPU-Rigs der 80GB-Klasse sind auf dem Clore.ai-Marktplatz nicht gelistet.** Die größten heute gelisteten Systeme sind 4× RTX PRO 6000 Blackwell (je 96 GB, 380 GB gesamt) und 8–11× RTX 5090 (je 32 GB). Kapazitäten für A100 / H200 / B200 werden als [Bare Metal](https://clore.ai/bare-metal) auf Anfrage verkauft. Prüfe [GPU-Preise & Verfügbarkeit](/guides/guides_v2-de/erste-schritte/pricing.md) bevor du eine Bereitstellung dimensionierst.
{% endhint %}

| Konfiguration | Budget (Q4 GGUF) | Standard (NVFP4) | Voll (FP8)     |
| ------------- | ---------------- | ---------------- | -------------- |
| GPU           | 4× RTX 4090      | 8× A100 80GB     | 8× H100/H200   |
| VRAM          | 4×24GB (96GB)    | 8×80GB (640GB)   | 8×80GB (640GB) |
| RAM           | 128GB            | 256 GB           | 256 GB         |
| Festplatte    | 400GB            | 700GB            | 1,4TB          |
| CUDA          | 12.8+            | 12.8+            | 12.8+          |

**Empfohlene Clore.ai-Konfiguration:**

* **Bestes Preis-Leistungs-Verhältnis:** 4× RTX 4090 ($0.56–1.68/Std.) — Q4-GGUF-Quantisierung über llama.cpp oder Ollama ausführen
* **Produktionsqualität:** 8× A100 80GB ([Bare Metal](https://clore.ai/bare-metal)) — NVFP4 mit vollem Kontext über vLLM
* **Maximale Leistung:** 8× H100 (\~$8.32/Std.) — FP8, voller 256K-Kontext

## Schnellstart mit Ollama

Der schnellste Weg, Mistral Large 3 auf einer Multi-GPU-Clore.ai-Instanz auszuführen:

```bash
# Ollama installieren
curl -fsSL https://ollama.com/install.sh | sh

# Führen Sie das 675B-Modell aus (erfordert Multi-GPU, ~96GB+ VRAM für Q4)
ollama run mistral-large-3:675b

# Für die kleineren dichten Varianten (Single-GPU):
ollama run mistral3:14b    # 14B dicht — passt auf RTX 3060+
ollama run mistral3:8b     # 8B dicht — passt auf jede GPU
```

## Schnellstart mit vLLM (Produktion)

Für eine Produktionsbereitstellung mit OpenAI-kompatibler API:

```bash
# vLLM installieren
pip install vllm

# Bereitstellung mit NVFP4-Quantisierung auf 8× A100/H100
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4 \\
    --tensor-parallel-size 8 \
    --tokenizer-mode mistral \
    --config-format mistral \
    --load-format mistral \
    --max-model-len 65536 \
    --gpu-memory-utilization 0.90 \\
    --enable-auto-tool-choice \\
    --tool-call-parser mistral \
    --host 0.0.0.0 \
    --port 8000

# Für FP8 (Originalgewichte, höchste Qualität):
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512 \\
    --tensor-parallel-size 8 \
    --tokenizer-mode mistral \
    --config-format mistral \
    --load-format mistral \
    --max-model-len 131072 \\
    --host 0.0.0.0 \
    --port 8000
```

## Anwendungsbeispiele

### 1. Chat-Vervollständigung (OpenAI-kompatible API)

Sobald vLLM läuft, verwenden Sie einen beliebigen OpenAI-kompatiblen Client:

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[
        {"role": "system", "content": "Du bist ein hilfreicher Coding-Assistent."},
        {"role": "user", "content": "Schreibe einen asynchronen Python-Web-Scraper mit aiohttp und BeautifulSoup."}
    ],
    temperature=0.1,
    max_tokens=4096
)

print(response.choices[0].message.content)
```

### 2. Function Calling / Tool-Nutzung

Mistral Large 3 glänzt beim strukturierten Tool-Calling:

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

tools = [
    {
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "Aktuelles Wetter für einen Ort abrufen",
            "parameters": {
                "type": "object",
                "properties": {
                    "location": {"type": "string", "description": "Stadtname"},
                    "unit": {"type": "string", "enum": ["celsius", "fahrenheit"]}
                },
                "required": ["location"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[{"role": "user", "content": "Wie ist das Wetter in Tokio?"}],
    tools=tools,
    tool_choice="auto"
)

tool_call = response.choices[0].message.tool_calls[0]
print(f"Funktion: {tool_call.function.name}")
print(f"Argumente: {tool_call.function.arguments}")
```

### 3. Vision — Bildanalyse

Mistral Large 3 versteht Bilder nativ:

```python
import base64
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

# Bild kodieren
with open("diagram.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Beschreibe dieses Architekturdiagramm detailliert."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_b64}"}}
        ]
    }],
    max_tokens=2048
)

print(response.choices[0].message.content)
```

## Tipps für Clore.ai-Nutzer

1. **Starten Sie mit NVFP4 auf A100s** — Der `Mistral-Large-3-675B-Instruct-2512-NVFP4` Checkpoint ist speziell für A100/H100-Knoten konzipiert und bietet nahezu verlustfreie Qualität bei halb so hohem Speicherbedarf wie FP8.
2. **Ollama für schnelle Experimente verwenden** — Wenn Sie eine 4× RTX 4090-Instanz haben, verarbeitet Ollama GGUF-Quantisierung automatisch. Perfekt zum Testen, bevor Sie sich für ein vLLM-Produktionssetup entscheiden.
3. **Die API sicher freigeben** — Wenn Sie vLLM auf einer Clore.ai-Instanz ausführen, verwenden Sie SSH-Tunneling (`ssh -L 8000:localhost:8000 root@<ip>`) anstatt Port 8000 direkt freizugeben.
4. **Niedriger `max-model-len` um VRAM zu sparen** — Wenn Sie den vollen 256K-Kontext nicht benötigen, setzen Sie `--max-model-len 32768` oder `65536` um die KV-Cache-Speichernutzung deutlich zu reduzieren.
5. **Die dichten Alternativen in Betracht ziehen** — Für Single-GPU-Setups liefert Mistral 3 14B (`mistral3:14b` in Ollama) hervorragende Leistung auf einer einzelnen RTX 4090 und stammt aus derselben Modellfamilie.

## Fehlerbehebung

| Problem                              | Lösung                                                                                                                                  |
| ------------------------------------ | --------------------------------------------------------------------------------------------------------------------------------------- |
| `CUDA-Speicher erschöpft` auf vLLM   | Reduziere `--max-model-len` (probieren Sie 32768), erhöhen Sie `--tensor-parallel-size`, oder verwenden Sie das NVFP4-Checkpoint        |
| Langsame Generierungsgeschwindigkeit | Stelle sicher `--tensor-parallel-size` passt zu Ihrer GPU-Anzahl; aktivieren Sie speculative decoding mit Eagle-Checkpoint              |
| Ollama lädt 675B nicht               | Stellen Sie sicher, dass Sie über alle GPUs hinweg 96GB+ VRAM haben; Ollama benötigt `OLLAMA_NUM_PARALLEL=1` für große Modelle          |
| `tokenizer_mode mistral` Fehler      | Sie müssen alle drei Flags übergeben: `--tokenizer-mode mistral --config-format mistral --load-format mistral`                          |
| Vision funktioniert nicht            | Stellen Sie sicher, dass Bilder nahe an einem 1:1-Seitenverhältnis sind; vermeiden Sie sehr breite/schlanke Bilder für beste Ergebnisse |
| Download zu langsam                  | Verwende `huggingface-cli download mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4` mit `HF_TOKEN` setzen                            |

## Weiterführende Lektüre

* [Mistral-3-Ankündigungsblog](https://mistral.ai/news/mistral-3) — Offizieller Launch-Beitrag mit Benchmarks
* [HuggingFace-Modellkarte](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512) — Bereitstellungsanweisungen und Benchmark-Ergebnisse
* [NVFP4-quantisierte Version](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512-NVFP4) — Optimiert für A100/H100
* [GGUF-quantisiert (Unsloth)](https://huggingface.co/unsloth/Mistral-Large-3-675B-Instruct-2512-GGUF) — Für llama.cpp und Ollama
* [vLLM-Dokumentation](https://docs.vllm.ai/) — Produktions-Serving-Framework
* [Red-Hat-Day-0-Leitfaden](https://developers.redhat.com/articles/2025/12/02/run-mistral-large-3-ministral-3-vllm-red-hat-ai) — Schritt-für-Schritt-vLLM-Bereitstellung


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/mistral-large3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
