> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/mistral-medium35.md).

# Mistral Medium 3.5 (128B dicht, 256K)

Deploye Mistral Medium 3.5 auf Clore.ai — 128B dicht, 256K Kontext, dual-modales Reasoning, veröffentlicht im April 2026. Produktionsreife vLLM/SGLang-Einrichtung auf 4× H100 oder 2× H200.

{% hint style="info" %}
**Status (April 2026):** Mistral Medium 3.5 wurde veröffentlicht am **29. April 2026** von Mistral AI als Nachfolger von Mistral Medium 3. Die Gewichte sind unter [huggingface.co/mistralai/Mistral-Medium-3.5](https://huggingface.co/mistralai/Mistral-Medium-3.5) unter der **Mistral-Forschungslizenz (MRL)** für die Forschung; die **Mistral-Kommerzlizenz** ist für den Produktionseinsatz über die Evaluierung hinaus erforderlich. vLLM (≥ 0.8.x) und SGLang bringen Unterstützung ab Tag 0 mit.
{% endhint %}

Mistral Medium 3.5 ist ein **128B-dichter Transformer** mit einem **Kontextfenster mit 256K Tokens** und ein **nativer Reasoning-Umschalter** das zwischen schnellen "instant"-Antworten und längeren Chain-of-Thought-"deep"-Spuren im selben Checkpoint umschaltet. Die Veröffentlichung bündelt drei zuvor getrennte Mistral-Linien — **Medium 3** (allgemeine Anweisung), **Codestral** (Code) und Mistrals Reasoning-Vorschau — zu einem einzigen umschaltbaren Modell, was die wichtigste Änderung für Engineering-Teams ist, die mit mehreren Gewichten jonglierten.

Für Clore.ai-Nutzer ist die praktische Konsequenz die Dimensionierung. Ein 128B-dichtes Modell in FP8 wiegt ungefähr **128 GB** vor dem KV-Cache, also **nicht** passt es nicht mit voller Präzision auf eine einzelne 80-GB-GPU — Sie benötigen **4× H100 80 GB** (FP8) oder **2× H200 141 GB** um es sauber über vLLM bereitzustellen. Auf dem Marktplatz landet das bei ungefähr [**Bare Metal**](https://clore.ai/bare-metal) für das 4× H100-Setup oder **\~$4,16/h** für 2× H200, was für die meisten Teams der Sweet Spot ist. Single-H100-Deployments funktionieren nur mit aggressiver Q4-GGUF-Quantisierung (\~70 tok/s via llama.cpp), und der 256K-Kontext ist das Erste, das beim Komprimieren verschwindet.

## Hauptfunktionen

* **128B-dichte Parameter** — keine MoE-Routing-Tricks, ein vorhersehbares VRAM- und Latenzprofil, einfacher feinabzustimmen als spärliche Modelle
* **256K-Kontextfenster** — Analyse der gesamten Codebasis, RAG für lange Dokumente, mehrstufige Agenten-Schleifen ohne Trunkierung
* **Reasoning mit zwei Modi** — umschalten `reasoning_mode=instant` für eine Chat-Latenz von ca. `reasoning_mode=deep` um eine `<think>` Spur vor der Antwort anzuzeigen
* **Vereinheitlichte Anweisung + Code + Reasoning** — ein Satz Gewichte ersetzt Medium 3 + Codestral + die Reasoning-Vorschau
* **Funktionsaufrufe und strukturierte Ausgaben** — native JSON-Schema-Durchsetzung, OpenAI-kompatibles Tool-Call-Format
* **Offene Gewichte** — MRL für Forschung, kommerzielle Lizenz verfügbar; die Gewichte bleiben auf Ihrer Box und gehen nie per Roundtrip an eine Anbieter-API
* **Unterstützung für vLLM und SGLang ab Tag 0** — produktionsreife FP8-Pfade, Tensor-Parallelität, Chunked Prefill, kontinuierliches Batching

## Reasoning-Modi

Medium 3.5 ist das erste Mistral-Modell, das einen einzelnen Checkpoint ausliefert, der sowohl "schnelle" als auch "denkende" Antworten bereitstellt. Der Umschalter wird zur Anfragezeit und nicht zur Ladezeit gesteuert, sodass ein vLLM-Prozess beide Modi für denselben Aufrufer behandelt.

| Modus                | Wann verwenden                                                                                   | Typische TTFT                      | Ausgabeform                                            |
| -------------------- | ------------------------------------------------------------------------------------------------ | ---------------------------------- | ------------------------------------------------------ |
| `instant` (Standard) | Chat, Autovervollständigung, Klassifikation, Funktionsaufrufe, bei denen Latenz wichtig ist      | 50–250 ms                          | Nur Antwort                                            |
| `deep`               | Code-Review, mehrstufige Planung, Mathematik, schwieriges Debugging, Planungsschritt des Agenten | 1–6 s vor dem ersten Antwort-Token | `<think>...</think>` Spur, dann die endgültige Antwort |

In `deep` Im Modus gibt das Modell einen versteckten Reasoning-Abschnitt aus (eingehüllt in `<think>...</think>` vom Chat-Template) vor der sichtbaren Antwort aus. Das kostet pro Runde irgendwo zwischen ein paar hundert und ein paar tausend zusätzliche Token, also **aktivieren Sie es nicht für jede Anfrage** — reservieren Sie es für Aufgaben, bei denen Sie sonst ein kleineres Modell mit „denke Schritt für Schritt“ auffordern würden. Ein vernünftiges Muster ist, beizubehalten `instant` als Standard und nur eskalieren zu `deep` für Planungsschritte von Tool-Aufrufen oder die Synthese der endgültigen Antwort.

{% hint style="warning" %}
**Vom Anbieter empfohlenes Sampling.** Mistral empfiehlt `temperature=0.15` für `instant` und `temperature=0.7` mit `top_p=0.95` für `deep` Modus. Sampling mit Nulltemperatur neigt dazu, Reasoning-Spuren früh abzuschneiden.
{% endhint %}

## Wählen Sie Ihre Bereitstellung

Drei realistische Konfigurationen auf dem Clore.ai-Marktplatz. Wählen Sie zuerst nach VRAM-Budget, dann nach Durchsatz.

| Einrichtung                                                                                                         | Präzision           | Gesamter VRAM | Kontext (praktisch) | Durchsatz      | Empfohlene Clore-Stufe                   | Hinweise                                                               |
| ------------------------------------------------------------------------------------------------------------------- | ------------------- | ------------- | ------------------- | -------------- | ---------------------------------------- | ---------------------------------------------------------------------- |
| 1× H100 80 GB                                                                                                       | Q4 GGUF (llama.cpp) | 80 GB         | 32K–64K             | \~50–70 tok/s  | Single-GPU, Evaluierung/Entwicklung      | Aggressive Quantisierung; etwas Qualität bei langem Code geht verloren |
| 4× [H100](https://clore.ai/rent-h100.html?utm_source=docs\&utm_medium=guide\&utm_campaign=mistral-medium-35) 80 GB  | FP8 (vLLM)          | 320 GB        | Volle 256K          | \~80–140 tok/s | **Produktions-Sweet-Spot**               | TP=4, bestes tok/$ für anhaltenden Traffic                             |
| 2× [H200](https://clore.ai/rent-h200.html?utm_source=docs\&utm_medium=guide\&utm_campaign=mistral-medium-35) 141 GB | FP8 oder BF16       | 282 GB        | Volle 256K          | \~90–130 tok/s | Hoher Kontext, weniger GPUs zu verwalten | Einfachere Topologie, Spielraum für den KV-Cache bei 256K              |

{% hint style="success" %}
**Standardwahl:** **4× H100 80 GB FP8** über vLLM. Sie erhalten den vollen 256K-Kontext, \~100 tok/s dauerhaft, eine OpenAI-kompatible API und sauberes Tensor-Parallel-Scaling — für ungefähr die täglichen Kosten eines einzigen stark genutzten Claude-Opus-Platzes.
{% endhint %}

## Serveranforderungen

{% hint style="warning" %}
**Multi-GPU-Rigs der 80GB-Klasse sind auf dem Clore.ai-Marktplatz nicht gelistet.** Die größten heute gelisteten Systeme sind 4× RTX PRO 6000 Blackwell (je 96 GB, 380 GB gesamt) und 8–11× RTX 5090 (je 32 GB). Kapazitäten für A100 / H200 / B200 werden als [Bare Metal](https://clore.ai/bare-metal) auf Anfrage verkauft. Prüfe [GPU-Preise & Verfügbarkeit](/guides/guides_v2-de/erste-schritte/pricing.md) bevor du eine Bereitstellung dimensionierst.
{% endhint %}

| Komponente        | Minimum (Q4 Single-GPU)   | Empfohlen (FP8, 4× H100)        | Hoher Kontext (2× H200) |
| ----------------- | ------------------------- | ------------------------------- | ----------------------- |
| GPU-VRAM          | 80 GB (1× H100)           | 4× 80 GB = 320 GB               | 2× 141 GB = 282 GB      |
| System-RAM        | 128 GB                    | 256 GB                          | 256 GB                  |
| Festplatte (NVMe) | 200 GB                    | 400 GB                          | 400 GB                  |
| Netzwerk          | 1 Gbit/s+ für HF-Download | 1 Gbit/s+                       | 1 Gbit/s+               |
| CUDA              | 12.8+                     | 12.8+                           | 12.8+                   |
| Treiber           | ≥ 555                     | ≥ 555                           | ≥ 555                   |
| Startzeit         | 3–6 Min. (Cold Pull)      | 6–12 Min. (Cold Pull, 4 Shards) | 5–10 Min.               |

Der erste Kaltstart wird vom HuggingFace-Download dominiert — FP8-Gewichte sind ungefähr **128 GB**, BF16 eher bei **256 GB**. Hängen Sie ein persistentes Volume auf `/root/.cache/huggingface` sodass Sie diese Bandbreitenkosten nur einmal pro Server bezahlen.

## Schnellbereitstellung auf CLORE.AI

Der schnellste Weg ist das offizielle `vllm/vllm-openai` Image mit Tensor-Parallelität, die auf Ihre GPU-Anzahl gesetzt ist. Das folgende Beispiel geht von einer 4× H100-Instanz aus.

**Docker-Image:**

```
vllm/vllm-openai:latest
```

**Ports:**

```
22/tcp
8000/http
```

**Startbefehl (4× H100, FP8):**

```bash
vllm serve mistralai/Mistral-Medium-3.5-FP8 \\
    --tensor-parallel-size 4 \
    --max-model-len 65536 \
    --gpu-memory-utilization 0.90 \\
    --enable-chunked-prefill \\
    --enable-auto-tool-choice \\
    --tool-call-parser mistral \
    --reasoning-parser mistral \\
    --tokenizer-mode mistral \
    --config-format mistral \
    --load-format mistral \
    --served-model-name mistral-medium-3.5 \\
    --host 0.0.0.0 \
    --port 8000
```

**Alternative — 2× H200 BF16:**

```bash
vllm serve mistralai/Mistral-Medium-3.5 \\
    --tensor-parallel-size 2 \
    --max-model-len 131072 \\
    --gpu-memory-utilization 0.92 \
    --enable-chunked-prefill \\
    --enable-auto-tool-choice \\
    --tool-call-parser mistral \
    --reasoning-parser mistral \\
    --tokenizer-mode mistral \
    --config-format mistral \
    --load-format mistral \
    --served-model-name mistral-medium-3.5 \\
    --host 0.0.0.0 \
    --port 8000
```

{% hint style="info" %}
Beginnen Sie mit `--max-model-len 65536` selbst auf Hardware, die mehr aufnehmen könnte. Der KV-Cache-Speicher wächst linear mit dem Kontext, und die meisten Workloads erreichen nie 256K. Erhöhen Sie ihn erst, wenn Sie den Anfrage-Mix bestätigt haben.
{% endhint %}

**SGLang-Alternative** (oft auf Hopper schneller bei langen Prefills):

```bash
python3 -m sglang.launch_server \
    --model-path mistralai/Mistral-Medium-3.5-FP8 \\
    --tp-size 4 \\
    --tool-call-parser mistral \
    --reasoning-parser mistral \\
    --mem-fraction-static 0.88 \\
    --context-length 65536 \\
    --served-model-name mistral-medium-3.5 \\
    --host 0.0.0.0 \
    --port 8000
```

## Anwendungsbeispiele

Nach der Bereitstellung findest du deine `http_pub` URL in **Meine Bestellungen** auf Clore.ai (z. B. `abc123.clorecloud.net`). Ersetzen Sie `localhost:8000` mit `https://YOUR_HTTP_PUB_URL` in den folgenden Beispielen, wenn Sie von außerhalb des Servers aufrufen.

### 1. Chat — Instant-Modus (Standard)

Antwort mit niedriger Latenz, keine sichtbare Reasoning-Spur. Gut für Chat-UIs, Autovervollständigung, Klassifikation.

```bash
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mistral-medium-3.5",
    "messages": [
      {"role": "system", "content": "Sie sind ein Senior-Backend-Engineer."},
      {"role": "user", "content": "Schreibe eine Go-HTTP-Middleware, die pro API-Schlüssel mit einem Token-Bucket drosselt."}
    ],
    "temperature": 0.15,
    "max_tokens": 1024,
    "extra_body": {"reasoning_mode": "instant"}
  }'
```

### 2. Chat — Deep-Modus (Reasoning-Umschalter)

Aktiviert die `<think>` Spur vor der endgültigen Antwort. Verwenden Sie es für schwieriges Debugging, Planung, Mathematik.

```bash
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mistral-medium-3.5",
    "messages": [
      {"role": "user", "content": "Ein Nutzer meldet, dass unser Payment-Webhook für 1 % der Bestellungen zweimal ausgelöst wird. Gehen Sie die wahrscheinlichsten Ursachen in Reihenfolge der Wahrscheinlichkeit durch und schlagen Sie einen Diagnoseplan vor."}
    ],
    "temperature": 0.7,
    "top_p": 0.95,
    "max_tokens": 4096,
    "extra_body": {"reasoning_mode": "deep"}
  }'
```

Die Antwort enthält ein `reasoning_content` Feld (vLLM parst den `<think>...</think>` Abschnitt aus der sichtbaren Nachricht) zusammen mit `content`. Entfernen Sie die Spur oder zeigen Sie sie je nach Ihrem Produkt an.

### 3. Python — OpenAI-kompatibler Client

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

# Instant-Modus — Chat
response = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[
        {"role": "system", "content": "Du bist ein hilfreicher Coding-Assistent."},
        {"role": "user", "content": "Überarbeiten Sie diese Python-Funktion für bessere Lesbarkeit."}
    ],
    temperature=0.15,
    max_tokens=1024,
    extra_body={"reasoning_mode": "instant"}
)
print(response.choices[0].message.content)

# Deep-Modus — Planungsschritt
plan = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[
        {"role": "user", "content": "Planen Sie eine Migration von MongoDB zu PostgreSQL für eine 2-TB-Bestell-Tabelle ohne Ausfallzeit."}
    ],
    temperature=0.7,
    max_tokens=4096,
    extra_body={"reasoning_mode": "deep"}
)

msg = plan.choices[0].message
print("THINKING:\n", getattr(msg, "reasoning_content", ""))
print("\nANSWER:\n", msg.content)
```

### 4. Strukturierte Ausgaben — JSON-Schema

Medium 3.5 unterstützt JSON-Schema-gesteuertes Decoding über vLLMs `response_format`. Nützlich, wenn der nachgelagerte Konsument ein Parser und kein Mensch ist.

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="x")

schema = {
    "type": "object",
    "properties": {
        "severity": {"type": "string", "enum": ["low", "medium", "high", "critical"]},
        "categories": {
            "type": "array",
            "items": {"type": "string", "enum": ["auth", "payments", "db", "ui", "infra"]}
        },
        "summary": {"type": "string", "maxLength": 240},
        "next_action": {"type": "string"}
    },
    "required": ["severity", "categories", "summary", "next_action"],
    "additionalProperties": False
}

response = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[
        {"role": "system", "content": "Klassifizieren Sie den eingehenden Bug-Report. Geben Sie striktes JSON zurück."},
        {"role": "user", "content": "Login schlägt für Nutzer mit Apostrophen in ihrer E-Mail fehl und gibt einen 500-Fehler von /webapi/login zurück."}
    ],
    temperature=0.0,
    response_format={
        "type": "json_schema",
        "json_schema": {"name": "triage", "schema": schema, "strict": True}
    },
    extra_body={"reasoning_mode": "instant"}
)

import json
print(json.loads(response.choices[0].message.content))
```

### 5. Funktionsaufruf

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="x")

tools = [{
    "type": "function",
    "function": {
        "name": "search_orders",
        "description": "Durchsucht die Bestelldatenbank nach Benutzer-ID und optionalem Datumsbereich",
        "parameters": {
            "type": "object",
            "properties": {
                "user_id": {"type": "string"},
                "start_date": {"type": "string", "format": "date"},
                "end_date": {"type": "string", "format": "date"}
            },
            "required": ["user_id"]
        }
    }
}]

response = client.chat.completions.create(
    model="mistral-medium-3.5",
    messages=[{"role": "user", "content": "Finden Sie alle Bestellungen für Benutzer u_4821 im April 2026."}],
    tools=tools,
    tool_choice="auto",
    temperature=0.1
)

for call in response.choices[0].message.tool_calls or []:
    print(call.function.name, call.function.arguments)
```

## Leistungstipps

1. **Bevorzugen Sie den FP8-Checkpoint auf Hopper.** `Mistral-Medium-3.5-FP8` ist der vom Anbieter bereitgestellte FP8-Build und etwa 2× leichter als BF16 bei vernachlässigbarem Qualitätsverlust auf Hopper-Klasse-Hardware. Er ist die richtige Standardwahl für sowohl 4× H100 als auch 2× H200.
2. **Tensor-Parallelität = Anzahl der GPUs.** Für 4× H100 verwenden Sie `--tensor-parallel-size 4`; für 2× H200 verwenden Sie `--tensor-parallel-size 2`. Pipeline-Parallelität auf einem einzelnen Knoten schadet bei einem 128B-dichten Modell in der Regel dem Durchsatz.
3. **Beschränken Sie `max-model-len` auf das, was Sie tatsächlich nutzen.** Der KV-Cache bei 256K ist enorm — eine einzelne Sequenz im vollen Kontext kann 30–50 GB verbrauchen. Setzen Sie `--max-model-len 65536` (oder 32768), sofern Sie keinen nachgewiesenen Bedarf für mehr haben, und erhöhen Sie ihn erst nach Profiling.
4. **Aktivieren Sie Chunked Prefill.** `--enable-chunked-prefill` hält die Decodierungstoken in Fluss, während große Prompts noch verarbeitet werden. Bei 100K+-Prompts ist das der Unterschied zwischen „reagierend“ und „Zeitüberschreitung“.
5. **Speichern Sie die Gewichte im Cache.** Hängen Sie ein Docker-Volume auf `/root/.cache/huggingface` und verwenden Sie es über Neustarts hinweg erneut. Das erneute Herunterladen von 128 GB bei jedem Kaltstart ist die häufigste Ursache dafür, dass „vLLM scheint langsam zu starten“.
6. **KV-Cache-Quantisierung für etwas zusätzlichen Spielraum.** Auf 4× H100 können Sie mit mehr gleichzeitige Sitzungen herausquetschen mit `--kv-cache-dtype fp8`. Der Anbieter berichtet von nahezu verlustfreier Qualität; prüfen Sie dies auf Ihrem Evaluierungssatz, bevor Sie es in der Produktion aktivieren.
7. **Nicht verwenden `deep` Modus für jede Anfrage.** Reasoning-Spuren kosten echte Token und echte Latenz. Leiten Sie nach Aufgabentyp um: Klassifikation, Autovervollständigung und Tool-Argument-Generierung bleiben in `instant`; Planungs- und Verifikationsschritte eskalieren zu `deep`.
8. **Spekulatives Decoding hilft.** vLLM und SGLang unterstützen beide spekulatives Decoding mit einem Draft-Modell (z. B. mit einem Ministral-3B-Draft). Bei langen Code-Vervollständigungen bringt das typischerweise 1,3–1,7× Durchsatz ohne Qualitätsverlust.

## Benchmarks

{% hint style="warning" %}
**Vom Anbieter veröffentlichte Zahlen — unabhängig verifizieren.** Die folgende Tabelle stammt aus der Ankündigung von Mistral AI vom 29. April 2026. Unabhängige Reproduktionen durch Dritte (LMSys, EQ-Bench, das SWE-Bench-Leaderboard) treffen noch ein. Als Richtungsangabe behandeln, nicht als autoritativ.
{% endhint %}

| Benchmark                   | Mistral Medium 3.5 (Anbieter) | Referenzpunkte (vom Anbieter zitiert) |
| --------------------------- | ----------------------------- | ------------------------------------- |
| MMLU-Pro                    | \~78%                         | Llama 4 Maverick \~76%, GPT-5.4 \~81% |
| HumanEval                   | \~92%                         | Codestral 25.01 \~88%, GLM-5.1 \~94%  |
| LiveCodeBench (Apr. 2026)   | \~68%                         | GLM-5.1 \~72%, Llama 4 Maverick \~64% |
| AIME 2025 (Deep-Modus)      | \~62%                         | GPT-5.4 \~73%, GLM-5.1 \~58%          |
| GPQA Diamond (Deep-Modus)   | \~59%                         | Claude Opus 4.6 \~63%, GLM-5.1 \~57%  |
| Abruf im Langkontext (128K) | \~95%                         | Llama 4 Maverick \~93%                |

Die Positionierung, die Mistral anstrebt: **etwa die Klasse von Llama 4 Maverick / GLM-5.1 bei allgemeinen Aufgaben, geringere Lücke beim Coden, separater Reasoning-Umschalter**. Es wird nicht als Herausforderer von GPT-5.4 / Claude Opus 4.6 positioniert.

## Fehlerbehebung

| Problem                                                             | Lösung                                                                                                                                                                                           |
| ------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| `CUDA-Speicher erschöpft` beim Laden (4× H100)                      | Sie laden wahrscheinlich versehentlich BF16. Verwenden Sie den FP8-Checkpoint (`Mistral-Medium-3.5-FP8`) oder wechseln Sie zu `--max-model-len 32768`.                                           |
| `CUDA-Speicher erschöpft` mit 256K-Kontext mitten in der Anfrage    | Der KV-Cache ist explodiert. Verringern Sie `--max-model-len`, aktivieren Sie `--kv-cache-dtype fp8`, oder begrenzen Sie `--max-num-seqs` (versuchen Sie 8).                                     |
| Deep-Modus erzeugt leere `reasoning_content`                        | Bestätigen Sie `--reasoning-parser mistral` ist in vLLM gesetzt und dass `temperature ≥ 0.5`. Sampling mit Nulltemperatur schneidet die Spur ab.                                                 |
| Langsame Zeit bis zum ersten Token im Deep-Modus                    | Erwartet — der Deep-Modus gibt einen `<think>` Abschnitt aus, bevor irgendeine sichtbare Ausgabe erfolgt. Streamen Sie zum Client mit `stream=true` und zeigen Sie einen „denke…“-UI-Zustand an. |
| `403 Verboten` beim HuggingFace-Download                            | Mistral Medium 3.5 ist **zugangsbeschränkt**. Akzeptieren Sie die MRL auf der Modellkarte und setzen Sie `HF_TOKEN` sie in der Container-Umgebung.                                               |
| `tokenizer_mode mistral` Fehler                                     | Alle drei Flags werden zusammen benötigt: `--tokenizer-mode mistral --config-format mistral --load-format mistral`.                                                                              |
| Tool-Calls stillschweigend verworfen                                | Setzen Sie beide `--enable-auto-tool-choice` und `--tool-call-parser mistral`. Ohne den Parser gibt vLLM Tool-Argumente als Klartext zurück.                                                     |
| Der Durchsatz bricht bei mehr als \~32 gleichzeitigen Sitzungen ein | Sie stoßen auf KV-Cache-Verdrängung. Verringern Sie `--max-model-len`, erhöhen Sie `--gpu-memory-utilization` auf 0,92 oder skalieren Sie auf eine zweite Replik hoch.                           |
| Lizenzfehler blockiert kommerzielle Nutzung                         | MRL ist nur für Forschung. Kontaktieren Sie Mistral Sales wegen der kommerziellen Lizenz, bevor Sie zahlende Nutzer bedienen.                                                                    |

## FAQ

**F: Mistral Medium 3.5 vs. Llama 4 Maverick — welches soll ich wählen?**

Beide liegen in einer ähnlichen Gewichtsklasse (Maverick ist ein 17B-aktives MoE bei 400B gesamt; Medium 3.5 ist 128B dicht). Wählen Sie **Medium 3.5** wenn Sie vorhersehbares VRAM/Latenzverhalten, den Reasoning-Umschalter mit zwei Modi in einem Checkpoint und stärkere Code-Performance wollen. Wählen Sie **Llama 4 Maverick** wenn Sie eine permissive Lizenz für uneingeschränkte kommerzielle Nutzung benötigen (Llama 4 ist community-lizenziert, Medium 3.5 benötigt für die Produktion eine Mistral-Kommerzlizenz) oder wenn Sie die günstigeren Inferenzkosten pro Token wollen, die MoE Ihnen pro Anfrage bietet.

**F: Wie aktiviere ich den Reasoning-Modus?**

Übergeben Sie `extra_body={"reasoning_mode": "deep"}` im OpenAI-Python-Client, oder fügen Sie `"reasoning_mode": "deep"` auf der obersten Ebene Ihres HTTP-JSON-Textkörpers. Der Standard ist `"instant"`. Auf der Serverseite stellen Sie sicher, dass vLLM gestartet wurde mit `--reasoning-parser mistral` damit das `<think>` span in das `reasoning_content` Feld statt in `content`.

**F: Warum 4× H100 statt 2× H100?**

FP8-Gewichte liegen vor dem KV-Cache bei etwa 128 GB. 2× H100 80 GB ergeben insgesamt 160 GB — genug, um die Gewichte zu laden, aber mit fast keinem Spielraum für KV-Cache, Aktivierungen oder selbst ein moderates Kontextfenster. In der Praxis laufen 2× H100 unmittelbar nach 8K Kontext in einen OOM. **4× H100 ist das Minimum für eine nutzbare Bereitstellung mit 256K-Fähigkeit**; 2× H200 (282 GB) ist die Alternative, wenn Sie lieber weniger GPUs mit etwas höheren Kosten pro GPU verwalten.

**F: Kann ich Mistral Medium 3.5 kommerziell nutzen?**

Die standardmäßige Mistral Research License (MRL) erlaubt Forschung und interne Evaluierung, aber **nicht** keine kommerzielle Produktion. Für Bereitstellungen, die sich an zahlende Kunden richten, benötigen Sie die **Mistral-Kommerzlizenz** — wenden Sie sich an den Vertrieb von Mistral. Dies ist dieselbe Einschränkung, die zuvor für Medium 3 und Codestral galt. Wenn eine kommerziell freundliche Lizenzierung eine harte Anforderung ist, schauen Sie sich [Mistral Small 3.1](/guides/guides_v2-de/sprachmodelle/mistral-small.md) (Apache 2.0) oder [Llama 4](/guides/guides_v2-de/sprachmodelle/llama4.md) (Llama-Community-Lizenz).

**F: Unterstützt Medium 3.5 Vision oder Audio?**

Nein. Medium 3.5 ist nur für Text. Für multimodales Mistral verwenden Sie [Mistral Large 3](/guides/guides_v2-de/sprachmodelle/mistral-large3.md), das mit einem 2,5B-Vision-Encoder ausgeliefert wird. Für andere multimodale Optionen auf Clore.ai siehe Qwen3.5-Omni oder Gemma 3.

## Verwandte Leitfäden

* [Mistral Large 3](/guides/guides_v2-de/sprachmodelle/mistral-large3.md) — multimodales Frontier-Modell mit 675B MoE, Apache 2.0, wenn Sie Vision und maximale Qualität benötigen
* [Mistral & Mixtral](/guides/guides_v2-de/sprachmodelle/mistral-mixtral.md) — ältere Mistral 7B und Mixtral 8x7B/8x22B für Einzel-GPU-Bereitstellungen
* [vLLM](/guides/guides_v2-de/sprachmodelle/vllm.md) — Framework für den produktiven Betrieb, das empfohlene Backend für Medium 3.5
* [Llama 4](/guides/guides_v2-de/sprachmodelle/llama4.md) — nächstliegender Open-Weight-Verwandter in dieser Größenordnung, permissiv lizenzierte Alternative

### Externe Links

* [Mistral Medium 3.5 auf HuggingFace](https://huggingface.co/mistralai/Mistral-Medium-3.5)
* [Mistral Medium 3.5 FP8-Checkpoint](https://huggingface.co/mistralai/Mistral-Medium-3.5-FP8)
* [Ankündigung von Mistral AI (29. April 2026)](https://mistral.ai/news/mistral-medium-3-5)
* [Mistral-Forschungslizenz](https://mistral.ai/licenses/MRL-0.1.md)
* [vLLM-Dokumentation](https://docs.vllm.ai)
* [SGLang-Repo](https://github.com/sgl-project/sglang)
* [Clore.ai-Marktplatz](https://clore.ai/marketplace) — mieten Sie H100 / H200 von [Bare Metal](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/mistral-medium35.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
