For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.5

Führe Alibaba Qwen3.5 auf Clore.ai aus — das frischeste Frontier-Modell (Feb. 2026)

Qwen3.5, veröffentlicht am 16. Februar 2026, ist Alibabas neuestes Flaggschiffmodell und eine der heißesten Open-Source-Veröffentlichungen von 2026. Das 397B MoE-Flaggschiff schlug Claude 4.5 Opus im HMMT-Mathe-Benchmark, während das kleinere 35B-Dichtmodell passt auf eine einzelne RTX 4090. Alle Modelle kommen von Haus aus mit agentischen Fähigkeiten (Tool-Nutzung, Funktionsaufrufe, autonome Aufgabenausführung) und multimodalem Verständnis.

Wichtige Merkmale

  • Drei Größen: 9B (dicht), 35B (dicht), 397B (MoE) — für jede GPU etwas dabei

  • Schlägt Claude 4.5 Opus im HMMT-Mathe-Benchmark

  • Nativ multimodal: Text- und Bildverständnis

  • Agentische Fähigkeiten: Tool-Nutzung, Funktionsaufrufe, autonome Workflows

  • 128K-Kontextfenster: Große Dokumente und Codebasen verarbeiten

  • Apache-2.0-Lizenz: Vollständige kommerzielle Nutzung, keine Einschränkungen

Modellvarianten

Modell
Parameter
Typ
VRAM (Q4)
VRAM (FP16)
Stärke

Qwen3.5-9B

9B

Dicht

6 GB

18 GB

Schnell, effizient

Qwen3.5-35B

35B

Dicht

22 GB

70 GB

Bestes Einzel-GPU-Modell

Qwen3.5-397B

397B

MoE

~100 GB

400 GB+

Spitzenklasse

Anforderungen

Komponente
9B (Q4)
35B (Q4)
397B (Mehr-GPU)

GPU

RTX 3080 10GB

RTX 4090 24GB

4× H100 80GB

VRAM

8 GB

22 GB

320 GB+

RAM

16 GB

32 GB

128 GB

Festplatte

15 GB

30 GB

250 GB

Empfohlene Clore.ai-GPU: RTX 4090 24 GB (0,14–0,42 $/Std.) für 35B — beste Qualität fürs Geld

Schnellstart mit Ollama

vLLM-Einrichtung (Produktion)

HuggingFace Transformers

Beispiel für agentische Nutzung / Tool-Nutzung

Warum Qwen3.5 auf Clore.ai?

Das 35B-Modell ist wohl das beste Modell, das du auf einer einzelnen RTX 4090 ausführen kannst:

  • Übertrifft Llama 4 Scout bei Mathematik und Schlussfolgerung

  • Übertrifft Gemma 3 27B bei agentischen Aufgaben

  • Tool-Nutzung / Funktionsaufrufe funktionieren sofort

  • Apache 2.0 = keine Lizenzprobleme

Für 0,14–0,42 $/Std. für eine RTX 4090 bekommst du KI der Spitzenklasse zum Preis eines Kaffees.

Tipps für Clore.ai-Nutzer

  • 35B ist der Sweet Spot: Passt auf eine RTX 4090 in Q4, übertrifft die meisten 70B-Modelle

  • 9B fürs Budget: Sogar eine RTX 3060 (0,03–0,07 $/Std.) betreibt das 9B-Modell gut

  • Nutze Ollama für den Schnellstart: Ein Befehl zum Bereitstellen; OpenAI-kompatible API enthalten

  • Agentische Workflows: Qwen3.5 ist hervorragend in der Tool-Nutzung — kombiniere es mit Funktionsaufrufen für Automatisierung

  • Frisches Modell = weniger im Cache: Der erste Download dauert eine Weile (~20 GB für 35B). Vorab ziehen, bevor deine Arbeitslast startet

Fehlerbehebung

Problem
Lösung

35B OOM auf 24 GB

Verwende load_in_4bit=True oder reduziere --max-model-len

Ollama-Modell nicht gefunden

Ollama aktualisieren: curl -fsSL https://ollama.com/install.sh | sh

Langsam bei der ersten Anfrage

Das Laden des Modells dauert 30–60 s; nachfolgende Anfragen sind schnell

Funktionsaufrufe funktionieren nicht

Stelle sicher, dass du übergibst tools Parameter; verwende nur die Instruct-Variante

Weiterführende Lektüre

Zuletzt aktualisiert

War das hilfreich?