Qwen3.5
Führe Alibaba Qwen3.5 auf Clore.ai aus — das frischeste Frontier-Modell (Feb. 2026)
Qwen3.5, veröffentlicht am 16. Februar 2026, ist Alibabas neuestes Flaggschiffmodell und eine der heißesten Open-Source-Veröffentlichungen von 2026. Das 397B MoE-Flaggschiff schlug Claude 4.5 Opus im HMMT-Mathe-Benchmark, während das kleinere 35B-Dichtmodell passt auf eine einzelne RTX 4090. Alle Modelle kommen von Haus aus mit agentischen Fähigkeiten (Tool-Nutzung, Funktionsaufrufe, autonome Aufgabenausführung) und multimodalem Verständnis.
Wichtige Merkmale
Drei Größen: 9B (dicht), 35B (dicht), 397B (MoE) — für jede GPU etwas dabei
Schlägt Claude 4.5 Opus im HMMT-Mathe-Benchmark
Nativ multimodal: Text- und Bildverständnis
Agentische Fähigkeiten: Tool-Nutzung, Funktionsaufrufe, autonome Workflows
128K-Kontextfenster: Große Dokumente und Codebasen verarbeiten
Apache-2.0-Lizenz: Vollständige kommerzielle Nutzung, keine Einschränkungen
Modellvarianten
Qwen3.5-9B
9B
Dicht
6 GB
18 GB
Schnell, effizient
Qwen3.5-35B
35B
Dicht
22 GB
70 GB
Bestes Einzel-GPU-Modell
Qwen3.5-397B
397B
MoE
~100 GB
400 GB+
Spitzenklasse
Anforderungen
Multi-GPU-Rigs der 80-GB-Klasse sind auf dem Clore.ai-Marktplatz nicht gelistet. Die größten heute gelisteten Setups sind 4× RTX PRO 6000 Blackwell (je 96 GB, insgesamt 380 GB) und 8–11× RTX 5090 (je 32 GB). A100-/H200-/B200-Kapazität wird als Bare Metal auf Anfrage verkauft. Prüfe GPU-Preise & Verfügbarkeit bevor du ein Deployment dimensionierst.
GPU
RTX 3080 10GB
RTX 4090 24GB
4× H100 80GB
VRAM
8 GB
22 GB
320 GB+
RAM
16 GB
32 GB
128 GB
Festplatte
15 GB
30 GB
250 GB
Empfohlene Clore.ai-GPU: RTX 4090 24 GB (0,14–0,42 $/Std.) für 35B — beste Qualität fürs Geld
Schnellstart mit Ollama
vLLM-Einrichtung (Produktion)
HuggingFace Transformers
Beispiel für agentische Nutzung / Tool-Nutzung
Warum Qwen3.5 auf Clore.ai?
Das 35B-Modell ist wohl das beste Modell, das du auf einer einzelnen RTX 4090 ausführen kannst:
Übertrifft Llama 4 Scout bei Mathematik und Schlussfolgerung
Übertrifft Gemma 3 27B bei agentischen Aufgaben
Tool-Nutzung / Funktionsaufrufe funktionieren sofort
Apache 2.0 = keine Lizenzprobleme
Für 0,14–0,42 $/Std. für eine RTX 4090 bekommst du KI der Spitzenklasse zum Preis eines Kaffees.
Tipps für Clore.ai-Nutzer
35B ist der Sweet Spot: Passt auf eine RTX 4090 in Q4, übertrifft die meisten 70B-Modelle
9B fürs Budget: Sogar eine RTX 3060 (0,03–0,07 $/Std.) betreibt das 9B-Modell gut
Nutze Ollama für den Schnellstart: Ein Befehl zum Bereitstellen; OpenAI-kompatible API enthalten
Agentische Workflows: Qwen3.5 ist hervorragend in der Tool-Nutzung — kombiniere es mit Funktionsaufrufen für Automatisierung
Frisches Modell = weniger im Cache: Der erste Download dauert eine Weile (~20 GB für 35B). Vorab ziehen, bevor deine Arbeitslast startet
Fehlerbehebung
35B OOM auf 24 GB
Verwende load_in_4bit=True oder reduziere --max-model-len
Ollama-Modell nicht gefunden
Ollama aktualisieren: curl -fsSL https://ollama.com/install.sh | sh
Langsam bei der ersten Anfrage
Das Laden des Modells dauert 30–60 s; nachfolgende Anfragen sind schnell
Funktionsaufrufe funktionieren nicht
Stelle sicher, dass du übergibst tools Parameter; verwende nur die Instruct-Variante
Weiterführende Lektüre
Zuletzt aktualisiert
War das hilfreich?