Qwen2.5
Führe Alibabas Qwen2.5-Mehrsprach-LLMs auf Clore.ai-GPUs aus
Führe Alibabas Qwen2.5-Modellfamilie aus – leistungsstarke mehrsprachige LLMs mit hervorragenden Code- und Mathematikfähigkeiten auf CLORE.AI-GPUs.
Alle Beispiele können auf GPU-Servern ausgeführt werden, die gemietet wurden über CLORE.AI-Marktplatz.
Warum Qwen2.5?
Vielseitige Größen - 0,5B bis 72B Parameter
Mehrsprachig - 29 Sprachen, darunter Chinesisch
Langer Kontext - Bis zu 128K Tokens
Spezialisierte Varianten - Coder-, Math-Editionen
Open Source - Apache-2.0-Lizenz
Schnellbereitstellung auf CLORE.AI
Docker-Image:
vllm/vllm-openai:latestPorts:
22/tcp
8000/httpBefehl:
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 \
--port 8000Auf deinen Dienst zugreifen
Nach der Bereitstellung findest du deine http_pub URL in Meine Bestellungen:
Gehe zu Meine Bestellungen Seite
Klicke auf deine Bestellung
Finde die
http_pubURL (z. B.abc123.clorecloud.net)
Verwende https://YOUR_HTTP_PUB_URL anstelle von localhost in den folgenden Beispielen.
Prüfen, ob es funktioniert
Wenn du HTTP 502 erhältst, warte 5–15 Minuten – das Modell wird noch von HuggingFace heruntergeladen.
Qwen3-Reasoning-Modus
Bei der Verwendung von Qwen3-Modellen über vLLM können Antworten Reasoning enthalten:
Um Qwen3 mit Reasoning zu verwenden:
Modellvarianten
Basis-Modelle
Qwen2.5-0.5B
0.5B
2GB
32K
Edge/Tests
Qwen2.5-1.5B
1.5B
4 GB
32K
Sehr leicht
Qwen2.5-3B
3B
8 GB
32K
Budget
Qwen2.5-7B
7B
16 GB
128K
Ausgewogen
Qwen2.5-14B
14B
32 GB
128K
Hohe Qualität
Qwen2.5-32B
32B
70GB
128K
Sehr hohe Qualität
Qwen2.5-72B
72B
150GB
128K
Beste Qualität
Qwen2.5-72B-Instruct
72B
150GB
128K
Für Chat/Instruct optimiert
Spezialisierte Varianten
Qwen2.5-Coder-7B-Instruct
Code
Programmierung, Debugging
16 GB
Qwen2.5-Coder-14B-Instruct
Code
Komplexe Code-Aufgaben
32 GB
Qwen2.5-Coder-32B-Instruct
Code
Bestes Codemodell
70GB
Qwen2.5-Math-7B-Instruct
Mathematik
Berechnungen, Beweise
16 GB
Qwen2.5-Math-72B-Instruct
Mathematik
Mathematik auf Forschungsniveau
150GB
Qwen2.5-Instruct
Chat
Allgemeiner Assistent
variiert
Hardware-Anforderungen
Multi-GPU-Rigs der 80GB-Klasse sind auf dem Clore.ai-Marktplatz nicht gelistet. Die größten heute gelisteten Systeme sind 4× RTX PRO 6000 Blackwell (je 96 GB, 380 GB gesamt) und 8–11× RTX 5090 (je 32 GB). Kapazitäten für A100 / H200 / B200 werden als Bare Metal auf Anfrage verkauft. Prüfe GPU-Preise & Verfügbarkeit bevor du eine Bereitstellung dimensionierst.
0,5B-3B
RTX 3060 12 GB
RTX 3080
2-6GB
7B
RTX 3090 24 GB
RTX 4090
6 GB
14B
A100 40GB
A100 80GB
12 GB
32B
A100 80GB
2x A100 40 GB
22 GB
72B
2x A100 80 GB
4x A100 80 GB
48GB
Coder-32B
A100 80GB
2x A100 40 GB
22 GB
Installation
Mit vLLM (empfohlen)
Verwendung von Ollama
Mit Transformers
API-Nutzung
OpenAI-kompatible API
Streaming
cURL
Qwen2.5-72B-Instruct
Das Flaggschiff-Modell von Qwen2.5 — das größte und leistungsfähigste der Familie. Es konkurriert mit GPT-4 bei vielen Benchmarks und ist unter Apache 2.0 vollständig Open Source.
Ausführung über vLLM (Multi-GPU)
Ausführung über Ollama
Python-Beispiel
Qwen2.5-Coder-32B-Instruct
Das beste verfügbare Open-Source-Codemodell. Qwen2.5-Coder-32B-Instruct erreicht bei vielen Coding-Benchmarks GPT-4o oder übertrifft es und unterstützt über 40 Programmiersprachen.
Ausführung über vLLM
Ausführung über Ollama
Beispiele zur Codegenerierung
Qwen2.5-Coder
Optimiert für Codegenerierung:
Qwen2.5-Math
Speziell für mathematisches Schlussfolgern:
Mehrsprachige Unterstützung
Qwen2.5 unterstützt 29 Sprachen:
Langer Kontext (128K)
Quantisierung
GGUF mit Ollama
AWQ mit vLLM
GGUF mit llama.cpp
Multi-GPU-Einrichtung
Tensor-Parallelismus
Leistung
Durchsatz (Tokens/Sek.)
Qwen2.5-0.5B
250
320
380
400
Qwen2.5-3B
150
200
250
280
Qwen2.5-7B
75
100
130
150
Qwen2.5-7B Q4
110
140
180
200
Qwen2.5-14B
-
55
70
85
Qwen2.5-32B
-
-
35
50
Qwen2.5-72B
-
-
20 (2x)
40 (2x)
Qwen2.5-72B Q4
-
-
-
55 (2x)
Qwen2.5-Coder-32B
-
-
32
48
Zeit bis zum ersten Token (TTFT)
7B
60ms
40ms
35 ms
14B
120ms
80ms
60ms
32B
-
200ms
140ms
72B
-
400ms (2x)
280ms (2x)
Kontextlänge vs. VRAM (7B)
8K
16 GB
10 GB
6 GB
32K
24 GB
16 GB
10 GB
64K
40 GB
26GB
16 GB
128K
72GB
48GB
28GB
Benchmarks
Qwen2.5-7B
74.2%
75.6%
85.4%
55.2%
42.1%
Qwen2.5-14B
79.7%
81.1%
89.5%
65.8%
51.3%
Qwen2.5-32B
83.3%
84.2%
91.2%
72.1%
60.7%
Qwen2.5-72B
86.1%
86.2%
93.2%
79.5%
67.4%
Qwen2.5-Coder-7B
72.8%
88.4%
86.1%
58.4%
64.2%
Qwen2.5-Coder-32B
83.1%
92.7%
92.3%
76.8%
78.5%
Docker Compose
Kostenschätzung
Übliche CLORE.AI-Marktplatzpreise:
RTX 3090 24 GB
~$0.06
7B-Modelle
RTX 4090 24GB
~$0.10
7B-14B-Modelle
A100 40GB
~$0.17
14B-32B-Modelle
A100 80GB
~$0.25
32B-Modelle, Coder-32B
2x A100 80 GB
~$0.50
72B-Modelle
4x A100 80 GB
~$1.00
72B maximaler Kontext
Preise variieren je nach Anbieter. Prüfen CLORE.AI-Marktplatz für aktuelle Preise.
Geld sparen:
Verwende Spot Markt für flexible Workloads
Bezahlen Sie mit CLORE Tokens
Für Tests mit kleineren Modellen (7B) beginnen
Fehlerbehebung
Speicher erschöpft
Langsame Generierung
Anzeige chinesischer Zeichen
Modell nicht gefunden
Qwen2.5 im Vergleich zu anderen
Kontext
128K
128K
128K
128K
Mehrsprachig
Hervorragend
Hervorragend
Gut
Hervorragend
Code
Hervorragend
Hervorragend
Gut
Hervorragend
Mathe
Hervorragend
Hervorragend
Gut
Hervorragend
Chinesisch
Hervorragend
Hervorragend
Schlecht
Gut
Lizenz
Apache 2.0
Apache 2.0
Llama 3.1
Proprietär
Kosten
Kostenlos
Kostenlos
Kostenlos
Bezahlte API
Qwen2.5 verwenden, wenn:
Unterstützung für die chinesische Sprache benötigt wird
Mathe-/Code-Aufgaben Priorität haben
Langer Kontext erforderlich ist
Apache-2.0-Lizenz gewünscht
Bestes Open-Source-Codemodell benötigt (Coder-32B)
Nächste Schritte
vLLM - Produktionseinsatz
Ollama - Einfache lokale Einrichtung
DeepSeek-V3 - Größeres Reasoning-Modell
DeepSeek-R1 - Open-Source-Reasoning-Modell
LLM feinabstimmen - Anpassungstraining
Zuletzt aktualisiert
War das hilfreich?