For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen2.5

Führe Alibabas Qwen2.5-Mehrsprach-LLMs auf Clore.ai-GPUs aus

Führe Alibabas Qwen2.5-Modellfamilie aus – leistungsstarke mehrsprachige LLMs mit hervorragenden Code- und Mathematikfähigkeiten auf CLORE.AI-GPUs.

Warum Qwen2.5?

  • Vielseitige Größen - 0,5B bis 72B Parameter

  • Mehrsprachig - 29 Sprachen, darunter Chinesisch

  • Langer Kontext - Bis zu 128K Tokens

  • Spezialisierte Varianten - Coder-, Math-Editionen

  • Open Source - Apache-2.0-Lizenz

Schnellbereitstellung auf CLORE.AI

Docker-Image:

vllm/vllm-openai:latest

Ports:

22/tcp
8000/http

Befehl:

python -m vllm.entrypoints.openai.api_server \
    --model Qwen/Qwen2.5-7B-Instruct \
    --host 0.0.0.0 \
    --port 8000

Auf deinen Dienst zugreifen

Nach der Bereitstellung findest du deine http_pub URL in Meine Bestellungen:

  1. Gehe zu Meine Bestellungen Seite

  2. Klicke auf deine Bestellung

  3. Finde die http_pub URL (z. B. abc123.clorecloud.net)

Verwende https://YOUR_HTTP_PUB_URL anstelle von localhost in den folgenden Beispielen.

Prüfen, ob es funktioniert

Qwen3-Reasoning-Modus

Neu in Qwen3: Einige Qwen3-Modelle unterstützen einen Reasoning-Modus, der den Denkprozess des Modells in <think> Tags vor der endgültigen Antwort anzeigt.

Bei der Verwendung von Qwen3-Modellen über vLLM können Antworten Reasoning enthalten:

Um Qwen3 mit Reasoning zu verwenden:

Modellvarianten

Basis-Modelle

Modell
Parameter
VRAM (FP16)
Kontext
Hinweise

Qwen2.5-0.5B

0.5B

2GB

32K

Edge/Tests

Qwen2.5-1.5B

1.5B

4 GB

32K

Sehr leicht

Qwen2.5-3B

3B

8 GB

32K

Budget

Qwen2.5-7B

7B

16 GB

128K

Ausgewogen

Qwen2.5-14B

14B

32 GB

128K

Hohe Qualität

Qwen2.5-32B

32B

70GB

128K

Sehr hohe Qualität

Qwen2.5-72B

72B

150GB

128K

Beste Qualität

Qwen2.5-72B-Instruct

72B

150GB

128K

Für Chat/Instruct optimiert

Spezialisierte Varianten

Modell
Fokus
Am besten geeignet für
VRAM (FP16)

Qwen2.5-Coder-7B-Instruct

Code

Programmierung, Debugging

16 GB

Qwen2.5-Coder-14B-Instruct

Code

Komplexe Code-Aufgaben

32 GB

Qwen2.5-Coder-32B-Instruct

Code

Bestes Codemodell

70GB

Qwen2.5-Math-7B-Instruct

Mathematik

Berechnungen, Beweise

16 GB

Qwen2.5-Math-72B-Instruct

Mathematik

Mathematik auf Forschungsniveau

150GB

Qwen2.5-Instruct

Chat

Allgemeiner Assistent

variiert

Hardware-Anforderungen

Modell
Minimale GPU
Empfohlen
VRAM (Q4)

0,5B-3B

RTX 3060 12 GB

RTX 3080

2-6GB

7B

RTX 3090 24 GB

RTX 4090

6 GB

14B

A100 40GB

A100 80GB

12 GB

32B

A100 80GB

2x A100 40 GB

22 GB

72B

2x A100 80 GB

4x A100 80 GB

48GB

Coder-32B

A100 80GB

2x A100 40 GB

22 GB

Installation

Mit vLLM (empfohlen)

Verwendung von Ollama

Mit Transformers

API-Nutzung

OpenAI-kompatible API

Streaming

cURL

Qwen2.5-72B-Instruct

Das Flaggschiff-Modell von Qwen2.5 — das größte und leistungsfähigste der Familie. Es konkurriert mit GPT-4 bei vielen Benchmarks und ist unter Apache 2.0 vollständig Open Source.

Ausführung über vLLM (Multi-GPU)

Ausführung über Ollama

Python-Beispiel

Qwen2.5-Coder-32B-Instruct

Das beste verfügbare Open-Source-Codemodell. Qwen2.5-Coder-32B-Instruct erreicht bei vielen Coding-Benchmarks GPT-4o oder übertrifft es und unterstützt über 40 Programmiersprachen.

Ausführung über vLLM

Ausführung über Ollama

Beispiele zur Codegenerierung

Qwen2.5-Coder

Optimiert für Codegenerierung:

Qwen2.5-Math

Speziell für mathematisches Schlussfolgern:

Mehrsprachige Unterstützung

Qwen2.5 unterstützt 29 Sprachen:

Langer Kontext (128K)

Quantisierung

GGUF mit Ollama

AWQ mit vLLM

GGUF mit llama.cpp

Multi-GPU-Einrichtung

Tensor-Parallelismus

Leistung

Durchsatz (Tokens/Sek.)

Modell
RTX 3090
RTX 4090
A100 40GB
A100 80GB

Qwen2.5-0.5B

250

320

380

400

Qwen2.5-3B

150

200

250

280

Qwen2.5-7B

75

100

130

150

Qwen2.5-7B Q4

110

140

180

200

Qwen2.5-14B

-

55

70

85

Qwen2.5-32B

-

-

35

50

Qwen2.5-72B

-

-

20 (2x)

40 (2x)

Qwen2.5-72B Q4

-

-

-

55 (2x)

Qwen2.5-Coder-32B

-

-

32

48

Zeit bis zum ersten Token (TTFT)

Modell
RTX 4090
A100 40GB
A100 80GB

7B

60ms

40ms

35 ms

14B

120ms

80ms

60ms

32B

-

200ms

140ms

72B

-

400ms (2x)

280ms (2x)

Kontextlänge vs. VRAM (7B)

Kontext
FP16
Q8
Q4

8K

16 GB

10 GB

6 GB

32K

24 GB

16 GB

10 GB

64K

40 GB

26GB

16 GB

128K

72GB

48GB

28GB

Benchmarks

Modell
MMLU
HumanEval
GSM8K
MATH
LiveCodeBench

Qwen2.5-7B

74.2%

75.6%

85.4%

55.2%

42.1%

Qwen2.5-14B

79.7%

81.1%

89.5%

65.8%

51.3%

Qwen2.5-32B

83.3%

84.2%

91.2%

72.1%

60.7%

Qwen2.5-72B

86.1%

86.2%

93.2%

79.5%

67.4%

Qwen2.5-Coder-7B

72.8%

88.4%

86.1%

58.4%

64.2%

Qwen2.5-Coder-32B

83.1%

92.7%

92.3%

76.8%

78.5%

Docker Compose

Kostenschätzung

Übliche CLORE.AI-Marktplatzpreise:

GPU
Stundensatz
Am besten geeignet für

RTX 3090 24 GB

~$0.06

7B-Modelle

RTX 4090 24GB

~$0.10

7B-14B-Modelle

A100 40GB

~$0.17

14B-32B-Modelle

A100 80GB

~$0.25

32B-Modelle, Coder-32B

2x A100 80 GB

~$0.50

72B-Modelle

4x A100 80 GB

~$1.00

72B maximaler Kontext

Preise variieren je nach Anbieter. Prüfen CLORE.AI-Marktplatz für aktuelle Preise.

Geld sparen:

  • Verwende Spot Markt für flexible Workloads

  • Bezahlen Sie mit CLORE Tokens

  • Für Tests mit kleineren Modellen (7B) beginnen

Fehlerbehebung

Speicher erschöpft

Langsame Generierung

Anzeige chinesischer Zeichen

Modell nicht gefunden

Qwen2.5 im Vergleich zu anderen

Funktion
Qwen2.5-7B
Qwen2.5-72B
Llama 3.1 70B
GPT-4o

Kontext

128K

128K

128K

128K

Mehrsprachig

Hervorragend

Hervorragend

Gut

Hervorragend

Code

Hervorragend

Hervorragend

Gut

Hervorragend

Mathe

Hervorragend

Hervorragend

Gut

Hervorragend

Chinesisch

Hervorragend

Hervorragend

Schlecht

Gut

Lizenz

Apache 2.0

Apache 2.0

Llama 3.1

Proprietär

Kosten

Kostenlos

Kostenlos

Kostenlos

Bezahlte API

Qwen2.5 verwenden, wenn:

  • Unterstützung für die chinesische Sprache benötigt wird

  • Mathe-/Code-Aufgaben Priorität haben

  • Langer Kontext erforderlich ist

  • Apache-2.0-Lizenz gewünscht

  • Bestes Open-Source-Codemodell benötigt (Coder-32B)

Nächste Schritte

Zuletzt aktualisiert

War das hilfreich?