DeepSeek-R1 रीजनिंग मॉडल
Clore.ai GPUs पर DeepSeek-R1 ओपन-सोर्स रीजनिंग मॉडल चलाएँ
सभी उदाहरण GPU सर्वरों पर चलते हैं, जिन्हें के माध्यम से किराये पर लिया गया है CLORE.AI मार्केटप्लेस. RTX 4090 इंस्टेंस $0.14–0.42/घंटा से शुरू होते हैं।
अवलोकन
DeepSeek-R1 एक 671B-पैरामीटर वाला ओपन-वेट रीजनिंग मॉडल है, जिसे जनवरी 2025 में DeepSeek द्वारा के तहत जारी किया गया था Apache 2.0 लाइसेंस। यह पहला ओपन मॉडल है जो गणित, कोडिंग और वैज्ञानिक बेंचमार्क्स में OpenAI o1 की बराबरी करता है — जबकि अपनी पूरी चेन-ऑफ-थॉट को स्पष्ट <think> टैग्स के माध्यम से उजागर करता है।
पूरा मॉडल उपयोग करता है Mixture-of-Experts (MoE) प्रति टोकन 37B सक्रिय पैरामीटर के साथ, जिससे भारी पैरामीटर संख्या के बावजूद इन्फरेंस व्यावहारिक हो जाता है। अधिकांश प्रैक्टिशनरों के लिए, डिस्टिल्ड वेरिएंट्स (1.5B → 70B) अधिक व्यावहारिक हैं: वे ज्ञान-आसवन (knowledge distillation) के माध्यम से Qwen-2.5 और Llama-3 बेस आर्किटेक्चर में R1 के रीजनिंग पैटर्न को विरासत में लेते हैं और सामान्य GPU पर चलते हैं।
मुख्य विशेषताएँ
स्पष्ट चेन-ऑफ-थॉट — हर उत्तर एक
<think>ब्लॉक से शुरू होता है जहाँ मॉडल अंतिम उत्तर देने से पहले तर्क करता है, वापस जाँचता है, और स्वयं-सुधार करता हैरीइन्फोर्समेंट-लर्निंग से प्रशिक्षित — रीजनिंग क्षमता हाथ से लिखे गए चेन-ऑफ-थॉट डेटा के बजाय RL रिवॉर्ड सिग्नल्स से उभरती है
छह डिस्टिल्ड वेरिएंट्स — 1.5B, 7B, 8B, 14B, 32B, 70B पैरामीटर मॉडल्स, जिन्हें पूर्ण 671B से Qwen और Llama आर्किटेक्चर में डिस्टिल किया गया है
Apache 2.0 लाइसेंस — पूरी तरह व्यावसायिक, कोई रॉयल्टी नहीं, कोई उपयोग-प्रतिबंध नहीं
व्यापक फ्रेमवर्क समर्थन — Ollama, vLLM, llama.cpp, SGLang, Transformers, TGI सभी बिना किसी अतिरिक्त सेटअप के काम करते हैं
AIME 2024 Pass@1: 79.8% — प्रतियोगिता गणित में OpenAI o1 के बराबर
Codeforces 2029 Elo — प्रतिस्पर्धी प्रोग्रामिंग में o1 के 1891 से बेहतर
मॉडल वेरिएंट
DeepSeek-R1 (पूर्ण MoE)
671B (37B सक्रिय)
DeepSeek MoE
~1.3 TB
~350 GB
~340 GB
R1-Distill-Llama-70B
70B
Llama 3
140 GB
40 GB
42 GB
R1-Distill-Qwen-32B
32B
Qwen 2.5
64 GB
22 GB
20 GB
R1-Distill-Qwen-14B
14B
Qwen 2.5
28 GB
10 GB
9 GB
R1-Distill-Llama-8B
8B
Llama 3
16 GB
6 GB
5.5 GB
R1-Distill-Qwen-7B
7B
Qwen 2.5
14 GB
5 GB
4.5 GB
R1-Distill-Qwen-1.5B
1.5B
Qwen 2.5
3 GB
2 जीबी
1.2 GB
वेरिएंट चुनना
त्वरित प्रयोग, एज टेस्टिंग
R1-Distill-Qwen-1.5B
कोई भी GPU
बजट डिप्लॉयमेंट, तेज इन्फरेंस
R1-Distill-Qwen-7B
RTX 3090 ($0.07–0.21/घंटा)
अधिकतम डिस्टिल्ड गुणवत्ता
R1-Distill-Llama-70B
2× A100 80 GB
अनुसंधान, पूर्ण-निष्ठा रीजनिंग
DeepSeek-R1 671B
8× H100 क्लस्टर
HuggingFace रिपॉज़िटरीज़
पूर्ण R1
Llama-70B distill
Qwen-32B distill
Qwen-14B distill
Llama-8B distill
Qwen-7B distill
Qwen-1.5B distill
आवश्यकताएँ
Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं। आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता bare metal के रूप में अनुरोध पर बेची जाती है। देखें GPU मूल्य और उपलब्धता किसी deployment का आकार तय करने से पहले।
GPU VRAM
6 GB
24 GB
System RAM
16 GB
32 GB
डिस्क
10 GB
30 GB
CUDA
12.8+
12.8+
Docker
24.0+
25.0+
Ollama क्विक स्टार्ट
Ollama quantization, डाउनलोडिंग, और सर्विंग को अपने-आप संभालता है — चल रहे DeepSeek-R1 तक पहुँचने का सबसे तेज़ रास्ता।
इंस्टॉल करें और चलाएँ
उदाहरणात्मक इंटरैक्टिव सत्र
OpenAI-संगत API का उपयोग करें
Python क्लाइंट (OpenAI SDK के माध्यम से)
vLLM उत्पादन सेटअप
vLLM निरंतर batching, PagedAttention, और prefix caching के साथ multi-user serving के लिए उच्चतम throughput प्रदान करता है।
एकल GPU — 7B / 14B
बहु-GPU — 32B (अनुशंसित)
सुझाव: 32B Q4 GPTQ या AWQ चेकपॉइंट एकल RTX 4090 (24 GB) पर फिट बैठता है:
बहु-GPU — 70B
vLLM endpoint को क्वेरी करें
Transformers / Python (साथ में <think> टैग पार्सिंग)
जब आपको जनरेशन पर सूक्ष्म नियंत्रण चाहिए या R1 को Python पाइपलाइन में एकीकृत करना हो, तब HuggingFace Transformers का उपयोग करें।
बुनियादी जनरेशन
पार्सिंग <think> टैग्स
साथ में स्ट्रीमिंग <think> state tracking
Clore.ai पर Docker डिप्लॉयमेंट
Ollama Docker (सबसे सरल)
Docker image: ollama/ollama पोर्ट: 22/tcp, 11434/http
vLLM Docker (प्रोडक्शन)
Docker image: vllm/vllm-openai:latest पोर्ट: 22/tcp, 8000/http
Clore.ai पर डिप्लॉय करें:
खोलें clore.ai/marketplace
के अनुसार फ़िल्टर करें 2× GPU, कुल 48 GB+ VRAM (उदा. 2× RTX 4090 या A100 80 GB)
Docker image को सेट करें
vllm/vllm-openai:latestपोर्ट मैप करें 8000 को HTTP के रूप में
ऊपर दिए गए compose फ़ाइल से कमांड को startup command में पेस्ट करें
health check पास हो जाने के बाद HTTP endpoint के माध्यम से कनेक्ट करें
Clore.ai डिप्लॉयमेंट के लिए सुझाव
सही GPU चुनना
न्यूनतम
RTX 3090 (24 GB)
$0.30 – 1.00
R1-Distill-Qwen-7B या 14B Q4
मानक
RTX 4090 (24 GB)
$0.50 – 2.00
R1-Distill-Qwen-14B FP16 या 32B Q4
प्रोडक्शन
A100 80 GB
$3 – 8
R1-Distill-Qwen-32B FP16
उच्च गुणवत्ता
2× A100 80 GB
$6 – 16
R1-Distill-Llama-70B FP16
प्रदर्शन अनुकूलन
Temperature 0.6 रीजनिंग कार्यों के लिए अनुशंसित डिफ़ॉल्ट है — DeepSeek के अपने पेपर्स इसी मान का उपयोग करते हैं
सेट करें
max_tokensउदारता से — रीजनिंग मॉडल लंबे<think>ब्लॉक उत्पन्न करते हैं; गैर-तुच्छ समस्याओं के लिए 4096+prefix caching सक्षम करें (
--enable-prefix-cachingvLLM में) जब साझा सिस्टम प्रॉम्प्ट का उपयोग कर रहे होंconcurrency सीमित करें (
--max-num-seqs 16) रीजनिंग workloads के लिए — प्रत्येक अनुरोध मानक चैट से अधिक compute उपयोग करता हैQ4 quantization का उपयोग करें ताकि 32B को एकल 24 GB GPU पर न्यूनतम गुणवत्ता हानि के साथ फिट किया जा सके (distill पहले से ही R1 के ज्ञान को संपीड़ित करता है)
context length संबंधी विचार
रीजनिंग मॉडल मानक चैट मॉडल्स की तुलना में अधिक context उपयोग करते हैं क्योंकि <think> ब्लॉक:
सरल अंकगणित
~100 tokens
~300 tokens
कोड जनरेशन
~500–1000 tokens
~2000 tokens
प्रतियोगिता गणित (AIME)
~2000–4000 tokens
~5000 tokens
बहु-चरणीय शोध विश्लेषण
~4000–8000 tokens
~10000 tokens
समस्या निवारण
मेमोरी से बाहर (OOM)
मॉडल कोई <think> ब्लॉक
कुछ system prompts सोचने की प्रक्रिया को दबा देते हैं। "be concise" या "don't explain your reasoning." जैसी निर्देशों से बचें। एक न्यूनतम system prompt या बिल्कुल न इस्तेमाल करें:
दोहरावदार या लूपिंग <think> आउटपुट
तर्क श्रृंखला में यादृच्छिकता कम करने के लिए temperature घटाएँ:
धीमा पहला टोकन (उच्च TTFT)
यह अपेक्षित है — मॉडल <think> दृश्यमान उत्तर से पहले tokens उत्पन्न करता है। जहाँ latency-संवेदनशील अनुप्रयोगों में रीजनिंग की आवश्यकता नहीं है, वहाँ DeepSeek-V3 का उपयोग करें।
Clore इंस्टेंस पर डाउनलोड अटक जाता है
कुछ providers पर HuggingFace downloads धीमे हो सकते हैं। मॉडल को persistent volume में पहले से cache करें:
अधिक पढ़ें
DeepSeek-R1 पेपर — रीइन्फोर्समेंट लर्निंग के माध्यम से LLMs में तर्क क्षमता को प्रोत्साहित करना
DeepSeek-R1 GitHub — model cards वाला आधिकारिक repository
DeepSeek-V3 गाइड — उसी प्रयोगशाला का non-reasoning सामान्य-उद्देश्य मॉडल
vLLM गाइड — व्यापक production serving सेटअप
Ollama गाइड — किसी भी मॉडल के लिए सरल स्थानीय डिप्लॉयमेंट
Open WebUI गाइड — native
<think>टैग रेंडरिंग वाला चैट UIQwen 2.5 गाइड — अधिकांश R1 distills द्वारा उपयोग की जाने वाली बेस आर्किटेक्चर
अंतिम अपडेट
क्या यह उपयोगी था?