For the complete documentation index, see llms.txt. This page is also available as Markdown.

DeepSeek-R1 रीजनिंग मॉडल

Clore.ai GPUs पर DeepSeek-R1 ओपन-सोर्स रीजनिंग मॉडल चलाएँ

अवलोकन

DeepSeek-R1 एक 671B-पैरामीटर वाला ओपन-वेट रीजनिंग मॉडल है, जिसे जनवरी 2025 में DeepSeek द्वारा के तहत जारी किया गया था Apache 2.0 लाइसेंस। यह पहला ओपन मॉडल है जो गणित, कोडिंग और वैज्ञानिक बेंचमार्क्स में OpenAI o1 की बराबरी करता है — जबकि अपनी पूरी चेन-ऑफ-थॉट को स्पष्ट <think> टैग्स के माध्यम से उजागर करता है।

पूरा मॉडल उपयोग करता है Mixture-of-Experts (MoE) प्रति टोकन 37B सक्रिय पैरामीटर के साथ, जिससे भारी पैरामीटर संख्या के बावजूद इन्फरेंस व्यावहारिक हो जाता है। अधिकांश प्रैक्टिशनरों के लिए, डिस्टिल्ड वेरिएंट्स (1.5B → 70B) अधिक व्यावहारिक हैं: वे ज्ञान-आसवन (knowledge distillation) के माध्यम से Qwen-2.5 और Llama-3 बेस आर्किटेक्चर में R1 के रीजनिंग पैटर्न को विरासत में लेते हैं और सामान्य GPU पर चलते हैं।

मुख्य विशेषताएँ

  • स्पष्ट चेन-ऑफ-थॉट — हर उत्तर एक <think> ब्लॉक से शुरू होता है जहाँ मॉडल अंतिम उत्तर देने से पहले तर्क करता है, वापस जाँचता है, और स्वयं-सुधार करता है

  • रीइन्फोर्समेंट-लर्निंग से प्रशिक्षित — रीजनिंग क्षमता हाथ से लिखे गए चेन-ऑफ-थॉट डेटा के बजाय RL रिवॉर्ड सिग्नल्स से उभरती है

  • छह डिस्टिल्ड वेरिएंट्स — 1.5B, 7B, 8B, 14B, 32B, 70B पैरामीटर मॉडल्स, जिन्हें पूर्ण 671B से Qwen और Llama आर्किटेक्चर में डिस्टिल किया गया है

  • Apache 2.0 लाइसेंस — पूरी तरह व्यावसायिक, कोई रॉयल्टी नहीं, कोई उपयोग-प्रतिबंध नहीं

  • व्यापक फ्रेमवर्क समर्थन — Ollama, vLLM, llama.cpp, SGLang, Transformers, TGI सभी बिना किसी अतिरिक्त सेटअप के काम करते हैं

  • AIME 2024 Pass@1: 79.8% — प्रतियोगिता गणित में OpenAI o1 के बराबर

  • Codeforces 2029 Elo — प्रतिस्पर्धी प्रोग्रामिंग में o1 के 1891 से बेहतर

मॉडल वेरिएंट

वैरिएंट
पैरामीटर
आर्किटेक्चर
FP16 VRAM
Q4 VRAM
Q4 Disk

DeepSeek-R1 (पूर्ण MoE)

671B (37B सक्रिय)

DeepSeek MoE

~1.3 TB

~350 GB

~340 GB

R1-Distill-Llama-70B

70B

Llama 3

140 GB

40 GB

42 GB

R1-Distill-Qwen-32B

32B

Qwen 2.5

64 GB

22 GB

20 GB

R1-Distill-Qwen-14B

14B

Qwen 2.5

28 GB

10 GB

9 GB

R1-Distill-Llama-8B

8B

Llama 3

16 GB

6 GB

5.5 GB

R1-Distill-Qwen-7B

7B

Qwen 2.5

14 GB

5 GB

4.5 GB

R1-Distill-Qwen-1.5B

1.5B

Qwen 2.5

3 GB

2 जीबी

1.2 GB

वेरिएंट चुनना

उपयोग-प्रकरण
अनुशंसित वेरिएंट
Clore पर GPU

त्वरित प्रयोग, एज टेस्टिंग

R1-Distill-Qwen-1.5B

कोई भी GPU

बजट डिप्लॉयमेंट, तेज इन्फरेंस

R1-Distill-Qwen-7B

RTX 3090 ($0.07–0.21/घंटा)

एकल-GPU प्रोडक्शन का आदर्श विकल्प

R1-Distill-Qwen-14B Q4

RTX 4090 ($0.14–0.42/घंटा)

कीमत के मुकाबले सर्वोत्तम गुणवत्ता (अनुशंसित)

R1-Distill-Qwen-32B Q4

RTX 4090 24 GB या A100 40 GB

अधिकतम डिस्टिल्ड गुणवत्ता

R1-Distill-Llama-70B

2× A100 80 GB

अनुसंधान, पूर्ण-निष्ठा रीजनिंग

DeepSeek-R1 671B

8× H100 क्लस्टर

HuggingFace रिपॉज़िटरीज़

आवश्यकताएँ

घटक
न्यूनतम (7B Q4)
अनुशंसित (32B Q4)

GPU VRAM

6 GB

24 GB

System RAM

16 GB

32 GB

डिस्क

10 GB

30 GB

CUDA

12.8+

12.8+

Docker

24.0+

25.0+

Ollama क्विक स्टार्ट

Ollama quantization, डाउनलोडिंग, और सर्विंग को अपने-आप संभालता है — चल रहे DeepSeek-R1 तक पहुँचने का सबसे तेज़ रास्ता।

इंस्टॉल करें और चलाएँ

उदाहरणात्मक इंटरैक्टिव सत्र

OpenAI-संगत API का उपयोग करें

Python क्लाइंट (OpenAI SDK के माध्यम से)

vLLM उत्पादन सेटअप

vLLM निरंतर batching, PagedAttention, और prefix caching के साथ multi-user serving के लिए उच्चतम throughput प्रदान करता है।

एकल GPU — 7B / 14B

बहु-GPU — 32B (अनुशंसित)

सुझाव: 32B Q4 GPTQ या AWQ चेकपॉइंट एकल RTX 4090 (24 GB) पर फिट बैठता है:

बहु-GPU — 70B

vLLM endpoint को क्वेरी करें

Transformers / Python (साथ में <think> टैग पार्सिंग)

जब आपको जनरेशन पर सूक्ष्म नियंत्रण चाहिए या R1 को Python पाइपलाइन में एकीकृत करना हो, तब HuggingFace Transformers का उपयोग करें।

बुनियादी जनरेशन

पार्सिंग <think> टैग्स

साथ में स्ट्रीमिंग <think> state tracking

Clore.ai पर Docker डिप्लॉयमेंट

Ollama Docker (सबसे सरल)

Docker image: ollama/ollama पोर्ट: 22/tcp, 11434/http

vLLM Docker (प्रोडक्शन)

Docker image: vllm/vllm-openai:latest पोर्ट: 22/tcp, 8000/http

Clore.ai पर डिप्लॉय करें:

  1. खोलें clore.ai/marketplace

  2. के अनुसार फ़िल्टर करें 2× GPU, कुल 48 GB+ VRAM (उदा. 2× RTX 4090 या A100 80 GB)

  3. Docker image को सेट करें vllm/vllm-openai:latest

  4. पोर्ट मैप करें 8000 को HTTP के रूप में

  5. ऊपर दिए गए compose फ़ाइल से कमांड को startup command में पेस्ट करें

  6. health check पास हो जाने के बाद HTTP endpoint के माध्यम से कनेक्ट करें

Clore.ai डिप्लॉयमेंट के लिए सुझाव

सही GPU चुनना

बजट
GPU
दैनिक लागत
सर्वोत्तम वेरिएंट

न्यूनतम

RTX 3090 (24 GB)

$0.30 – 1.00

R1-Distill-Qwen-7B या 14B Q4

मानक

RTX 4090 (24 GB)

$0.50 – 2.00

R1-Distill-Qwen-14B FP16 या 32B Q4

प्रोडक्शन

A100 80 GB

$3 – 8

R1-Distill-Qwen-32B FP16

उच्च गुणवत्ता

2× A100 80 GB

$6 – 16

R1-Distill-Llama-70B FP16

प्रदर्शन अनुकूलन

  • Temperature 0.6 रीजनिंग कार्यों के लिए अनुशंसित डिफ़ॉल्ट है — DeepSeek के अपने पेपर्स इसी मान का उपयोग करते हैं

  • सेट करें max_tokens उदारता से — रीजनिंग मॉडल लंबे <think> ब्लॉक उत्पन्न करते हैं; गैर-तुच्छ समस्याओं के लिए 4096+

  • prefix caching सक्षम करें (--enable-prefix-caching vLLM में) जब साझा सिस्टम प्रॉम्प्ट का उपयोग कर रहे हों

  • concurrency सीमित करें (--max-num-seqs 16) रीजनिंग workloads के लिए — प्रत्येक अनुरोध मानक चैट से अधिक compute उपयोग करता है

  • Q4 quantization का उपयोग करें ताकि 32B को एकल 24 GB GPU पर न्यूनतम गुणवत्ता हानि के साथ फिट किया जा सके (distill पहले से ही R1 के ज्ञान को संपीड़ित करता है)

context length संबंधी विचार

रीजनिंग मॉडल मानक चैट मॉडल्स की तुलना में अधिक context उपयोग करते हैं क्योंकि <think> ब्लॉक:

कार्य जटिलता
सामान्य सोच की लंबाई
आवश्यक कुल context

सरल अंकगणित

~100 tokens

~300 tokens

कोड जनरेशन

~500–1000 tokens

~2000 tokens

प्रतियोगिता गणित (AIME)

~2000–4000 tokens

~5000 tokens

बहु-चरणीय शोध विश्लेषण

~4000–8000 tokens

~10000 tokens

समस्या निवारण

मेमोरी से बाहर (OOM)

मॉडल कोई <think> ब्लॉक

कुछ system prompts सोचने की प्रक्रिया को दबा देते हैं। "be concise" या "don't explain your reasoning." जैसी निर्देशों से बचें। एक न्यूनतम system prompt या बिल्कुल न इस्तेमाल करें:

दोहरावदार या लूपिंग <think> आउटपुट

तर्क श्रृंखला में यादृच्छिकता कम करने के लिए temperature घटाएँ:

धीमा पहला टोकन (उच्च TTFT)

यह अपेक्षित है — मॉडल <think> दृश्यमान उत्तर से पहले tokens उत्पन्न करता है। जहाँ latency-संवेदनशील अनुप्रयोगों में रीजनिंग की आवश्यकता नहीं है, वहाँ DeepSeek-V3 का उपयोग करें।

Clore इंस्टेंस पर डाउनलोड अटक जाता है

कुछ providers पर HuggingFace downloads धीमे हो सकते हैं। मॉडल को persistent volume में पहले से cache करें:

अधिक पढ़ें

  • DeepSeek-R1 पेपररीइन्फोर्समेंट लर्निंग के माध्यम से LLMs में तर्क क्षमता को प्रोत्साहित करना

  • DeepSeek-R1 GitHub — model cards वाला आधिकारिक repository

  • DeepSeek-V3 गाइड — उसी प्रयोगशाला का non-reasoning सामान्य-उद्देश्य मॉडल

  • vLLM गाइड — व्यापक production serving सेटअप

  • Ollama गाइड — किसी भी मॉडल के लिए सरल स्थानीय डिप्लॉयमेंट

  • Open WebUI गाइड — native <think> टैग रेंडरिंग वाला चैट UI

  • Qwen 2.5 गाइड — अधिकांश R1 distills द्वारा उपयोग की जाने वाली बेस आर्किटेक्चर

अंतिम अपडेट

क्या यह उपयोगी था?