For the complete documentation index, see llms.txt. This page is also available as Markdown.

DeepSeek V4 (1.6T MoE, मल्टिमोडल)

Clore.ai पर DeepSeek V4 डिप्लॉय करें — MIT-लाइसेंस वाला फ्रंटियर MoE, Flash-0731 और Pro-0813 के रूप में रिफ़्रेश किया गया

स्थिति (अगस्त 2026): DeepSeek V4 पहली बार 22 अप्रैल 2026 को जारी किया गया था 22 अप्रैल 2026 के अंतर्गत MIT, और तब से दोनों स्तरों को ताज़ा किया गया है। वर्तमान चेकपॉइंट हैं deepseek-ai/DeepSeek-V4-Flash-0731 (31 जुलाई 2026, 167GB FP8, 1M संदर्भ, speculative-decoding मॉड्यूल संलग्न) और deepseek-ai/DeepSeek-V4-Pro-0813 (13 अगस्त 2026, 893GB FP8, 1M संदर्भ)। अप्रैल वाले रिपो अभी भी पूर्वावलोकन पीढ़ी के रूप में उपलब्ध हैं।

अप्रैल के बाद क्या बदला

अप्रैल पूर्वावलोकन
वर्तमान

Flash

DeepSeek-V4-Flash

DeepSeek-V4-Flash-0731 — 167GB FP8, 43 परतें, 256 एक्सपर्ट (6 सक्रिय), 1M संदर्भ, DSpark speculative decoding संलग्न

Pro

DeepSeek-V4-Pro

DeepSeek-V4-Pro-0813 — 893GB FP8, 61 परतें, 384 एक्सपर्ट (6 सक्रिय), 1M संदर्भ

तर्क नियंत्रण

reasoning_effort: निम्न, उच्च, अधिकतम

चैट टेम्पलेट

Jinja

कोई Jinja टेम्पलेट नहीं। रिपो के साथ एक encoding/ फ़ोल्डर आता है, जिसमें प्रॉम्प्ट बनाने और आउटपुट पार्स करने के लिए Python सहायक हैं

Flash-0731, अप्रैल Pro पूर्वावलोकन से बेहतर प्रदर्शन करता है DeepSeek के अपने बेंचमार्क पर, सक्रिय पैरामीटरों के एक अंश के बावजूद: Terminal-Bench 2.1 82.7 (72.1 बनाम), NL2Repo 54.2 (38.5 बनाम), DeepSWE 54.4 (12.8 बनाम), Toolathlon-Verified 70.3 (55.9 बनाम)। ये विक्रेता द्वारा रिपोर्ट किए गए हैं, और DeepSeek के अपने harness से मापे गए हैं, निम्न पर reasoning_effort: max.

यदि आपने अप्रैल पूर्वावलोकन तैनात किया था, तो इसमें जाना -0731 अभी DeepSeek परिनियोजन में आप जो एकल सबसे मूल्यवान बदलाव कर सकते हैं, वही है।

Speculative decoding के साथ Flash-0731 सर्व करना

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

DeepSeek V4, 2026 का पहला open-weight frontier model है जो एक दो-स्तरीय रिलीज़. V4-Pro फ्लैगशिप है — एक 1.6 ट्रिलियन पैरामीटर वाला Mixture-of-Experts लगभग प्रति टोकन 49B सक्रिय पैरामीटर, एक 1M टोकन संदर्भ विंडो, और एक हाइब्रिड अटेंशन डिज़ाइन, जो Compressed Sparse Attention को नए Heavily Compressed Attention हेड के साथ जोड़ता है ताकि सस्ते लंबे-संदर्भ प्रीफिल मिल सकें। V4-Flash व्यावहारिक सिब्लिंग है — कुल 284B / सक्रिय 13B, वही आर्किटेक्चर, क्वांटाइज़ करने पर एकल 80GB GPU पर फिट हो जाता है, और Unsloth GGUF बिल्ड्स के साथ 2×48GB बॉक्स पर आराम से चलता है।

आर्किटेक्चर ही मुख्य बात है। DeepSeek का हाइब्रिड अटेंशन लंबे संदर्भ पर KV-cache मेमोरी को बहुत कम कर देता है, और MoE राउटर को अधिक सटीक एक्सपर्ट चयन के लिए पुनः प्रशिक्षित किया गया है — शुरुआती स्वतंत्र रन बताते हैं कि Pro, लगभग आधे सक्रिय-पैरामीटर कंप्यूट पर V3-स्तर के कोडिंग स्कोर हासिल करता है। Clore.ai उपयोगकर्ताओं के लिए यह महत्वपूर्ण है क्योंकि V4-Flash पहली बार है जब 15B से कम सक्रिय वाला frontier-class मॉडल पूर्ण वज़नों के साथ जारी किया गया है, जिससे गंभीर ओपन इन्फ़ेरेंस एक H100 या सस्ते multi-4090 बॉक्स की पहुँच में आ जाता है।

अधिकांश टीमों के लिए यथार्थवादी Clore परिनियोजन है 1× A100 80GB या 2× RTX 4090 पर V4-Flash — यहीं कीमत-प्रदर्शन का असली लाभ है। V4-Pro गंभीर इन्फ्रा के लिए आरक्षित है: 8× H100, 4× H200, या 8× B200, आदर्श रूप से NVLink के साथ। यदि आप चलाते रहे हैं DeepSeek V3 या DeepSeek-R1, तो माइग्रेशन पथ सीधा है — वही मॉडल परिवार, वही चैट टेम्पलेट, vLLM पर ड्रॉप-इन प्रतिस्थापन।

मुख्य विनिर्देश

गुण
DeepSeek V4-Pro
DeepSeek V4-Flash

कुल पैरामीटर

1.6T (MoE)

284B (MoE)

सक्रिय पैरामीटर

प्रति टोकन ~49B

प्रति टोकन ~13B

संदर्भ विंडो

1,000,000 टोकन

256,000 टोकन

अटेंशन

संपीडित विरल + अत्यधिक संपीडित अटेंशन

संपीडित विरल + HCA

लाइसेंस

MIT

MIT

रिलीज़ तिथि

22 अप्रैल 2026

22 अप्रैल 2026

मुख्य टूलिंग

vLLM, SGLang (दिन-0)

vLLM, SGLang, llama.cpp (Unsloth GGUF)

DeepSeek V4 क्यों?

  • वास्तव में खुले frontier वज़न — MIT लाइसेंस, कोई उपयोग प्रतिबंध नहीं, पूर्ण व्यावसायिक उपयोग

  • Pro पर 1M संदर्भ, Flash पर 256K — पूरे कोडबेस, किताबों, या घंटे भर की प्रतिलिपियों को एक ही पास में संभालता है

  • हाइब्रिड विरल अटेंशन — लंबे संदर्भ पर KV cache उप-रेखीय रूप से स्केल करता है, प्रीफिल सस्ता है

  • दो-स्तरीय रिलीज़ — Flash पहला 13B-सक्रिय MoE है जो अधिकांश वर्कफ़्लो में V3 को बदलने लायक अच्छा है

  • पहले दिन से vLLM और SGLang समर्थन — समुदाय पैच के लिए इंतज़ार नहीं, बस pip install -U और शुरू करें

  • MoE दक्षता — आप 13B/49B इन्फ़ेरेंस लागत चुकाते हैं, 284B/1.6T नहीं


आवश्यकताएँ

घटक
न्यूनतम (V4-Flash, GGUF Q4)
अनुशंसित (V4-Flash FP8)
पूर्ण V4-Pro (BF16)

GPU VRAM

1× 80GB या 2× 48GB

1× H100 80GB या 1× A100 80GB

8× H100 80GB या 4× H200 141GB

RAM

64GB

128GB

1TB+

डिस्क

200GB NVMe

600GB NVMe

4TB NVMe

CUDA

12.8+

12.8+

12.8+

नेटवर्क

multi-node के लिए NVLink / 400Gb IB

हार्डवेयर उपयुक्तता: 95% उपयोगकर्ताओं के लिए, 80GB-श्रेणी के कार्ड पर FP8 में V4-Flash सबसे अच्छा संतुलन है — पूरा 256K संदर्भ, कोई क्वांटाइज़ेशन नुकसान नहीं, bare metal मार्केटप्लेस पर। इस्तेमाल करें H100 या H200 tensor-parallel सेटअप केवल तब करें जब आपको सचमुच V4-Pro का 1M संदर्भ या अतिरिक्त reasoning headroom चाहिए।


विकल्प A — Ollama / GGUF (क्वांटाइज़्ड, केवल V4-Flash)

Unsloth ने रिलीज़ के 48 घंटे के भीतर V4-Flash के लिए GGUF क्वांट्स प्रकाशित किए। Q4_K_M सबसे अच्छा संतुलन है — यह 1× 80GB या 2× 48GB पर फिट हो जाता है और गुणवत्ता को FP8 के काफ़ी करीब रखता है।

V4-Pro के लिए GGUF क्वांट्स मौजूद हैं, लेकिन व्यावहारिक नहीं हैं — Q2_K भी लगभग 400GB है और ऑफलोड प्रदर्शन चैट के लिए अनुपयोगी है। क्वांटाइज़्ड परिनियोजनों के लिए Flash पर ही रहें।


विकल्प B — vLLM (प्रोडक्शन API, अनुशंसित)

vLLM 0.7.x ने दोनों V4 चेकपॉइंट्स के लिए दिन-0 समर्थन जोड़ा। हाइब्रिड अटेंशन kernels को --trust-remote-code और पूर्ण गति के लिए Hopper या Blackwell हार्डवेयर चाहिए।

एकल H100 / A100 80GB पर V4-Flash:

8× H100 80GB पर V4-Pro: कमांड को इसके साथ बदलें:

से शुरू करें --max-model-len 131072 भले ही अंत में आप पूरा 1M ctx चाहते हों — लंबे संदर्भ प्रीफिल समय और KV मेमोरी को बहुत बढ़ा देते हैं। बेसलाइन स्थिर होने के बाद ही इसे बढ़ाएँ।


विकल्प C — SGLang (विकल्प, Hopper पर अक्सर तेज)

SGLang का RadixAttention और prefix caching, V4 के hybrid attention के साथ अच्छी तरह मेल खाते हैं — साझा prompts वाले agentic workloads के लिए vLLM की तुलना में काफ़ी बेहतर tok/s की अपेक्षा करें।

SGLang का --enable-torch-compile आमतौर पर प्रारंभिक वार्मअप के बाद Hopper पर थ्रूपुट में अतिरिक्त 10–20% जोड़ता है।


Clore.ai GPU अनुशंसाएँ

सेटअप
मॉडल
VRAM
अपेक्षित थ्रूपुट
Clore.ai लागत

RTX 4090 (Q4 GGUF)

V4-Flash

48GB

शौकिया उपयोग, एकल-स्ट्रीम

$0.14–0.42/hr

A100 80GB (FP8)

V4-Flash

80GB

मज़बूत प्रोडक्शन एकल-टेनेंट

1× RTX 5090 32GB (Q4 GGUF, आंशिक ऑफलोड)

V4-Flash

32GB + RAM

सीमित, केवल dev

$0.25–0.77/घंटा पीक

V4-Flash FP8 (ज़रूरत से ज़्यादा) या V4-Pro Q4

320GB

मल्टी-टेनेंट Flash, एकल-स्ट्रीम Pro

~$1.04/घंटा

V4-Pro BF16

640GB

प्रोडक्शन frontier इन्फ़ेरेंस

~$1.04/घंटा

V4-Pro BF16 + 1M ctx

564GB

पूरा 1M संदर्भ, अधिकतम थ्रूपुट


उपयोग के मामले

  • पूरे कोडबेस पर तर्क — V4-Pro का 1M संदर्भ एक सामान्य 500K-LOC monorepo और उसके tests को एक ही प्रॉम्प्ट में समा लेता है

  • लंबी-रूप RAG — पूरी किताबें, अदालत में दाख़िल दस्तावेज़, या वार्षिक रिपोर्टें संदर्भ में डालें, chunking pipeline को छोड़ें

  • एजेंटिक कोडिंग — V4-Flash, इन्फ़ेरेंस लागत के एक अंश पर SWE-Bench में V3 के बराबर है; इसे SWE-agent या OpenHands के साथ जोड़ें

  • बहु-दस्तावेज़ संश्लेषण — पहले जिन research workflows के लिए Gemini 2.5 Pro चाहिए था, वे अब आपके अपने हार्डवेयर पर चलते हैं

  • स्व-होस्टेड Cursor / Copilot विकल्प — एकल A100 पर V4-Flash 5-डेवलपर टीम की ज़रूरतें पूरी कर देता है

  • फाइन-ट्यूनिंग आधार — MIT लाइसेंस + साफ़ MoE आर्किटेक्चर इसे डोमेन फाइन-ट्यून के लिए एक मज़बूत शुरुआती बिंदु बनाता है


बेंचमार्क

Benchmark
V4-Pro
V4-Flash
DeepSeek V3
GLM-5.1

MMLU-Pro

~84%

~78%

~76%

~80%

SWE-Bench Verified

~82%

~74%

~70%

~79%

HumanEval

~96%

~92%

~91%

~94%

MATH-500

~94%

~88%

~85%

~90%

LiveCodeBench

~76%

~68%

~62%

~72%

लंबा-संदर्भ (1M सुई-में-घास का ढेर)

~98%

लागू नहीं

लागू नहीं

लागू नहीं

समान-आधारित open-weight तुलना के लिए देखें GLM-5.1 गाइड — बेंचमार्क के अनुसार V4-Pro और GLM-5.1 एक-दूसरे को टक्कर देते हैं।


समस्या निवारण

समस्या
समाधान

OutOfMemoryError 8×H100 पर V4-Pro लोड करना

BF16 के लिए लगभग 3.2TB चाहिए — Pro को एकल 8×H100 node पर फिट नहीं किया जा सकता। 4× H200 141GB या multi-node का उपयोग करें।

असमर्थित attention backend

V4 के लिए vLLM ≥ 0.7.0 या SGLang ≥ 0.4.4 चाहिए। चलाएँ pip install -U vllm (या पुल करें :latest Docker image)।

HuggingFace डाउनलोड धीमा

उपयोग करें huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download. Pro लगभग 3.2TB है; Flash लगभग 570GB है।

--trust-remote-code अस्वीकृत

हाइब्रिड अटेंशन मॉड्यूल रिपो में कस्टम कोड के रूप में आते हैं — --trust-remote-code जब तक kernels upstream Transformers में नहीं आ जाते, दोनों engines के लिए आवश्यक है।

GGUF Q4 निरर्थक आउटपुट देता है

सुनिश्चित करें कि आप Unsloth बिल्ड पर हैं (unsloth/DeepSeek-V4-Flash-GGUF), किसी शुरुआती community quant पर नहीं। MoE router को विशेष handling चाहिए, जिसे शुरुआती quants ने गलत किया था।

V4-Pro पर 1M संदर्भ OOM

इसे घटाएँ --max-model-len 262144 और जोड़ें --enable-prefix-caching. वास्तविक 1M serving के लिए H200 या B200 चाहिए।

लंबे संदर्भ पर धीमा prefill

यह अपेक्षित है — हाइब्रिड अटेंशन के बावजूद, 500K+ prefill मिनटों में होता है, सेकंडों में नहीं। उपयोग करें --enable-chunked-prefill और लागत बाँटने के लिए prefix caching।


अगले चरण

  • पूर्ववर्ती: DeepSeek V3 — V4-Flash मॉडल प्रभावी रूप से इसे बदल देता है

  • तर्क वाला सिब्लिंग: DeepSeek-R1 — chain-of-thought के लिए ट्यून किया गया, फिर भी गणित-प्रधान workflows के लिए उपयोगी

  • ओपन-वेट विकल्प: GLM-5.1 — 744B MoE, SWE-Bench Pro के शीर्ष पर, तुलनीय कीमत-प्रदर्शन

  • मल्टीमोडल विकल्प: Qwen3.5-Omni — यदि आपको एक ही मॉडल में vision/audio चाहिए

  • हार्डवेयर किराए पर लें: Clore.ai मार्केटप्लेस — H100/H200/A100/RTX 4090 $0.14–0.42/घंटा से

लिंक्स

अंतिम अपडेट

क्या यह उपयोगी था?