DeepSeek V4 (1.6T MoE, मल्टिमोडल)
Clore.ai पर DeepSeek V4 डिप्लॉय करें — MIT-लाइसेंस वाला फ्रंटियर MoE, Flash-0731 और Pro-0813 के रूप में रिफ़्रेश किया गया
अप्रैल के बाद क्या बदला
Flash
DeepSeek-V4-Flash
DeepSeek-V4-Flash-0731 — 167GB FP8, 43 परतें, 256 एक्सपर्ट (6 सक्रिय), 1M संदर्भ, DSpark speculative decoding संलग्न
Pro
DeepSeek-V4-Pro
DeepSeek-V4-Pro-0813 — 893GB FP8, 61 परतें, 384 एक्सपर्ट (6 सक्रिय), 1M संदर्भ
तर्क नियंत्रण
—
reasoning_effort: निम्न, उच्च, अधिकतम
चैट टेम्पलेट
Jinja
कोई Jinja टेम्पलेट नहीं। रिपो के साथ एक encoding/ फ़ोल्डर आता है, जिसमें प्रॉम्प्ट बनाने और आउटपुट पार्स करने के लिए Python सहायक हैं
Flash-0731, अप्रैल Pro पूर्वावलोकन से बेहतर प्रदर्शन करता है DeepSeek के अपने बेंचमार्क पर, सक्रिय पैरामीटरों के एक अंश के बावजूद: Terminal-Bench 2.1 82.7 (72.1 बनाम), NL2Repo 54.2 (38.5 बनाम), DeepSWE 54.4 (12.8 बनाम), Toolathlon-Verified 70.3 (55.9 बनाम)। ये विक्रेता द्वारा रिपोर्ट किए गए हैं, और DeepSeek के अपने harness से मापे गए हैं, निम्न पर reasoning_effort: max.
यदि आपने अप्रैल पूर्वावलोकन तैनात किया था, तो इसमें जाना -0731 अभी DeepSeek परिनियोजन में आप जो एकल सबसे मूल्यवान बदलाव कर सकते हैं, वही है।
Speculative decoding के साथ Flash-0731 सर्व करना
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
--data-parallel-size 4 --enable-expert-parallel \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'167GB वज़न के लिए कार्ड नहीं, एक रिग चाहिए। Clore.ai मार्केटप्लेस पर इसका मतलब है 6× RTX 5090 (186GB) या 8× RTX 4090 (192GB) — ≥167GB पर 72 सर्वर सूचीबद्ध थे, और अंतिम स्नैपशॉट में 26 मुफ़्त थे। क्वांटाइज़्ड GGUF बिल्ड इसे और नीचे लाते हैं। 893GB वाला Pro-0813 एक bare metal परिनियोजन है।
DeepSeek V4, 2026 का पहला open-weight frontier model है जो एक दो-स्तरीय रिलीज़. V4-Pro फ्लैगशिप है — एक 1.6 ट्रिलियन पैरामीटर वाला Mixture-of-Experts लगभग प्रति टोकन 49B सक्रिय पैरामीटर, एक 1M टोकन संदर्भ विंडो, और एक हाइब्रिड अटेंशन डिज़ाइन, जो Compressed Sparse Attention को नए Heavily Compressed Attention हेड के साथ जोड़ता है ताकि सस्ते लंबे-संदर्भ प्रीफिल मिल सकें। V4-Flash व्यावहारिक सिब्लिंग है — कुल 284B / सक्रिय 13B, वही आर्किटेक्चर, क्वांटाइज़ करने पर एकल 80GB GPU पर फिट हो जाता है, और Unsloth GGUF बिल्ड्स के साथ 2×48GB बॉक्स पर आराम से चलता है।
आर्किटेक्चर ही मुख्य बात है। DeepSeek का हाइब्रिड अटेंशन लंबे संदर्भ पर KV-cache मेमोरी को बहुत कम कर देता है, और MoE राउटर को अधिक सटीक एक्सपर्ट चयन के लिए पुनः प्रशिक्षित किया गया है — शुरुआती स्वतंत्र रन बताते हैं कि Pro, लगभग आधे सक्रिय-पैरामीटर कंप्यूट पर V3-स्तर के कोडिंग स्कोर हासिल करता है। Clore.ai उपयोगकर्ताओं के लिए यह महत्वपूर्ण है क्योंकि V4-Flash पहली बार है जब 15B से कम सक्रिय वाला frontier-class मॉडल पूर्ण वज़नों के साथ जारी किया गया है, जिससे गंभीर ओपन इन्फ़ेरेंस एक H100 या सस्ते multi-4090 बॉक्स की पहुँच में आ जाता है।
अधिकांश टीमों के लिए यथार्थवादी Clore परिनियोजन है 1× A100 80GB या 2× RTX 4090 पर V4-Flash — यहीं कीमत-प्रदर्शन का असली लाभ है। V4-Pro गंभीर इन्फ्रा के लिए आरक्षित है: 8× H100, 4× H200, या 8× B200, आदर्श रूप से NVLink के साथ। यदि आप चलाते रहे हैं DeepSeek V3 या DeepSeek-R1, तो माइग्रेशन पथ सीधा है — वही मॉडल परिवार, वही चैट टेम्पलेट, vLLM पर ड्रॉप-इन प्रतिस्थापन।
मुख्य विनिर्देश
कुल पैरामीटर
1.6T (MoE)
284B (MoE)
सक्रिय पैरामीटर
प्रति टोकन ~49B
प्रति टोकन ~13B
संदर्भ विंडो
1,000,000 टोकन
256,000 टोकन
अटेंशन
संपीडित विरल + अत्यधिक संपीडित अटेंशन
संपीडित विरल + HCA
लाइसेंस
MIT
MIT
रिलीज़ तिथि
22 अप्रैल 2026
22 अप्रैल 2026
मुख्य टूलिंग
vLLM, SGLang (दिन-0)
vLLM, SGLang, llama.cpp (Unsloth GGUF)
DeepSeek V4 क्यों?
वास्तव में खुले frontier वज़न — MIT लाइसेंस, कोई उपयोग प्रतिबंध नहीं, पूर्ण व्यावसायिक उपयोग
Pro पर 1M संदर्भ, Flash पर 256K — पूरे कोडबेस, किताबों, या घंटे भर की प्रतिलिपियों को एक ही पास में संभालता है
हाइब्रिड विरल अटेंशन — लंबे संदर्भ पर KV cache उप-रेखीय रूप से स्केल करता है, प्रीफिल सस्ता है
दो-स्तरीय रिलीज़ — Flash पहला 13B-सक्रिय MoE है जो अधिकांश वर्कफ़्लो में V3 को बदलने लायक अच्छा है
पहले दिन से vLLM और SGLang समर्थन — समुदाय पैच के लिए इंतज़ार नहीं, बस
pip install -Uऔर शुरू करेंMoE दक्षता — आप 13B/49B इन्फ़ेरेंस लागत चुकाते हैं, 284B/1.6T नहीं
आवश्यकताएँ
Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं। आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता bare metal के रूप में अनुरोध पर बेची जाती है। देखें GPU मूल्य और उपलब्धता किसी deployment का आकार तय करने से पहले।
V4-Pro एक frontier model है। पूर्ण BF16 वज़न लगभग 3.2TB हैं और multi-node H100/H200 या 8× B200 NVLink की आवश्यकता होती है। एकल-सर्वर BF16 पथ उपलब्ध नहीं है। यदि आपके पास multi-node इन्फ्रा नहीं है, तो V4-Flash चलाएँ — यह हार्डवेयर लागत के 5% पर गुणवत्ता का 80% देता है।
GPU VRAM
1× 80GB या 2× 48GB
1× H100 80GB या 1× A100 80GB
8× H100 80GB या 4× H200 141GB
RAM
64GB
128GB
1TB+
डिस्क
200GB NVMe
600GB NVMe
4TB NVMe
CUDA
12.8+
12.8+
12.8+
नेटवर्क
—
—
multi-node के लिए NVLink / 400Gb IB
हार्डवेयर उपयुक्तता: 95% उपयोगकर्ताओं के लिए, 80GB-श्रेणी के कार्ड पर FP8 में V4-Flash सबसे अच्छा संतुलन है — पूरा 256K संदर्भ, कोई क्वांटाइज़ेशन नुकसान नहीं, bare metal मार्केटप्लेस पर। इस्तेमाल करें H100 या H200 tensor-parallel सेटअप केवल तब करें जब आपको सचमुच V4-Pro का 1M संदर्भ या अतिरिक्त reasoning headroom चाहिए।
विकल्प A — Ollama / GGUF (क्वांटाइज़्ड, केवल V4-Flash)
Unsloth ने रिलीज़ के 48 घंटे के भीतर V4-Flash के लिए GGUF क्वांट्स प्रकाशित किए। Q4_K_M सबसे अच्छा संतुलन है — यह 1× 80GB या 2× 48GB पर फिट हो जाता है और गुणवत्ता को FP8 के काफ़ी करीब रखता है।
विकल्प B — vLLM (प्रोडक्शन API, अनुशंसित)
vLLM 0.7.x ने दोनों V4 चेकपॉइंट्स के लिए दिन-0 समर्थन जोड़ा। हाइब्रिड अटेंशन kernels को --trust-remote-code और पूर्ण गति के लिए Hopper या Blackwell हार्डवेयर चाहिए।
एकल H100 / A100 80GB पर V4-Flash:
8× H100 80GB पर V4-Pro: कमांड को इसके साथ बदलें:
विकल्प C — SGLang (विकल्प, Hopper पर अक्सर तेज)
SGLang का RadixAttention और prefix caching, V4 के hybrid attention के साथ अच्छी तरह मेल खाते हैं — साझा prompts वाले agentic workloads के लिए vLLM की तुलना में काफ़ी बेहतर tok/s की अपेक्षा करें।
SGLang का --enable-torch-compile आमतौर पर प्रारंभिक वार्मअप के बाद Hopper पर थ्रूपुट में अतिरिक्त 10–20% जोड़ता है।
Clore.ai GPU अनुशंसाएँ
1× RTX 5090 32GB (Q4 GGUF, आंशिक ऑफलोड)
V4-Flash
32GB + RAM
सीमित, केवल dev
$0.25–0.77/घंटा पीक
4× H100 80GB
V4-Flash FP8 (ज़रूरत से ज़्यादा) या V4-Pro Q4
320GB
मल्टी-टेनेंट Flash, एकल-स्ट्रीम Pro
~$1.04/घंटा
Clore.ai पर सबसे बेहतर मूल्य: 1× A100 80GB पर चल रहा V4-Flash FP8। आपको 256K संदर्भ, ~13B सक्रिय इन्फ़ेरेंस लागत, कोई क्वांटाइज़ेशन नुकसान नहीं मिलता, और बिल लगभग Claude Sonnet API सदस्यता की कीमत के बराबर होता है — जबकि वज़न आपके बॉक्स पर ही रहते हैं।
उपयोग के मामले
पूरे कोडबेस पर तर्क — V4-Pro का 1M संदर्भ एक सामान्य 500K-LOC monorepo और उसके tests को एक ही प्रॉम्प्ट में समा लेता है
लंबी-रूप RAG — पूरी किताबें, अदालत में दाख़िल दस्तावेज़, या वार्षिक रिपोर्टें संदर्भ में डालें, chunking pipeline को छोड़ें
एजेंटिक कोडिंग — V4-Flash, इन्फ़ेरेंस लागत के एक अंश पर SWE-Bench में V3 के बराबर है; इसे SWE-agent या OpenHands के साथ जोड़ें
बहु-दस्तावेज़ संश्लेषण — पहले जिन research workflows के लिए Gemini 2.5 Pro चाहिए था, वे अब आपके अपने हार्डवेयर पर चलते हैं
स्व-होस्टेड Cursor / Copilot विकल्प — एकल A100 पर V4-Flash 5-डेवलपर टीम की ज़रूरतें पूरी कर देता है
फाइन-ट्यूनिंग आधार — MIT लाइसेंस + साफ़ MoE आर्किटेक्चर इसे डोमेन फाइन-ट्यून के लिए एक मज़बूत शुरुआती बिंदु बनाता है
बेंचमार्क
विक्रेता-प्रदत्त दावा — स्वतंत्र रूप से सत्यापित करें। नीचे दिए गए आँकड़े DeepSeek की 22 अप्रैल 2026 की घोषणा और मॉडल कार्ड से लिए गए हैं। स्वतंत्र पुनरुत्पादन अभी भी प्रकाशित हो रहे हैं; इन्हें केवल दिशा-सूचक मानें, अंतिम सत्य नहीं।
MMLU-Pro
~84%
~78%
~76%
~80%
SWE-Bench Verified
~82%
~74%
~70%
~79%
HumanEval
~96%
~92%
~91%
~94%
MATH-500
~94%
~88%
~85%
~90%
LiveCodeBench
~76%
~68%
~62%
~72%
लंबा-संदर्भ (1M सुई-में-घास का ढेर)
~98%
लागू नहीं
लागू नहीं
लागू नहीं
समान-आधारित open-weight तुलना के लिए देखें GLM-5.1 गाइड — बेंचमार्क के अनुसार V4-Pro और GLM-5.1 एक-दूसरे को टक्कर देते हैं।
समस्या निवारण
OutOfMemoryError 8×H100 पर V4-Pro लोड करना
BF16 के लिए लगभग 3.2TB चाहिए — Pro को एकल 8×H100 node पर फिट नहीं किया जा सकता। 4× H200 141GB या multi-node का उपयोग करें।
असमर्थित attention backend
V4 के लिए vLLM ≥ 0.7.0 या SGLang ≥ 0.4.4 चाहिए। चलाएँ pip install -U vllm (या पुल करें :latest Docker image)।
HuggingFace डाउनलोड धीमा
उपयोग करें huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download. Pro लगभग 3.2TB है; Flash लगभग 570GB है।
--trust-remote-code अस्वीकृत
हाइब्रिड अटेंशन मॉड्यूल रिपो में कस्टम कोड के रूप में आते हैं — --trust-remote-code जब तक kernels upstream Transformers में नहीं आ जाते, दोनों engines के लिए आवश्यक है।
GGUF Q4 निरर्थक आउटपुट देता है
सुनिश्चित करें कि आप Unsloth बिल्ड पर हैं (unsloth/DeepSeek-V4-Flash-GGUF), किसी शुरुआती community quant पर नहीं। MoE router को विशेष handling चाहिए, जिसे शुरुआती quants ने गलत किया था।
V4-Pro पर 1M संदर्भ OOM
इसे घटाएँ --max-model-len 262144 और जोड़ें --enable-prefix-caching. वास्तविक 1M serving के लिए H200 या B200 चाहिए।
लंबे संदर्भ पर धीमा prefill
यह अपेक्षित है — हाइब्रिड अटेंशन के बावजूद, 500K+ prefill मिनटों में होता है, सेकंडों में नहीं। उपयोग करें --enable-chunked-prefill और लागत बाँटने के लिए prefix caching।
अगले चरण
पूर्ववर्ती: DeepSeek V3 — V4-Flash मॉडल प्रभावी रूप से इसे बदल देता है
तर्क वाला सिब्लिंग: DeepSeek-R1 — chain-of-thought के लिए ट्यून किया गया, फिर भी गणित-प्रधान workflows के लिए उपयोगी
ओपन-वेट विकल्प: GLM-5.1 — 744B MoE, SWE-Bench Pro के शीर्ष पर, तुलनीय कीमत-प्रदर्शन
मल्टीमोडल विकल्प: Qwen3.5-Omni — यदि आपको एक ही मॉडल में vision/audio चाहिए
हार्डवेयर किराए पर लें: Clore.ai मार्केटप्लेस — H100/H200/A100/RTX 4090 $0.14–0.42/घंटा से
लिंक्स
अंतिम अपडेट
क्या यह उपयोगी था?