> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/deepseek-v4.md).

# DeepSeek V4 (1.6T MoE, मल्टिमोडल)

Clore.ai पर DeepSeek V4 डिप्लॉय करें — MIT-लाइसेंस वाला फ्रंटियर MoE, Flash-0731 और Pro-0813 के रूप में रिफ़्रेश किया गया

{% hint style="info" %}
**स्थिति (अगस्त 2026):** DeepSeek V4 पहली बार 22 अप्रैल 2026 को जारी किया गया था **22 अप्रैल 2026** के अंतर्गत **MIT**, और तब से दोनों स्तरों को ताज़ा किया गया है। वर्तमान चेकपॉइंट हैं [deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) (**31 जुलाई 2026**, 167GB FP8, 1M संदर्भ, speculative-decoding मॉड्यूल संलग्न) और [deepseek-ai/DeepSeek-V4-Pro-0813](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813) (**13 अगस्त 2026**, 893GB FP8, 1M संदर्भ)। अप्रैल वाले रिपो अभी भी पूर्वावलोकन पीढ़ी के रूप में उपलब्ध हैं।
{% endhint %}

## अप्रैल के बाद क्या बदला

|               | अप्रैल पूर्वावलोकन  | वर्तमान                                                                                                                                     |
| ------------- | ------------------- | ------------------------------------------------------------------------------------------------------------------------------------------- |
| Flash         | `DeepSeek-V4-Flash` | **`DeepSeek-V4-Flash-0731`** — 167GB FP8, 43 परतें, 256 एक्सपर्ट (6 सक्रिय), 1M संदर्भ, DSpark speculative decoding संलग्न                  |
| Pro           | `DeepSeek-V4-Pro`   | **`DeepSeek-V4-Pro-0813`** — 893GB FP8, 61 परतें, 384 एक्सपर्ट (6 सक्रिय), 1M संदर्भ                                                        |
| तर्क नियंत्रण | —                   | `reasoning_effort`: `निम्न`, `उच्च`, `अधिकतम`                                                                                               |
| चैट टेम्पलेट  | Jinja               | **कोई Jinja टेम्पलेट नहीं।** रिपो के साथ एक `encoding/` फ़ोल्डर आता है, जिसमें प्रॉम्प्ट बनाने और आउटपुट पार्स करने के लिए Python सहायक हैं |

**Flash-0731, अप्रैल Pro पूर्वावलोकन से बेहतर प्रदर्शन करता है** DeepSeek के अपने बेंचमार्क पर, सक्रिय पैरामीटरों के एक अंश के बावजूद: Terminal-Bench 2.1 **82.7** (72.1 बनाम), NL2Repo **54.2** (38.5 बनाम), DeepSWE **54.4** (12.8 बनाम), Toolathlon-Verified **70.3** (55.9 बनाम)। ये विक्रेता द्वारा रिपोर्ट किए गए हैं, और DeepSeek के अपने harness से मापे गए हैं, निम्न पर `reasoning_effort: max`.

यदि आपने अप्रैल पूर्वावलोकन तैनात किया था, तो इसमें जाना `-0731` अभी DeepSeek परिनियोजन में आप जो एकल सबसे मूल्यवान बदलाव कर सकते हैं, वही है।

### Speculative decoding के साथ Flash-0731 सर्व करना

```bash
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
```

{% hint style="warning" %}
**167GB वज़न के लिए कार्ड नहीं, एक रिग चाहिए।** Clore.ai मार्केटप्लेस पर इसका मतलब है 6× RTX 5090 (186GB) या 8× RTX 4090 (192GB) — ≥167GB पर 72 सर्वर सूचीबद्ध थे, और अंतिम स्नैपशॉट में 26 मुफ़्त थे। क्वांटाइज़्ड GGUF बिल्ड इसे और नीचे लाते हैं। 893GB वाला Pro-0813 एक [bare metal](https://clore.ai/bare-metal) परिनियोजन है।
{% endhint %}

DeepSeek V4, 2026 का पहला open-weight frontier model है जो एक **दो-स्तरीय रिलीज़**. **V4-Pro** फ्लैगशिप है — एक **1.6 ट्रिलियन पैरामीटर वाला Mixture-of-Experts** लगभग **प्रति टोकन 49B सक्रिय पैरामीटर**, एक **1M टोकन संदर्भ विंडो**, और एक हाइब्रिड अटेंशन डिज़ाइन, जो Compressed Sparse Attention को नए Heavily Compressed Attention हेड के साथ जोड़ता है ताकि सस्ते लंबे-संदर्भ प्रीफिल मिल सकें। **V4-Flash** व्यावहारिक सिब्लिंग है — **कुल 284B / सक्रिय 13B**, वही आर्किटेक्चर, क्वांटाइज़ करने पर एकल 80GB GPU पर फिट हो जाता है, और Unsloth GGUF बिल्ड्स के साथ 2×48GB बॉक्स पर आराम से चलता है।

आर्किटेक्चर ही मुख्य बात है। DeepSeek का हाइब्रिड अटेंशन लंबे संदर्भ पर KV-cache मेमोरी को बहुत कम कर देता है, और MoE राउटर को अधिक सटीक एक्सपर्ट चयन के लिए पुनः प्रशिक्षित किया गया है — शुरुआती स्वतंत्र रन बताते हैं कि Pro, लगभग आधे सक्रिय-पैरामीटर कंप्यूट पर V3-स्तर के कोडिंग स्कोर हासिल करता है। Clore.ai उपयोगकर्ताओं के लिए यह महत्वपूर्ण है क्योंकि **V4-Flash पहली बार है जब 15B से कम सक्रिय वाला frontier-class मॉडल पूर्ण वज़नों के साथ जारी किया गया है**, जिससे गंभीर ओपन इन्फ़ेरेंस एक H100 या सस्ते multi-4090 बॉक्स की पहुँच में आ जाता है।

अधिकांश टीमों के लिए यथार्थवादी Clore परिनियोजन है **1× A100 80GB या 2× RTX 4090 पर V4-Flash** — यहीं कीमत-प्रदर्शन का असली लाभ है। V4-Pro गंभीर इन्फ्रा के लिए आरक्षित है: 8× H100, 4× H200, या 8× B200, आदर्श रूप से NVLink के साथ। यदि आप चलाते रहे हैं [DeepSeek V3](/guides/guides_v2-hi/language-models/deepseek-v3.md) या [DeepSeek-R1](/guides/guides_v2-hi/language-models/deepseek-r1.md), तो माइग्रेशन पथ सीधा है — वही मॉडल परिवार, वही चैट टेम्पलेट, vLLM पर ड्रॉप-इन प्रतिस्थापन।

### मुख्य विनिर्देश

| गुण             | DeepSeek V4-Pro                                                                   | DeepSeek V4-Flash                                                                     |
| --------------- | --------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------- |
| कुल पैरामीटर    | 1.6T (MoE)                                                                        | 284B (MoE)                                                                            |
| सक्रिय पैरामीटर | प्रति टोकन \~49B                                                                  | प्रति टोकन \~13B                                                                      |
| संदर्भ विंडो    | 1,000,000 टोकन                                                                    | 256,000 टोकन                                                                          |
| अटेंशन          | संपीडित विरल + अत्यधिक संपीडित अटेंशन                                             | संपीडित विरल + HCA                                                                    |
| लाइसेंस         | MIT                                                                               | MIT                                                                                   |
| रिलीज़ तिथि     | 22 अप्रैल 2026                                                                    | 22 अप्रैल 2026                                                                        |
| HuggingFace     | [deepseek-ai/DeepSeek-V4-Pro](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro) | [deepseek-ai/DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) |
| मुख्य टूलिंग    | vLLM, SGLang (दिन-0)                                                              | vLLM, SGLang, llama.cpp (Unsloth GGUF)                                                |

### DeepSeek V4 क्यों?

* **वास्तव में खुले frontier वज़न** — MIT लाइसेंस, कोई उपयोग प्रतिबंध नहीं, पूर्ण व्यावसायिक उपयोग
* **Pro पर 1M संदर्भ, Flash पर 256K** — पूरे कोडबेस, किताबों, या घंटे भर की प्रतिलिपियों को एक ही पास में संभालता है
* **हाइब्रिड विरल अटेंशन** — लंबे संदर्भ पर KV cache उप-रेखीय रूप से स्केल करता है, प्रीफिल सस्ता है
* **दो-स्तरीय रिलीज़** — Flash पहला 13B-सक्रिय MoE है जो अधिकांश वर्कफ़्लो में V3 को बदलने लायक अच्छा है
* **पहले दिन से vLLM और SGLang समर्थन** — समुदाय पैच के लिए इंतज़ार नहीं, बस `pip install -U` और शुरू करें
* **MoE दक्षता** — आप 13B/49B इन्फ़ेरेंस लागत चुकाते हैं, 284B/1.6T नहीं

***

## आवश्यकताएँ

{% hint style="warning" %}
**Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं।** आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता [bare metal](https://clore.ai/bare-metal) के रूप में अनुरोध पर बेची जाती है। देखें [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) किसी deployment का आकार तय करने से पहले।
{% endhint %}

{% hint style="warning" %}
**V4-Pro एक frontier model है।** पूर्ण BF16 वज़न लगभग 3.2TB हैं और multi-node H100/H200 या 8× B200 NVLink की आवश्यकता होती है। एकल-सर्वर BF16 पथ उपलब्ध नहीं है। यदि आपके पास multi-node इन्फ्रा नहीं है, तो V4-Flash चलाएँ — यह हार्डवेयर लागत के 5% पर गुणवत्ता का 80% देता है।
{% endhint %}

| घटक      | न्यूनतम (V4-Flash, GGUF Q4) | अनुशंसित (V4-Flash FP8)      | पूर्ण V4-Pro (BF16)                 |
| -------- | --------------------------- | ---------------------------- | ----------------------------------- |
| GPU VRAM | 1× 80GB या 2× 48GB          | 1× H100 80GB या 1× A100 80GB | 8× H100 80GB या 4× H200 141GB       |
| RAM      | 64GB                        | 128GB                        | 1TB+                                |
| डिस्क    | 200GB NVMe                  | 600GB NVMe                   | 4TB NVMe                            |
| CUDA     | 12.8+                       | 12.8+                        | 12.8+                               |
| नेटवर्क  | —                           | —                            | multi-node के लिए NVLink / 400Gb IB |

**हार्डवेयर उपयुक्तता:** 95% उपयोगकर्ताओं के लिए, **80GB-श्रेणी के कार्ड पर FP8 में V4-Flash** सबसे अच्छा संतुलन है — पूरा 256K संदर्भ, कोई क्वांटाइज़ेशन नुकसान नहीं, [bare metal](https://clore.ai/bare-metal) मार्केटप्लेस पर। इस्तेमाल करें [H100](https://clore.ai/rent-h100.html) या [H200](https://clore.ai/rent-h200.html) tensor-parallel सेटअप केवल तब करें जब आपको सचमुच V4-Pro का 1M संदर्भ या अतिरिक्त reasoning headroom चाहिए।

***

## विकल्प A — Ollama / GGUF (क्वांटाइज़्ड, केवल V4-Flash)

Unsloth ने रिलीज़ के 48 घंटे के भीतर V4-Flash के लिए GGUF क्वांट्स प्रकाशित किए। Q4\_K\_M सबसे अच्छा संतुलन है — यह 1× 80GB या 2× 48GB पर फिट हो जाता है और गुणवत्ता को FP8 के काफ़ी करीब रखता है।

```bash
# Unsloth Q4_K_M बिल्ड को पुल करें
docker exec ollama ollama pull hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M
docker exec ollama ollama run hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M

# या डाउनलोड किए गए GGUF पर सीधे llama.cpp के साथ
docker run --gpus all -it --rm -p 8080:8080 \
  -v $(pwd)/models:/models \
  ghcr.io/ggerganov/llama.cpp:server-cuda \
  -m /models/DeepSeek-V4-Flash-Q4_K_M.gguf \
  --n-gpu-layers 99 --ctx-size 65536 \
  --port 8080 --host 0.0.0.0
```

{% hint style="info" %}
V4-**Pro** के लिए GGUF क्वांट्स मौजूद हैं, लेकिन व्यावहारिक नहीं हैं — Q2\_K भी लगभग 400GB है और ऑफलोड प्रदर्शन चैट के लिए अनुपयोगी है। क्वांटाइज़्ड परिनियोजनों के लिए Flash पर ही रहें।
{% endhint %}

***

## विकल्प B — vLLM (प्रोडक्शन API, अनुशंसित)

vLLM 0.7.x ने दोनों V4 चेकपॉइंट्स के लिए दिन-0 समर्थन जोड़ा। हाइब्रिड अटेंशन kernels को `--trust-remote-code` और पूर्ण गति के लिए Hopper या Blackwell हार्डवेयर चाहिए।

**एकल H100 / A100 80GB पर V4-Flash:**

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model deepseek-ai/DeepSeek-V4-Flash
      --tensor-parallel-size 1
      --max-model-len 131072
      --dtype bfloat16
      --gpu-memory-utilization 0.92
      --enable-chunked-prefill
      --served-model-name deepseek-v4-flash
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

**8× H100 80GB पर V4-Pro:** कमांड को इसके साथ बदलें:

```yaml
    command: >
      --model deepseek-ai/DeepSeek-V4-Pro
      --tensor-parallel-size 8
      --max-model-len 262144
      --dtype bfloat16
      --gpu-memory-utilization 0.90
      --enable-chunked-prefill
      --enable-prefix-caching
      --served-model-name deepseek-v4-pro
      --trust-remote-code
```

```bash
# API का परीक्षण करें
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "एक Rust async TCP echo server लिखें जिसमें graceful shutdown हो।"}],
    "max_tokens": 2048,
    "temperature": 0.6
  }'
```

{% hint style="info" %}
से शुरू करें `--max-model-len 131072` भले ही अंत में आप पूरा 1M ctx चाहते हों — लंबे संदर्भ प्रीफिल समय और KV मेमोरी को बहुत बढ़ा देते हैं। बेसलाइन स्थिर होने के बाद ही इसे बढ़ाएँ।
{% endhint %}

***

## विकल्प C — SGLang (विकल्प, Hopper पर अक्सर तेज)

SGLang का RadixAttention और prefix caching, V4 के hybrid attention के साथ अच्छी तरह मेल खाते हैं — साझा prompts वाले agentic workloads के लिए vLLM की तुलना में काफ़ी बेहतर tok/s की अपेक्षा करें।

```bash
docker pull lmsysorg/sglang:latest

# 1× H100/A100 पर V4-Flash
python3 -m sglang.launch_server \\
  --model-path deepseek-ai/DeepSeek-V4-Flash \
  --tp-size 1 \
  --context-length 131072 \
  --mem-fraction-static 0.90 \\
  --enable-torch-compile \
  --served-model-name deepseek-v4-flash \
  --trust-remote-code

# 8× H100 पर V4-Pro
python3 -m sglang.launch_server \\
  --model-path deepseek-ai/DeepSeek-V4-Pro \
  --tp-size 8 \\
  --context-length 262144 \\
  --mem-fraction-static 0.88 \
  --enable-torch-compile \
  --served-model-name deepseek-v4-pro \
  --trust-remote-code
```

SGLang का `--enable-torch-compile` आमतौर पर प्रारंभिक वार्मअप के बाद Hopper पर थ्रूपुट में अतिरिक्त 10–20% जोड़ता है।

***

## Clore.ai GPU अनुशंसाएँ

| सेटअप                                                      | मॉडल                                          | VRAM       | अपेक्षित थ्रूपुट                    | Clore.ai लागत                             |
| ---------------------------------------------------------- | --------------------------------------------- | ---------- | ----------------------------------- | ----------------------------------------- |
| 2× [RTX 4090](https://clore.ai/rent-4090.html) (Q4 GGUF)   | V4-Flash                                      | 48GB       | शौकिया उपयोग, एकल-स्ट्रीम           | $0.14–0.42/hr                             |
| 1× [A100 80GB](https://clore.ai/rent-a100-80gb.html) (FP8) | V4-Flash                                      | 80GB       | मज़बूत प्रोडक्शन एकल-टेनेंट         | [bare metal](https://clore.ai/bare-metal) |
| 1× RTX 5090 32GB (Q4 GGUF, आंशिक ऑफलोड)                    | V4-Flash                                      | 32GB + RAM | सीमित, केवल dev                     | $0.25–0.77/घंटा पीक                       |
| 4× [H100 80GB](https://clore.ai/rent-h100.html)            | V4-Flash FP8 (ज़रूरत से ज़्यादा) या V4-Pro Q4 | 320GB      | मल्टी-टेनेंट Flash, एकल-स्ट्रीम Pro | \~$1.04/घंटा                              |
| 8× [H100 80GB](https://clore.ai/rent-h100.html)            | V4-Pro BF16                                   | 640GB      | प्रोडक्शन frontier इन्फ़ेरेंस       | \~$1.04/घंटा                              |
| 4× [H200 141GB](https://clore.ai/rent-h200.html)           | V4-Pro BF16 + 1M ctx                          | 564GB      | पूरा 1M संदर्भ, अधिकतम थ्रूपुट      | [bare metal](https://clore.ai/bare-metal) |

{% hint style="success" %}
**Clore.ai पर सबसे बेहतर मूल्य:** 1× A100 80GB पर चल रहा V4-Flash FP8। आपको 256K संदर्भ, \~13B सक्रिय इन्फ़ेरेंस लागत, कोई क्वांटाइज़ेशन नुकसान नहीं मिलता, और बिल लगभग Claude Sonnet API सदस्यता की कीमत के बराबर होता है — जबकि वज़न आपके बॉक्स पर ही रहते हैं।
{% endhint %}

***

## उपयोग के मामले

* **पूरे कोडबेस पर तर्क** — V4-Pro का 1M संदर्भ एक सामान्य 500K-LOC monorepo और उसके tests को एक ही प्रॉम्प्ट में समा लेता है
* **लंबी-रूप RAG** — पूरी किताबें, अदालत में दाख़िल दस्तावेज़, या वार्षिक रिपोर्टें संदर्भ में डालें, chunking pipeline को छोड़ें
* **एजेंटिक कोडिंग** — V4-Flash, इन्फ़ेरेंस लागत के एक अंश पर SWE-Bench में V3 के बराबर है; इसे SWE-agent या OpenHands के साथ जोड़ें
* **बहु-दस्तावेज़ संश्लेषण** — पहले जिन research workflows के लिए Gemini 2.5 Pro चाहिए था, वे अब आपके अपने हार्डवेयर पर चलते हैं
* **स्व-होस्टेड Cursor / Copilot विकल्प** — एकल A100 पर V4-Flash 5-डेवलपर टीम की ज़रूरतें पूरी कर देता है
* **फाइन-ट्यूनिंग आधार** — MIT लाइसेंस + साफ़ MoE आर्किटेक्चर इसे डोमेन फाइन-ट्यून के लिए एक मज़बूत शुरुआती बिंदु बनाता है

***

## बेंचमार्क

{% hint style="warning" %}
**विक्रेता-प्रदत्त दावा — स्वतंत्र रूप से सत्यापित करें।** नीचे दिए गए आँकड़े DeepSeek की 22 अप्रैल 2026 की घोषणा और मॉडल कार्ड से लिए गए हैं। स्वतंत्र पुनरुत्पादन अभी भी प्रकाशित हो रहे हैं; इन्हें केवल दिशा-सूचक मानें, अंतिम सत्य नहीं।
{% endhint %}

| Benchmark                           | V4-Pro | V4-Flash  | DeepSeek V3 | GLM-5.1   |
| ----------------------------------- | ------ | --------- | ----------- | --------- |
| MMLU-Pro                            | \~84%  | \~78%     | \~76%       | \~80%     |
| SWE-Bench Verified                  | \~82%  | \~74%     | \~70%       | \~79%     |
| HumanEval                           | \~96%  | \~92%     | \~91%       | \~94%     |
| MATH-500                            | \~94%  | \~88%     | \~85%       | \~90%     |
| LiveCodeBench                       | \~76%  | \~68%     | \~62%       | \~72%     |
| लंबा-संदर्भ (1M सुई-में-घास का ढेर) | \~98%  | लागू नहीं | लागू नहीं   | लागू नहीं |

समान-आधारित open-weight तुलना के लिए देखें [GLM-5.1 गाइड](/guides/guides_v2-hi/language-models/glm-5-1.md) — बेंचमार्क के अनुसार V4-Pro और GLM-5.1 एक-दूसरे को टक्कर देते हैं।

***

## समस्या निवारण

| समस्या                                       | समाधान                                                                                                                                                                                      |
| -------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` 8×H100 पर V4-Pro लोड करना | BF16 के लिए लगभग 3.2TB चाहिए — Pro को एकल 8×H100 node पर फिट नहीं किया जा सकता। 4× H200 141GB या multi-node का उपयोग करें।                                                                  |
| `असमर्थित attention backend`                 | V4 के लिए vLLM ≥ 0.7.0 या SGLang ≥ 0.4.4 चाहिए। चलाएँ `pip install -U vllm` (या पुल करें `:latest` Docker image)।                                                                           |
| HuggingFace डाउनलोड धीमा                     | उपयोग करें `huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download`. Pro लगभग 3.2TB है; Flash लगभग 570GB है।                                        |
| `--trust-remote-code` अस्वीकृत               | हाइब्रिड अटेंशन मॉड्यूल रिपो में कस्टम कोड के रूप में आते हैं — `--trust-remote-code` जब तक kernels upstream Transformers में नहीं आ जाते, दोनों engines के लिए आवश्यक है।                  |
| GGUF Q4 निरर्थक आउटपुट देता है               | सुनिश्चित करें कि आप Unsloth बिल्ड पर हैं (`unsloth/DeepSeek-V4-Flash-GGUF`), किसी शुरुआती community quant पर नहीं। MoE router को विशेष handling चाहिए, जिसे शुरुआती quants ने गलत किया था। |
| V4-Pro पर 1M संदर्भ OOM                      | इसे घटाएँ `--max-model-len 262144` और जोड़ें `--enable-prefix-caching`. वास्तविक 1M serving के लिए H200 या B200 चाहिए।                                                                      |
| लंबे संदर्भ पर धीमा prefill                  | यह अपेक्षित है — हाइब्रिड अटेंशन के बावजूद, 500K+ prefill मिनटों में होता है, सेकंडों में नहीं। उपयोग करें `--enable-chunked-prefill` और लागत बाँटने के लिए prefix caching।                 |

***

## अगले चरण

* **पूर्ववर्ती:** [DeepSeek V3](/guides/guides_v2-hi/language-models/deepseek-v3.md) — V4-Flash मॉडल प्रभावी रूप से इसे बदल देता है
* **तर्क वाला सिब्लिंग:** [DeepSeek-R1](/guides/guides_v2-hi/language-models/deepseek-r1.md) — chain-of-thought के लिए ट्यून किया गया, फिर भी गणित-प्रधान workflows के लिए उपयोगी
* **ओपन-वेट विकल्प:** [GLM-5.1](/guides/guides_v2-hi/language-models/glm-5-1.md) — 744B MoE, SWE-Bench Pro के शीर्ष पर, तुलनीय कीमत-प्रदर्शन
* **मल्टीमोडल विकल्प:** [Qwen3.5-Omni](/guides/guides_v2-hi/language-models/qwen35-omni.md) — यदि आपको एक ही मॉडल में vision/audio चाहिए
* **हार्डवेयर किराए पर लें:** [Clore.ai मार्केटप्लेस](https://clore.ai/marketplace) — H100/H200/A100/RTX 4090 $0.14–0.42/घंटा से

### लिंक्स

* [HuggingFace पर DeepSeek-V4-Pro](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)
* [HuggingFace पर DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash)
* [Unsloth V4-Flash GGUF क्वांट्स](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF)
* [DeepSeek GitHub](https://github.com/deepseek-ai)
* [vLLM दस्तावेज़](https://docs.vllm.ai)
* [SGLang repo](https://github.com/sgl-project/sglang)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
