For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.6-27B (Dense, Single-GPU)

Qwen3.6-27B को Alibaba द्वारा Clore.ai पर डिप्लॉय करें — एक dense 27B जो एक RTX 4090 पर फिट होता है और 262K native context के साथ आता है

स्थिति (अप्रैल 2026): Qwen3.6-27B को Alibaba ने जारी किया था 21 अप्रैल 2026 के अंतर्गत Apache 2.0 लाइसेंस। वज़न यहाँ उपलब्ध हैं huggingface.co/Qwen/Qwen3.6-27B. यह एक डेंस 27B मॉडल है — MoE नहीं — जिसके पास 262K-टोकन का मूल संदर्भ है, जो आगे बढ़कर YaRN के साथ 1M टोकनतक जाता है, और vLLM, SGLang, तथा Ollama में पहले दिन से समर्थन मिलता है।

2026 के MoE दिग्गज — DeepSeek V4, GLM-5.1, MiMo-V2.5-Pro — बेंचमार्क पर रोमांचक हैं, लेकिन व्यवहार में भारी पड़ते हैं: सैकड़ों GB वज़न, मल्टी-GPU रैक, नाज़ुक एक्सपर्ट-रूटिंग कर्नेल, और ऐसे इन्फ़रेंस बिल जो वित्त टीमों को चौंका देते हैं। Qwen3.6-27B दूसरी दिशा में चलता है। यह डेंसहै, हर टोकन पर हर पैरामीटर सक्रिय होता है, VRAM गीगाबाइट स्तर तक पूर्वानुमेय है, और 8K संदर्भ पार करने पर कोई एक्सपर्ट-रूटिंग सरप्राइज़ नहीं होता।

अधिकांश टीमों के लिए सवाल यह नहीं है कि "क्या हम 744B MoE सर्व कर सकते हैं" — बल्कि यह है कि "क्या हम अपने क्लस्टर में एक अच्छा कार्ड लगाकर उस पर फ्रंटियर-स्तरीय कोडिंग असिस्टेंट चला सकते हैं?" Qwen3.6-27B ठीक उसी के लिए बनाया गया है। Q4 एक सिंगल RTX 4090 24GBमें फिट हो जाता है, Q8 एक सिंगल RTX 5090 32GBमें फिट हो जाता है, BF16 एक सिंगल L40S 48GB या A100 40GBमें फिट हो जाता है, और Alibaba प्रकाशित कर रहा है SWE-Bench Verified पर 77.2% (विक्रेता-घोषित)। एक कार्ड, एक कंटेनर, एक मॉडल।

मुख्य विनिर्देश

गुण
मान

पैरामीटर

27B (डेंस)

आर्किटेक्चर

डेंस डिकोडर-ओनली ट्रांसफ़ॉर्मर

मूल संदर्भ

262,144 टोकन

विस्तारित संदर्भ

1,000,000 टोकन (YaRN)

लाइसेंस

Apache 2.0

रिलीज़ तिथि

21 अप्रैल 2026

संगठन

Alibaba (Qwen टीम)

प्राथमिक टूलिंग

vLLM, SGLang, Ollama, llama.cpp

Qwen3.6-27B क्यों?

  • सिंगल-GPU अर्थशास्त्र — RTX 4090 पर Q4 $0.70–2.50/घंटा Clore.ai पर; डिबग करने के लिए कोई tensor-parallel orchestration नहीं

  • डेंस, MoE नहीं — निश्चित VRAM, कोई एक्सपर्ट हॉट-स्पॉटिंग नहीं, कुछ prompts पर कोई स्पाइकी latency नहीं

  • Apache 2.0 — पूरी तरह व्यावसायिक, फाइन-ट्यून करने योग्य, पुनर्वितरण योग्य, कोई उपयोग सीमा नहीं

  • 262K मूल संदर्भ, YaRN के साथ 1M — पूरे codebases, पूरी किताबें, ट्रांसक्रिप्ट के घंटे एक ही पास में

  • Day-0 vLLM / SGLang / Ollama — अपना serving stack चुनें; Qwen ने रिलीज़ के समय तीनों के लिए configs जारी किए

  • 77.2% SWE-Bench Verified (विक्रेता-घोषित) — वास्तविक कोडिंग कार्यों पर बहुत बड़े MoE मॉडलों के बराबर


आवश्यकताएँ

घटक
Q4 (GGUF / AWQ)
Q8 (GGUF / GPTQ)
BF16
पूर्ण FP16

GPU

1× RTX 4090 24GB

1× RTX 5090 32GB

1× L40S 48GB या 1× A100 40GB

1× A100 80GB

उपयोग की गई VRAM

~16–18GB

~28–30GB

~54GB

~54GB + KV cache headroom

RAM

32GB

32GB

64GB

96GB

डिस्क

20GB NVMe

32GB NVMe

60GB NVMe

60GB NVMe

CUDA

12.1+

12.4+

12.1+

12.1+

Clore.ai विकल्प: 90% टीमों के लिए, एक अकेला RTX 4090 24GB Q4 (AWQ या GGUF) चलाते हुए सही उत्तर है। आपको रोज़ाना दो कप कॉफ़ी की कीमत पर फ्रंटियर-स्तरीय कोडिंग मिलती है। यदि आप थोड़ी बेहतर गुणवत्ता के लिए Q8 चाहते हैं तो RTX 5090 32GB पर जाएँ, या पूर्ण BF16 production inference के लिए L40S / A100 40GB लें।


विकल्प A — Ollama (Quantized, सबसे आसान)

Ollama "मेरे पास Clore.ai GPU है" से "मेरे पास एक chat endpoint है" तक पहुँचने का सबसे तेज़ रास्ता है।

डिफ़ॉल्ट qwen3.6:27b टैग Ollama में Q4_K_M से मैप होता है। उपयोग करें qwen3.6:27b-q8_0 Q8 के लिए यदि आपके पास RTX 5090 है, या qwen3.6:27b-fp16 पूर्ण precision के लिए (A100 80GB की आवश्यकता होती है)।


विकल्प B — vLLM (Production)

vLLM अनुशंसित production server है। नीचे दिया गया single-GPU config RTX 4090 को AWQ quantization के साथ लक्षित करता है। Multi-GPU section पूर्णता के लिए है — लेकिन 27B dense model के साथ, आपको लगभग कभी इसकी आवश्यकता नहीं पड़ती।

पूर्ण BF16 को एक सिंगल L40S 48GB या A100 40GB पर, हटाएँ --quantization awq और base checkpoint पर इंगित करें (Qwen/Qwen3.6-27B-Instruct, --dtype bfloat16, --max-model-len 131072)। tensor parallelism के साथ 2× RTX 4090 के लिए (लंबा context, बड़ा KV cache), जोड़ें --tensor-parallel-size 2.


विकल्प C — SGLang

SGLang तब चमकता है जब आप YaRN के साथ मूल 262K window से आगे निकलते हैं। पास करें --rope-scaling इसे लगभग 1M टोकन तक बढ़ाने के लिए।


Clore.ai GPU अनुशंसाएँ

सेटअप
VRAM
मोड
अपेक्षित प्रदर्शन
Clore.ai लागत

1× RTX 4090 24GB

24GB

Q4 AWQ

50–80 tok/s, 64K ctx

~$0.70–2.50/घंटा

1× RTX 5090 32GB

32GB

Q8 GPTQ

60–90 tok/s, 96K ctx

~$1.50–3.50/घंटा

1× L40S 48GB

48GB

BF16

35–55 tok/s, 131K ctx

~$1.20–2.80/घंटा

1× A100 40GB

40GB

BF16

40–60 tok/s, 96K ctx

~$1.00–2.50/घंटा

1× A100 80GB

80GB

FP16 + 262K

40–60 tok/s, पूर्ण मूल ctx

~$1.80–3.50/घंटा

2× RTX 4090

48GB

BF16 TP=2

60–80 tok/s, 262K ctx

~$1.50–4.50/घंटा


उपयोग के मामले

  • सिंगल-GPU production deployments — एक Clore.ai 4090 पर एक कंटेनर और आपके पास एक वास्तविक coding assistant है

  • कोडिंग एजेंट — 77.2% SWE-Bench Verified (विक्रेता-घोषित) इसे "autonomous PRs के लिए उपयोगी" श्रेणी में रखता है

  • लंबा-संदर्भ RAG — 262K मूल संदर्भ पूरे codebases या हफ्तों के chat logs के लिए पर्याप्त है

  • 1M-टोकन विश्लेषण — YaRN के साथ, एक पूरी किताब या कई महीनों का git log एक ही prompt में डाल दें

  • On-prem / air-gapped — उत्पाद के साथ Apache 2.0 आता है, कोई API निर्भरता नहीं

  • एज फाइन-ट्यूनिंग — 27B dense एक सिंगल कार्ड पर LoRA/QLoRA के लिए अनुकूल है

  • agent-of-agents में worker — इसे एक worker के रूप में किसी बड़े MoE planner के साथ जोड़ें जैसे GLM-5.1


बेंचमार्क

बेंचमार्क
Qwen3.6-27B
Qwen3.5-35B
Gemma 3 27B
Llama 4 Scout

SWE-Bench Verified

77.2%

~71%

~58%

~54%

HumanEval

~93%

~92%

~90%

~88%

LiveCodeBench

~68%

~65%

~55%

~52%

MMLU-Pro

~78%

~76%

~74%

~72%

MATH

~87%

~85%

~78%

~76%

मुख्य आँकड़ा है SWE-Bench Verified 77.2% — यह एक single-GPU dense model को उस क्षेत्र में रखता है जो पहले multi-GPU MoE systems के लिए आरक्षित था। इसे तब तक vendor claim मानें जब तक LMSYS / Aider boards इसकी पुष्टि न करें।


समस्या निवारण

समस्या
समाधान

RTX 4090 (Q4) पर OOM

कम करें --max-model-len को 32768; 65K ctx पर AWQ 24GB की सीमा के ठीक किनारे पर है

qwen3.6:27b Ollama में नहीं मिला

Ollama अपडेट करें; यह tag अप्रैल 2026 के अंत में आया था

vLLM द्वारा YaRN config अस्वीकार

vLLM ≥ 0.7.x की आवश्यकता है; इसे के माध्यम से पास करें --rope-scaling JSON, अलग flags के रूप में नहीं

Tool calls चुपचाप छोड़ दिए गए

जोड़ें --enable-auto-tool-choice --tool-call-parser hermes vLLM में

लंबे संदर्भ पर धीमा prefill

जोड़ें --enable-chunked-prefill और batch size कम करें

262K पर KV cache OOM

Q8 पर जाएँ या L40S 48GB / A100 80GB पर जाएँ

1M ctx के पास खराब गुणवत्ता

YaRN positions को बढ़ाता है, लेकिन गुणवत्ता लगभग 600K के बाद घटती है; महत्वपूर्ण सामग्री को अंत के पास रखें


अगले कदम

  • पूर्ववर्ती: Qwen3.5 — Qwen3.6-27B इसका dense उत्तराधिकारी है; वही परिवार, बेहतर कोडिंग, लंबा मूल ctx

  • बहु-मोडल सहोदर: Qwen3.5-Omni — यदि आपको text से अधिक चाहिए तो text + audio + image + video

  • समान dense-27B वर्ग: Gemma 3 — Google का 27B dense प्रतिद्वंद्वी, अच्छा baseline comparison

  • MoE विकल्प: Llama 4 Scout — single-GPU MoE यदि आप architectures की तुलना करना चाहते हैं

  • Frontier MoE step-up: GLM-5.1 — जब 27B dense पर्याप्त न हो और आपके पास multi-GPU budget हो

लिंक्स

अंतिम अपडेट

क्या यह उपयोगी था?