Llama 4 (Scout & Maverick)
Clore.ai GPUs पर Meta Llama 4 Scout & Maverick MoE मॉडल चलाएँ
Meta का Llama 4, अप्रैल 2025 में जारी, की ओर एक मूलभूत बदलाव का संकेत देता है विशेषज्ञों का मिश्रण (MoE) आर्किटेक्चर। हर टोकन के लिए सभी पैरामीटर सक्रिय करने के बजाय, Llama 4 प्रत्येक टोकन को विशेषीकृत "एक्सपर्ट" उप-नेटवर्क्स तक भेजता है — जिससे कंप्यूट लागत के एक अंश पर अत्याधुनिक प्रदर्शन मिलता है। दो ओपन-वेट मॉडल उपलब्ध हैं: Scout (एकल-GPU के लिए आदर्श) और Maverick (बहु-GPU का पावरहाउस)।
मुख्य विशेषताएँ
MoE आर्किटेक्चर: प्रति टोकन केवल 17B पैरामीटर सक्रिय (कुल 109B/400B में से)
विशाल कॉन्टेक्स्ट विंडोज़: Scout 10M टोकन का समर्थन करता है, Maverick 1M टोकन का समर्थन करता है
मूल रूप से मल्टीमोडल: बॉक्स से बाहर ही टेक्स्ट और इमेज दोनों को समझता है
दो मॉडल: Scout (16 एक्सपर्ट, एकल-GPU के लिए अनुकूल) और Maverick (128 एक्सपर्ट, बहु-GPU)
प्रतिस्पर्धी प्रदर्शन: Scout, Gemma 3 27B के बराबर है; Maverick, GPT-4o श्रेणी के मॉडल्स से मुकाबला करता है
ओपन वेट्स: Llama Community License (अधिकांश व्यावसायिक उपयोगों के लिए मुफ़्त)
मॉडल वेरिएंट
Scout
109B
17B
16
10M
12GB
80GB
Maverick
400B
17B
128
1M
48GB (मल्टी)
320GB (मल्टी)
आवश्यकताएँ
GPU
1× RTX 4090
1× H100
4× RTX 4090
VRAM
24GB
80GB
4×24GB
RAM
32GB
64GB
128GB
डिस्क
50GB
120GB
250GB
CUDA
12.8+
12.8+
12.8+
अनुशंसित Clore.ai GPU: Scout के लिए RTX 4090 24GB ($0.14–0.42/घंटा) — सबसे बेहतर मूल्य
Ollama के साथ त्वरित शुरुआत
Llama 4 को चालू करने का सबसे तेज़ तरीका:
API सर्वर के रूप में Ollama
vLLM सेटअप (प्रोडक्शन)
उच्च throughput वाले प्रोडक्शन वर्कलोड के लिए:
vLLM सर्वर को क्वेरी करें
HuggingFace Transformers
Docker त्वरित शुरुआत
Clore.ai पर MoE क्यों महत्वपूर्ण है
पारंपरिक dense मॉडल (जैसे Llama 3.3 70B) को भारी VRAM चाहिए क्योंकि सभी 70B पैरामीटर सक्रिय होते हैं। Llama 4 Scout में कुल 109B हैं लेकिन प्रति टोकन केवल 17B सक्रिय होते हैं — यानी:
70B+ dense मॉडल्स जैसी ही गुणवत्ता VRAM लागत के एक अंश पर
एक ही RTX 4090 पर फिट हो जाता है क्वांटाइज़्ड मोड में
10M टोकन कॉन्टेक्स्ट — पूरे कोडबेस, लंबे दस्तावेज़, किताबें प्रोसेस करें
किराए पर लेना सस्ता — 70B मॉडल्स के लिए मल्टी-GPU रिग की बजाय $0.14–0.42/घंटा पर एक RTX 4090
Clore.ai उपयोगकर्ताओं के लिए सुझाव
Scout Q4 से शुरू करें: RTX 4090 पर पैसे का सबसे बेहतर मूल्य — $0.14–0.42/घंटा, 95% उपयोग-केस कवर करता है
उपयोग करें
--max-model-lenसमझदारी से: जितने कॉन्टेक्स्ट की ज़रूरत हो उससे ज़्यादा सेट न करें — यह VRAM आरक्षित करता है। 8192 से शुरू करें, आवश्यकता अनुसार बढ़ाएँMaverick के लिए Tensor Parallel: Maverick के लिए 4× RTX 4090 मशीनें किराए पर लें; उपयोग करें
--tensor-parallel-size 4HuggingFace लॉगिन आवश्यक:
huggingface-cli login— आपको पहले HF पर Llama लाइसेंस स्वीकार करना होगात्वरित परीक्षणों के लिए Ollama, उत्पादन के लिए vLLM: Ollama सेटअप करने में तेज़ है; vLLM API सर्विंग के लिए अधिक throughput देता है
GPU मेमोरी मॉनिटर करें:
nvidia-smi देखें— MoE मॉडल लंबे सीक्वेंस पर VRAM में स्पाइक कर सकते हैं
समस्या निवारण
OutOfMemoryError
कम करें --max-model-len, Q4 क्वांटाइज़ेशन का उपयोग करें, या GPU अपग्रेड करें
मॉडल डाउनलोड विफल होता है
चलाएँ huggingface-cli login और hf.co पर Llama 4 लाइसेंस स्वीकार करें
धीमी जनरेशन
सुनिश्चित करें कि GPU उपयोग में है (nvidia-smi); जांचें --gpu-memory-utilization
स्टार्टअप पर vLLM क्रैश हो जाता है
कॉन्टेक्स्ट लंबाई कम करें; सुनिश्चित करें कि CUDA 11.8+ इंस्टॉल है
Ollama गलत मॉडल दिखाता है
चलाएँ सत्यापित करने के लिए ollama list कि; ollama rm + ollama pull पुनः डाउनलोड करने के लिए
अधिक पढ़ें
अंतिम अपडेट
क्या यह उपयोगी था?