Gemma 2
Clore.ai GPUs पर Google के Gemma 2 मॉडल कुशलतापूर्वक चलाएँ
कुशल इन्फरेंस के लिए Google के Gemma 2 मॉडल चलाएँ।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
CLORE.AI पर किराए पर लेना
विज़िट करें CLORE.AI मार्केटप्लेस
GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें
चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)
अपना ऑर्डर कॉन्फ़िगर करें:
Docker इमेज चुनें
पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)
यदि आवश्यक हो तो environment variables जोड़ें
स्टार्टअप कमांड दर्ज करें
भुगतान चुनें: CLORE, BTCया USDT/USDC
ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें
अपने सर्वर तक पहुँचें
कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर
वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें
SSH:
ssh -p <port> root@<proxy-address>
Gemma 2 क्या है?
Google का Gemma 2 प्रदान करता है:
2B से 27B पैरामीटर तक के मॉडल
आकार के अनुपात में उत्कृष्ट प्रदर्शन
निर्देशों का मजबूत पालन
कुशल आर्किटेक्चर
मॉडल वेरिएंट
Gemma-2-2B
2B
3GB
8K
Gemma-2-9B
9B
12GB
8K
Gemma-2-27B
27B
32GB
8K
त्वरित डिप्लॉय
Docker इमेज:
पोर्ट:
कमांड:
अपनी सेवा तक पहुँचना
डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:
पर जाएँ मेरे ऑर्डर पेज
अपने ऑर्डर पर क्लिक करें
खोजें
http_pubURL (उदा.,abc123.clorecloud.net)
उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।
Ollama का उपयोग
इंस्टॉलेशन
मूल उपयोग
Gemma 2 2B (हल्का)
एज/मोबाइल परिनियोजन के लिए:
Gemma 2 27B (सर्वोत्तम गुणवत्ता)
vLLM सर्वर
OpenAI-संगत API
स्ट्रीमिंग
Gradio इंटरफ़ेस
बैच प्रोसेसिंग
प्रदर्शन
Gemma-2-2B
RTX 3060
~100
Gemma-2-9B
RTX 3090
~60
Gemma-2-9B
RTX 4090
~85
Gemma-2-27B
A100
~45
Gemma-2-27B (4-बिट)
RTX 4090
~30
तुलना
Gemma-2-9B
71.3%
उत्कृष्ट
तेज़
Llama-3.1-8B
69.4%
अच्छा
तेज़
Mistral-7B
62.5%
अच्छा
तेज़
समस्या निवारण
CUDA out of memory
27B के लिए - BitsAndBytesConfig के साथ 4-बिट क्वांटाइज़ेशन का उपयोग करें - `max_new_tokens` कम करें - GPU कैश साफ़ करें: `torch.cuda.empty_cache()`
धीमी जनरेशन
उत्पादन परिनियोजन के लिए vLLM का उपयोग करें
Flash Attention सक्षम करें
तेज़ इन्फरेंस के लिए 9B मॉडल आज़माएँ
आउटपुट गुणवत्ता संबंधी समस्याएँ
निर्देश-ट्यून किया गया संस्करण उपयोग करें (
-itप्रत्यय)तापमान समायोजित करें (0.7-0.9 अनुशंसित)
संदर्भ के लिए सिस्टम प्रॉम्प्ट जोड़ें
टोकनाइज़र चेतावनियाँ
transformers को नवीनतम संस्करण में अपडेट करें
उपयोग करें
padding_side="left"बैच इन्फरेंस के लिए
लागत का अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।
पैसे बचाएँ:
का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं
से भुगतान करें CLORE टोकन
विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें
अगले चरण
Llama 3.2 - Meta का मॉडल
Qwen2.5 - अलीबाबा का मॉडल
vLLM इंफ़ेरेंस - प्रोडक्शन सर्विंग
अंतिम अपडेट
क्या यह उपयोगी था?