For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 2

Clore.ai GPUs पर Google के Gemma 2 मॉडल कुशलतापूर्वक चलाएँ

नया संस्करण उपलब्ध है! Google ने जारी किया Gemma 3 मार्च 2025 में — 27B मॉडल Llama 3.1 405B को पछाड़ता है और मूल मल्टीमॉडल समर्थन जोड़ता है। अपग्रेड करने पर विचार करें।

कुशल इन्फरेंस के लिए Google के Gemma 2 मॉडल चलाएँ।

CLORE.AI पर किराए पर लेना

  1. विज़िट करें CLORE.AI मार्केटप्लेस

  2. GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें

  3. चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)

  4. अपना ऑर्डर कॉन्फ़िगर करें:

    • Docker इमेज चुनें

    • पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)

    • यदि आवश्यक हो तो environment variables जोड़ें

    • स्टार्टअप कमांड दर्ज करें

  5. भुगतान चुनें: CLORE, BTCया USDT/USDC

  6. ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें

अपने सर्वर तक पहुँचें

  • कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर

  • वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें

  • SSH: ssh -p <port> root@<proxy-address>

Gemma 2 क्या है?

Google का Gemma 2 प्रदान करता है:

  • 2B से 27B पैरामीटर तक के मॉडल

  • आकार के अनुपात में उत्कृष्ट प्रदर्शन

  • निर्देशों का मजबूत पालन

  • कुशल आर्किटेक्चर

मॉडल वेरिएंट

मॉडल
पैरामीटर
VRAM
संदर्भ

Gemma-2-2B

2B

3GB

8K

Gemma-2-9B

9B

12GB

8K

Gemma-2-27B

27B

32GB

8K

त्वरित डिप्लॉय

Docker इमेज:

पोर्ट:

कमांड:

अपनी सेवा तक पहुँचना

डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:

  1. पर जाएँ मेरे ऑर्डर पेज

  2. अपने ऑर्डर पर क्लिक करें

  3. खोजें http_pub URL (उदा., abc123.clorecloud.net)

उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।

Ollama का उपयोग

इंस्टॉलेशन

मूल उपयोग

Gemma 2 2B (हल्का)

एज/मोबाइल परिनियोजन के लिए:

Gemma 2 27B (सर्वोत्तम गुणवत्ता)

vLLM सर्वर

OpenAI-संगत API

स्ट्रीमिंग

Gradio इंटरफ़ेस

बैच प्रोसेसिंग

प्रदर्शन

मॉडल
GPU
टोकन/सेकंड

Gemma-2-2B

RTX 3060

~100

Gemma-2-9B

RTX 3090

~60

Gemma-2-9B

RTX 4090

~85

Gemma-2-27B

A100

~45

Gemma-2-27B (4-बिट)

RTX 4090

~30

तुलना

मॉडल
MMLU
गुणवत्ता
गति

Gemma-2-9B

71.3%

उत्कृष्ट

तेज़

Llama-3.1-8B

69.4%

अच्छा

तेज़

Mistral-7B

62.5%

अच्छा

तेज़

समस्या निवारण

27B के लिए - BitsAndBytesConfig के साथ 4-बिट क्वांटाइज़ेशन का उपयोग करें - `max_new_tokens` कम करें - GPU कैश साफ़ करें: `torch.cuda.empty_cache()`

धीमी जनरेशन

  • उत्पादन परिनियोजन के लिए vLLM का उपयोग करें

  • Flash Attention सक्षम करें

  • तेज़ इन्फरेंस के लिए 9B मॉडल आज़माएँ

आउटपुट गुणवत्ता संबंधी समस्याएँ

  • निर्देश-ट्यून किया गया संस्करण उपयोग करें (-it प्रत्यय)

  • तापमान समायोजित करें (0.7-0.9 अनुशंसित)

  • संदर्भ के लिए सिस्टम प्रॉम्प्ट जोड़ें

टोकनाइज़र चेतावनियाँ

  • transformers को नवीनतम संस्करण में अपडेट करें

  • उपयोग करें padding_side="left" बैच इन्फरेंस के लिए

लागत का अनुमान

CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):

GPU
प्रति घंटा दर
प्रति दिन दर
4-घंटे का सत्र

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।

पैसे बचाएँ:

  • का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं

  • से भुगतान करें CLORE टोकन

  • विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें

अगले चरण

  • Llama 3.2 - Meta का मॉडल

  • Qwen2.5 - अलीबाबा का मॉडल

  • vLLM इंफ़ेरेंस - प्रोडक्शन सर्विंग

अंतिम अपडेट

क्या यह उपयोगी था?