Llama 3.2 Vision
Clore.ai पर इमेज समझने के लिए Meta का Llama 3.2 Vision चलाएँ
छवि समझ के लिए CLORE.AI GPUs पर Meta के मल्टीमोडल Llama 3.2 Vision मॉडल चलाएँ।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
Llama 3.2 Vision क्यों?
मल्टीमोडल - टेक्स्ट और छवियों दोनों को समझता है
कई आकार - 11B और 90B पैरामीटर संस्करण
बहुउपयोगी - OCR, विज़ुअल QA, छवि कैप्शनिंग, दस्तावेज़ विश्लेषण
ओपन वेट्स - Meta का पूर्णतः ओपन सोर्स
Llama इकोसिस्टम - Ollama, vLLM, transformers के साथ संगत
मॉडल वेरिएंट
Llama-3.2-11B-Vision
11B
24GB
128K
सामान्य उपयोग, एकल GPU
Llama-3.2-90B-Vision
90B
180GB
128K
अधिकतम गुणवत्ता
Llama-3.2-11B-Vision-Instruct
11B
24GB
128K
चैट/सहायक
Llama-3.2-90B-Vision-Instruct
90B
180GB
128K
प्रोडक्शन
CLORE.AI पर त्वरित परिनियोजन
Docker इमेज:
पोर्ट:
कमांड:
अपनी सेवा तक पहुँचना
डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:
पर जाएँ मेरे ऑर्डर पेज
अपने ऑर्डर पर क्लिक करें
खोजें
http_pubURL (उदा.,abc123.clorecloud.net)
उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।
हार्डवेयर आवश्यकताएँ
Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं। आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता bare metal के रूप में अनुरोध पर बेची जाती है। देखें GPU मूल्य और उपलब्धता किसी deployment का आकार तय करने से पहले।
11B विज़न
RTX 4090 24GB
A100 40GB
A100 80GB
90B विज़न
4x A100 40GB
4x A100 80GB
8x H100
इंस्टॉलेशन
Ollama का उपयोग करके (सबसे आसान)
vLLM का उपयोग करके
Transformers का उपयोग
मूल उपयोग
छवि समझ
Ollama के साथ
vLLM API के साथ
उपयोग के मामले
OCR / पाठ निष्कर्षण
दस्तावेज़ विश्लेषण
विज़ुअल प्रश्नोत्तर
छवि कैप्शनिंग
स्क्रीनशॉट से कोड
एकाधिक छवियाँ
बैच प्रोसेसिंग
Gradio इंटरफ़ेस
प्रदर्शन
एकल छवि विवरण
11B
RTX 4090
~3s
एकल छवि विवरण
11B
A100 40GB
~2s
OCR (1 पृष्ठ)
11B
RTX 4090
~5 सेकंड
दस्तावेज़ विश्लेषण
11B
A100 40GB
~8s
बैच (10 छवियाँ)
11B
A100 40GB
~25 सेकंड
क्वांटाइज़ेशन
bitsandbytes के साथ 4-बिट
Ollama के साथ GGUF
लागत का अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें:
RTX 4090 24GB
~$0.10
11B मॉडल
A100 40GB
~$0.17
लंबे संदर्भ के साथ 11B
A100 80GB
~$0.25
11B सर्वोत्तम
4x A100 80GB
~$1.00
90B मॉडल
कीमतें अलग-अलग होती हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।
पैसे बचाएँ:
उपयोग करें स्पॉट बैच प्रोसेसिंग के लिए आदेश
से भुगतान करें CLORE टोकन
विकास के लिए क्वांटाइज़्ड मॉडल (4-बिट) का उपयोग करें
समस्या निवारण
मेमोरी समाप्त
धीमी जनरेशन
सुनिश्चित करें कि GPU का उपयोग हो रहा है (जांचें
nvidia-smi)float32 के बजाय bfloat16 का उपयोग करें
प्रसंस्करण से पहले छवि का रिज़ॉल्यूशन कम करें
बेहतर थ्रूपुट के लिए vLLM का उपयोग करें
छवि लोड नहीं हो रही
HuggingFace टोकन आवश्यक
Llama Vision बनाम अन्य
पैरामीटर
11B / 90B
7B / 34B
अज्ञात
ओपन सोर्स
हाँ
हाँ
नहीं
OCR गुणवत्ता
उत्कृष्ट
अच्छा
उत्कृष्ट
संदर्भ
128K
32K
128K
बहु-छवि
हाँ
सीमित
हाँ
लाइसेंस
Llama 3.2
Apache 2.0
स्वामित्वाधीन
Llama 3.2 Vision का उपयोग करें जब:
ओपन-सोर्स मल्टीमोडल की आवश्यकता हो
OCR और दस्तावेज़ विश्लेषण
Llama इकोसिस्टम के साथ एकीकरण
लंबे संदर्भ की समझ
अगले चरण
LLaVA - वैकल्पिक विज़न मॉडल
Florence-2 - Microsoft का विज़न मॉडल
Ollama - आसान परिनियोजन
vLLM - उत्पादन सर्विंग
अंतिम अपडेट
क्या यह उपयोगी था?