For the complete documentation index, see llms.txt. This page is also available as Markdown.

Llama 3.2 Vision

Clore.ai पर इमेज समझने के लिए Meta का Llama 3.2 Vision चलाएँ

छवि समझ के लिए CLORE.AI GPUs पर Meta के मल्टीमोडल Llama 3.2 Vision मॉडल चलाएँ।

Llama 3.2 Vision क्यों?

  • मल्टीमोडल - टेक्स्ट और छवियों दोनों को समझता है

  • कई आकार - 11B और 90B पैरामीटर संस्करण

  • बहुउपयोगी - OCR, विज़ुअल QA, छवि कैप्शनिंग, दस्तावेज़ विश्लेषण

  • ओपन वेट्स - Meta का पूर्णतः ओपन सोर्स

  • Llama इकोसिस्टम - Ollama, vLLM, transformers के साथ संगत

मॉडल वेरिएंट

मॉडल
पैरामीटर
VRAM (FP16)
संदर्भ
किसके लिए सर्वोत्तम

Llama-3.2-11B-Vision

11B

24GB

128K

सामान्य उपयोग, एकल GPU

Llama-3.2-90B-Vision

90B

180GB

128K

अधिकतम गुणवत्ता

Llama-3.2-11B-Vision-Instruct

11B

24GB

128K

चैट/सहायक

Llama-3.2-90B-Vision-Instruct

90B

180GB

128K

प्रोडक्शन

CLORE.AI पर त्वरित परिनियोजन

Docker इमेज:

पोर्ट:

कमांड:

अपनी सेवा तक पहुँचना

डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:

  1. पर जाएँ मेरे ऑर्डर पेज

  2. अपने ऑर्डर पर क्लिक करें

  3. खोजें http_pub URL (उदा., abc123.clorecloud.net)

उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।

हार्डवेयर आवश्यकताएँ

मॉडल
न्यूनतम GPU
अनुशंसित
इष्टतम

11B विज़न

RTX 4090 24GB

A100 40GB

A100 80GB

90B विज़न

4x A100 40GB

4x A100 80GB

8x H100

इंस्टॉलेशन

Ollama का उपयोग करके (सबसे आसान)

vLLM का उपयोग करके

Transformers का उपयोग

मूल उपयोग

छवि समझ

Ollama के साथ

vLLM API के साथ

उपयोग के मामले

OCR / पाठ निष्कर्षण

दस्तावेज़ विश्लेषण

विज़ुअल प्रश्नोत्तर

छवि कैप्शनिंग

स्क्रीनशॉट से कोड

एकाधिक छवियाँ

बैच प्रोसेसिंग

Gradio इंटरफ़ेस

प्रदर्शन

कार्य
मॉडल
GPU
समय

एकल छवि विवरण

11B

RTX 4090

~3s

एकल छवि विवरण

11B

A100 40GB

~2s

OCR (1 पृष्ठ)

11B

RTX 4090

~5 सेकंड

दस्तावेज़ विश्लेषण

11B

A100 40GB

~8s

बैच (10 छवियाँ)

11B

A100 40GB

~25 सेकंड

क्वांटाइज़ेशन

bitsandbytes के साथ 4-बिट

Ollama के साथ GGUF

लागत का अनुमान

CLORE.AI मार्केटप्लेस की सामान्य दरें:

GPU
प्रति घंटा दर
किसके लिए सर्वोत्तम

RTX 4090 24GB

~$0.10

11B मॉडल

A100 40GB

~$0.17

लंबे संदर्भ के साथ 11B

A100 80GB

~$0.25

11B सर्वोत्तम

4x A100 80GB

~$1.00

90B मॉडल

कीमतें अलग-अलग होती हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।

पैसे बचाएँ:

  • उपयोग करें स्पॉट बैच प्रोसेसिंग के लिए आदेश

  • से भुगतान करें CLORE टोकन

  • विकास के लिए क्वांटाइज़्ड मॉडल (4-बिट) का उपयोग करें

समस्या निवारण

मेमोरी समाप्त

धीमी जनरेशन

  • सुनिश्चित करें कि GPU का उपयोग हो रहा है (जांचें nvidia-smi)

  • float32 के बजाय bfloat16 का उपयोग करें

  • प्रसंस्करण से पहले छवि का रिज़ॉल्यूशन कम करें

  • बेहतर थ्रूपुट के लिए vLLM का उपयोग करें

छवि लोड नहीं हो रही

HuggingFace टोकन आवश्यक

Llama Vision बनाम अन्य

विशेषता
Llama 3.2 Vision
LLaVA 1.6
GPT-4V

पैरामीटर

11B / 90B

7B / 34B

अज्ञात

ओपन सोर्स

हाँ

हाँ

नहीं

OCR गुणवत्ता

उत्कृष्ट

अच्छा

उत्कृष्ट

संदर्भ

128K

32K

128K

बहु-छवि

हाँ

सीमित

हाँ

लाइसेंस

Llama 3.2

Apache 2.0

स्वामित्वाधीन

Llama 3.2 Vision का उपयोग करें जब:

  • ओपन-सोर्स मल्टीमोडल की आवश्यकता हो

  • OCR और दस्तावेज़ विश्लेषण

  • Llama इकोसिस्टम के साथ एकीकरण

  • लंबे संदर्भ की समझ

अगले चरण

  • LLaVA - वैकल्पिक विज़न मॉडल

  • Florence-2 - Microsoft का विज़न मॉडल

  • Ollama - आसान परिनियोजन

  • vLLM - उत्पादन सर्विंग

अंतिम अपडेट

क्या यह उपयोगी था?