For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence-2

कैप्शनिंग, डिटेक्शन, और सेगमेंटेशन के लिए Microsoft Florence-2

कैप्शनिंग, डिटेक्शन, सेगमेंटेशन और अन्य के लिए Microsoft का शक्तिशाली विज़न मॉडल।

इस गाइड के सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया हो CLORE.AI मार्केटप्लेस मार्केटप्लेस।

CLORE.AI पर किराए पर लेना

  1. विज़िट करें CLORE.AI मार्केटप्लेस

  2. GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें

  3. चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)

  4. अपना ऑर्डर कॉन्फ़िगर करें:

    • Docker इमेज चुनें

    • पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)

    • यदि आवश्यक हो तो environment variables जोड़ें

    • स्टार्टअप कमांड दर्ज करें

  5. भुगतान चुनें: CLORE, BTCया USDT/USDC

  6. ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें

अपने सर्वर तक पहुँचें

  • कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर

  • वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें

  • SSH: ssh -p <port> root@<proxy-address>

Florence-2 क्या है?

Microsoft का Florence-2 एक विज़न फाउंडेशन मॉडल है जो संभालता है:

  • छवि कैप्शनिंग (संक्षिप्त और विस्तृत)

  • ऑब्जेक्ट डिटेक्शन और स्थानीयकरण

  • घने क्षेत्र की कैप्शनिंग

  • संदर्भित अभिव्यक्ति की समझ

  • OCR और पाठ पहचान

  • दृश्य प्रश्नोत्तर

संसाधन

अनुशंसित हार्डवेयर

घटक
न्यूनतम
अनुशंसित
इष्टतम

GPU

RTX 3060 12GB

RTX 4080 16GB

RTX 4090 24GB

VRAM

8GB

12GB

16GB

CPU

4 कोर

8 कोर

16 कोर

RAM

16GB

32GB

64GB

स्टोरेज

30GB SSD

50GB NVMe

100GB NVMe

इंटरनेट

100 Mbps

500 Mbps

1 Gbps

CLORE.AI पर त्वरित परिनियोजन

Docker इमेज:

पोर्ट:

कमांड:

अपनी सेवा तक पहुँचना

डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:

  1. पर जाएँ मेरे ऑर्डर पेज

  2. अपने ऑर्डर पर क्लिक करें

  3. खोजें http_pub URL (उदा., abc123.clorecloud.net)

उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।

इंस्टॉलेशन

आप क्या बना सकते हैं

सामग्री विश्लेषण

  • छवि विवरण स्वतः जनरेट करें

  • छवियों से पाठ निकालें (OCR)

  • बड़े पैमाने पर दृश्य सामग्री का विश्लेषण करें

डेटा एनोटेशन

  • कैप्शन के साथ डेटासेट को स्वतः लेबल करें

  • ऑब्जेक्ट्स के लिए बाउंडिंग बॉक्स जनरेट करें

  • घने एनोटेशन बनाएँ

सुलभता

  • छवियों के लिए alt-text जनरेट करें

  • दृष्टिबाधित लोगों के लिए छवियों का वर्णन करें

  • ऑडियो विवरण बनाएँ

खोज और खोजबीन

  • सामग्री के आधार पर छवियों को इंडेक्स करें

  • विज़ुअल सर्च सिस्टम बनाएँ

  • सामग्री मॉडरेशन

दस्तावेज़ प्रसंस्करण

  • दस्तावेज़ों से पाठ निकालें

  • चार्ट और आरेख समझें

  • स्कैन की गई सामग्री को प्रोसेस करें

मूल उपयोग

छवि कैप्शनिंग

ऑब्जेक्ट डिटेक्शन

OCR (पाठ पहचान)

घने क्षेत्र की कैप्शनिंग

संदर्भित अभिव्यक्ति की समझ

पाठ विवरणों के आधार पर ऑब्जेक्ट्स खोजें:

सभी उपलब्ध कार्य

बैच प्रोसेसिंग

Gradio इंटरफ़ेस

प्रदर्शन

कार्य
रिज़ॉल्यूशन
GPU
गति

कैप्शन

768x768

RTX 3090

200ms

कैप्शन

768x768

RTX 4090

120ms

ऑब्जेक्ट डिटेक्शन

768x768

RTX 4090

150ms

OCR

768x768

RTX 4090

180ms

घना कैप्शन

768x768

A100

100ms

मॉडल वेरिएंट

मॉडल
पैरामीटर
VRAM
गति

Florence-2-base

232M

4GB

तेज़

Florence-2-large

771M

8GB

मध्यम

Florence-2-base-ft

232M

4GB

तेज़

Florence-2-large-ft

771M

8GB

मध्यम

सामान्य समस्याएँ और समाधान

मेमोरी समाप्त

समस्या: CUDA OOM त्रुटि

समाधान:

धीमी inference

समस्या: प्रसंस्करण में बहुत समय लग रहा है

समाधान:

  • तेज़ inference के लिए Florence-2-base का उपयोग करें

  • गति बढ़ाने के लिए flash-attention इंस्टॉल करें

  • कई छवियों को एक साथ बैच करें

  • प्रोडक्शन के लिए A100 GPU का उपयोग करें

OCR के खराब परिणाम

समस्या: पाठ पहचान सटीक नहीं है

समाधान:

  • सुनिश्चित करें कि छवि उच्च रेज़ोल्यूशन की हो (कम से कम 768px)

  • उपयोग करें <OCR_WITH_REGION> बेहतर स्थानीयकरण के लिए

  • पूर्व-प्रसंस्करण: कंट्रास्ट बढ़ाएँ, छवि को डेस्क्यू करें

  • OCR से पहले पाठ क्षेत्रों में क्रॉप करें

डिटेक्शन में ऑब्जेक्ट्स छूट रहे हैं

समस्या: ऑब्जेक्ट्स का पता नहीं चला

समाधान:

  • उपयोग करें <DENSE_REGION_CAPTION> अधिक क्षेत्रों के लिए

  • कोशिश करें <OPEN_VOCABULARY_DETECTION> विशिष्ट लेबलों के साथ

  • विशिष्ट ऑब्जेक्ट्स के लिए GroundingDINO के साथ संयोजन करें

समस्या निवारण

कार्य काम नहीं कर रहा है

  • सटीक task name syntax जाँचें

  • कुछ कार्यों को विशिष्ट इनपुट फ़ॉर्मेट चाहिए

  • सत्यापित करें कि मॉडल संस्करण कार्य से मेल खाता है

आउटपुट फ़ॉर्मेट अप्रत्याशित है

  • अलग-अलग कार्य अलग-अलग फ़ॉर्मेट लौटाते हैं

  • कार्य प्रकार के अनुसार आउटपुट को पार्स करें

  • कार्य आउटपुट के लिए दस्तावेज़ देखें

CUDA मेमोरी समस्याएँ

  • Florence-2-large को लगभग 8GB VRAM चाहिए

  • कम मेमोरी के लिए Florence-2-base का उपयोग करें

  • gradient checkpointing सक्षम करें

धीमी प्रोसेसिंग

  • जब संभव हो batch inference का उपयोग करें

  • FP16 मोड सक्षम करें

  • TensorRT ऑप्टिमाइज़ेशन पर विचार करें

लागत का अनुमान

CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):

GPU
प्रति घंटा दर
प्रति दिन दर
4-घंटे का सत्र

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।

पैसे बचाएँ:

  • का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं

  • से भुगतान करें CLORE टोकन

  • विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें

अगले चरण

  • LLaVA - विज़न चैट और QA

  • GroundingDINO - ज़ीरो-शॉट डिटेक्शन

  • SAM2 - पता लगाए गए ऑब्जेक्ट्स को सेगमेंट करें

अंतिम अपडेट

क्या यह उपयोगी था?