Florence-2
कैप्शनिंग, डिटेक्शन, और सेगमेंटेशन के लिए Microsoft Florence-2
कैप्शनिंग, डिटेक्शन, सेगमेंटेशन और अन्य के लिए Microsoft का शक्तिशाली विज़न मॉडल।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
CLORE.AI पर किराए पर लेना
विज़िट करें CLORE.AI मार्केटप्लेस
GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें
चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)
अपना ऑर्डर कॉन्फ़िगर करें:
Docker इमेज चुनें
पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)
यदि आवश्यक हो तो environment variables जोड़ें
स्टार्टअप कमांड दर्ज करें
भुगतान चुनें: CLORE, BTCया USDT/USDC
ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें
अपने सर्वर तक पहुँचें
कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर
वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें
SSH:
ssh -p <port> root@<proxy-address>
Florence-2 क्या है?
Microsoft का Florence-2 एक विज़न फाउंडेशन मॉडल है जो संभालता है:
छवि कैप्शनिंग (संक्षिप्त और विस्तृत)
ऑब्जेक्ट डिटेक्शन और स्थानीयकरण
घने क्षेत्र की कैप्शनिंग
संदर्भित अभिव्यक्ति की समझ
OCR और पाठ पहचान
दृश्य प्रश्नोत्तर
संसाधन
HuggingFace: microsoft/Florence-2-large
पेपर: Florence-2 पेपर
GitHub: microsoft/Florence-2
डेमो: HuggingFace Space
अनुशंसित हार्डवेयर
GPU
RTX 3060 12GB
RTX 4080 16GB
RTX 4090 24GB
VRAM
8GB
12GB
16GB
CPU
4 कोर
8 कोर
16 कोर
RAM
16GB
32GB
64GB
स्टोरेज
30GB SSD
50GB NVMe
100GB NVMe
इंटरनेट
100 Mbps
500 Mbps
1 Gbps
CLORE.AI पर त्वरित परिनियोजन
Docker इमेज:
पोर्ट:
कमांड:
अपनी सेवा तक पहुँचना
डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:
पर जाएँ मेरे ऑर्डर पेज
अपने ऑर्डर पर क्लिक करें
खोजें
http_pubURL (उदा.,abc123.clorecloud.net)
उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।
इंस्टॉलेशन
आप क्या बना सकते हैं
सामग्री विश्लेषण
छवि विवरण स्वतः जनरेट करें
छवियों से पाठ निकालें (OCR)
बड़े पैमाने पर दृश्य सामग्री का विश्लेषण करें
डेटा एनोटेशन
कैप्शन के साथ डेटासेट को स्वतः लेबल करें
ऑब्जेक्ट्स के लिए बाउंडिंग बॉक्स जनरेट करें
घने एनोटेशन बनाएँ
सुलभता
छवियों के लिए alt-text जनरेट करें
दृष्टिबाधित लोगों के लिए छवियों का वर्णन करें
ऑडियो विवरण बनाएँ
खोज और खोजबीन
सामग्री के आधार पर छवियों को इंडेक्स करें
विज़ुअल सर्च सिस्टम बनाएँ
सामग्री मॉडरेशन
दस्तावेज़ प्रसंस्करण
दस्तावेज़ों से पाठ निकालें
चार्ट और आरेख समझें
स्कैन की गई सामग्री को प्रोसेस करें
मूल उपयोग
छवि कैप्शनिंग
ऑब्जेक्ट डिटेक्शन
OCR (पाठ पहचान)
घने क्षेत्र की कैप्शनिंग
संदर्भित अभिव्यक्ति की समझ
पाठ विवरणों के आधार पर ऑब्जेक्ट्स खोजें:
सभी उपलब्ध कार्य
बैच प्रोसेसिंग
Gradio इंटरफ़ेस
प्रदर्शन
कैप्शन
768x768
RTX 3090
200ms
कैप्शन
768x768
RTX 4090
120ms
ऑब्जेक्ट डिटेक्शन
768x768
RTX 4090
150ms
OCR
768x768
RTX 4090
180ms
घना कैप्शन
768x768
A100
100ms
मॉडल वेरिएंट
Florence-2-base
232M
4GB
तेज़
Florence-2-large
771M
8GB
मध्यम
Florence-2-base-ft
232M
4GB
तेज़
Florence-2-large-ft
771M
8GB
मध्यम
सामान्य समस्याएँ और समाधान
मेमोरी समाप्त
समस्या: CUDA OOM त्रुटि
समाधान:
धीमी inference
समस्या: प्रसंस्करण में बहुत समय लग रहा है
समाधान:
तेज़ inference के लिए Florence-2-base का उपयोग करें
गति बढ़ाने के लिए flash-attention इंस्टॉल करें
कई छवियों को एक साथ बैच करें
प्रोडक्शन के लिए A100 GPU का उपयोग करें
OCR के खराब परिणाम
समस्या: पाठ पहचान सटीक नहीं है
समाधान:
सुनिश्चित करें कि छवि उच्च रेज़ोल्यूशन की हो (कम से कम 768px)
उपयोग करें
<OCR_WITH_REGION>बेहतर स्थानीयकरण के लिएपूर्व-प्रसंस्करण: कंट्रास्ट बढ़ाएँ, छवि को डेस्क्यू करें
OCR से पहले पाठ क्षेत्रों में क्रॉप करें
डिटेक्शन में ऑब्जेक्ट्स छूट रहे हैं
समस्या: ऑब्जेक्ट्स का पता नहीं चला
समाधान:
उपयोग करें
<DENSE_REGION_CAPTION>अधिक क्षेत्रों के लिएकोशिश करें
<OPEN_VOCABULARY_DETECTION>विशिष्ट लेबलों के साथविशिष्ट ऑब्जेक्ट्स के लिए GroundingDINO के साथ संयोजन करें
समस्या निवारण
कार्य काम नहीं कर रहा है
सटीक task name syntax जाँचें
कुछ कार्यों को विशिष्ट इनपुट फ़ॉर्मेट चाहिए
सत्यापित करें कि मॉडल संस्करण कार्य से मेल खाता है
आउटपुट फ़ॉर्मेट अप्रत्याशित है
अलग-अलग कार्य अलग-अलग फ़ॉर्मेट लौटाते हैं
कार्य प्रकार के अनुसार आउटपुट को पार्स करें
कार्य आउटपुट के लिए दस्तावेज़ देखें
CUDA मेमोरी समस्याएँ
Florence-2-large को लगभग 8GB VRAM चाहिए
कम मेमोरी के लिए Florence-2-base का उपयोग करें
gradient checkpointing सक्षम करें
धीमी प्रोसेसिंग
जब संभव हो batch inference का उपयोग करें
FP16 मोड सक्षम करें
TensorRT ऑप्टिमाइज़ेशन पर विचार करें
लागत का अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।
पैसे बचाएँ:
का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं
से भुगतान करें CLORE टोकन
विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें
अगले चरण
LLaVA - विज़न चैट और QA
GroundingDINO - ज़ीरो-शॉट डिटेक्शन
SAM2 - पता लगाए गए ऑब्जेक्ट्स को सेगमेंट करें
अंतिम अपडेट
क्या यह उपयोगी था?