Stable Diffusion 3.5
Clore.ai GPUs पर Stable Diffusion 3.5 का उपयोग करके सटीक टेक्स्ट रेंडरिंग के साथ उच्च-निष्ठा छवियाँ जनरेट करें।
Stability AI का Stable Diffusion 3.5 एक मल्टीमॉडल डिफ्यूज़न ट्रांसफ़ॉर्मर (MMDiT) है, जो ओपन-वेट इमेज जेनरेशन के लिए एक नया मानक स्थापित करता है। यह तीन वेरिएंट्स में आता है: लार्ज (8B पैरामीटर), मध्यम (2.5B पैरामीटर), और लार्ज टर्बो (8B, 4-स्टेप इनफ़ेरेंस के लिए डिस्टिल्ड)। इसकी सबसे खास विशेषता है इसका सटीक टेक्स्ट रेंडरिंग — SD 3.5 जनरेट की गई छवियों के भीतर पढ़ने योग्य टेक्स्ट को भरोसेमंद ढंग से रख सकता है, ऐसी क्षमता जिसमें अधिकांश पुराने मॉडल संघर्ष करते हैं।
पर Clore.ai आप SD 3.5 को जितनी कम $0.05/घंटा लागत में आवश्यक GPU पावर किराए पर लेकर प्रति घंटे सैकड़ों छवियाँ जनरेट कर सकते हैं।
मुख्य विशेषताएँ
तीन वेरिएंट्स — लार्ज (8B, सर्वोच्च गुणवत्ता), मीडियम (2.5B, तेज़ और हल्का), लार्ज टर्बो (8B, 4-स्टेप डिस्टिल्ड)।
सटीक टेक्स्ट रेंडरिंग — छवियों के भीतर पढ़ने योग्य टेक्स्ट, साइन, लेबल और टाइपोग्राफी जनरेट करता है।
MMDiT आर्किटेक्चर — उत्कृष्ट प्रॉम्प्ट पालन के लिए संयुक्त इमेज-टेक्स्ट अटेंशन।
1024×1024 मूल रेज़ोल्यूशन — अपस्केलिंग हैक्स के बिना साफ़ आउटपुट।
लचीले आस्पेक्ट रेशियो — गुणवत्ता खोए बिना गैर-वर्गाकार आउटपुट (768×1344, 1344×768, आदि) को संभालता है।
नेटिव diffusers सपोर्ट —
StableDiffusion3Pipelineमेंdiffusers >= 0.30.ओपन वेट्स — Stability AI कम्युनिटी लाइसेंस; अधिकांश व्यावसायिक उपयोग के लिए मुफ़्त।
आवश्यकताएँ
GPU VRAM
12 GB (मीडियम)
24 GB (लार्ज / टर्बो)
System RAM
16 GB
32 GB
डिस्क
20 GB
40 GB
Python
3.10+
3.11
CUDA
12.8+
12.8+
diffusers
0.30+
नवीनतम
Clore.ai GPU अनुशंसा: एक RTX 4090 (24 GB, $0.14–0.42/घंटा) तीनों वेरिएंट्स को पूरी गति से चलाता है। मीडियम मॉडल के लिए, एक RTX 3090 (24 GB, $0.07–0.21/घंटा) या यहाँ तक कि 16 GB कार्ड भी पर्याप्त और सस्ता है।
त्वरित शुरुआत
उपयोग के उदाहरण
SD 3.5 लार्ज — अधिकतम गुणवत्ता
SD 3.5 लार्ज टर्बो — 4-स्टेप तेज़ जनरेशन
SD 3.5 मीडियम — हल्का विकल्प
अलग-अलग आस्पेक्ट रेशियो के साथ बैच जनरेशन
Clore.ai उपयोगकर्ताओं के लिए सुझाव
इटरेशन के लिए टर्बो, फाइनल्स के लिए लार्ज — प्रॉम्प्ट आइडियाज़ को जल्दी से एक्सप्लोर करने के लिए 4-स्टेप टर्बो वेरिएंट का उपयोग करें, फिर अंतिम रेंडर के लिए लार्ज (28 स्टेप्स) पर स्विच करें।
guidance_scale=3.5 — SD 3.5 लार्ज पुराने Stable Diffusion मॉडलों की तुलना में कम CFG पर सबसे अच्छा काम करता है। 5.0 से ऊपर जाने पर अक्सर अत्यधिक सैचुरेशन होता है।
टर्बो को guidance_scale=0 चाहिए — डिस्टिल्ड मॉडल में guidance पहले से ही शामिल होता है; और जोड़ने से आउटपुट खराब होता है।
छवियों में टेक्स्ट — SD 3.5 का टेक्स्ट रेंडरिंग मज़बूत है, लेकिन परिपूर्ण नहीं। जिस सटीक टेक्स्ट को आप चाहते हैं, उसे कोट्स में रखें:
'24 घंटे खुला'. इसे छोटा रखें (अधिकतम 3–5 शब्द)।वज़न कैश करें — सेट करें
HF_HOME=/workspace/hf_cacheपर्सिस्टेंट स्टोरेज पर। लार्ज डिस्क पर लगभग 16 GB है।लार्ज के लिए bf16, मीडियम के लिए fp16 — 8B मॉडल bf16 में प्रशिक्षित किए गए थे; 2.5B मीडियम fp16 में ठीक चलता है।
बैच को कुशलता से चलाएँ — SD 3.5 लार्ज RTX 4090 पर लगभग 3 सेकंड में एक 1024×1024 छवि जनरेट करता है। बड़े पैमाने की जनरेशन के लिए रात भर बैच चलाएँ।
HF लाइसेंस स्वीकार करें — डाउनलोड करने से पहले आपको HuggingFace मॉडल पेज पर मॉडल लाइसेंस स्वीकार करना होगा। इसके साथ लॉग इन करें
huggingface-cli login.
समस्या निवारण
OutOfMemoryError लार्ज के साथ
उपयोग करें pipe.enable_model_cpu_offload(); या मीडियम वेरिएंट पर स्विच करें
छवि में गड़बड़ टेक्स्ट
टेक्स्ट छोटा रखें (3–5 शब्द); इसे प्रॉम्प्ट में कोट्स में रखें; बढ़ाएँ num_inference_steps को 35
अत्यधिक सैचुरेटेड रंग
कम करें guidance_scale — लार्ज के लिए 2.5–3.5 आज़माएँ; टर्बो के लिए 0.0 का उपयोग करें
मॉडल डाउनलोड करते समय 403 त्रुटि
लाइसेंस स्वीकार करें https://huggingface.co/stabilityai/stable-diffusion-3.5-large और चलाएँ huggingface-cli login
धीमी पहली रन
प्रारंभिक डाउनलोड लार्ज के लिए लगभग 16 GB है; बाद के रन कैश का उपयोग करते हैं
KeyError: 'text_encoder_3'
diffusers अपग्रेड करें: pip install -U diffusers transformers
काली छवि आउटपुट
सुनिश्चित करें torch_dtype=torch.bfloat16 लार्ज/टर्बो के लिए; fp32 कुछ कार्ड्स पर चुपचाप विफल हो सकता है
अंतिम अपडेट
क्या यह उपयोगी था?