Text Generation WebUI
Clore.ai GPUs पर LLM इन्फ़रेंस के लिए text-generation-webui चलाएँ
सभी मॉडल प्रारूपों के समर्थन के साथ सबसे लोकप्रिय LLM इंटरफ़ेस चलाएँ।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
CLORE.AI पर किराए पर लेना
विज़िट करें CLORE.AI मार्केटप्लेस
GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें
चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)
अपना ऑर्डर कॉन्फ़िगर करें:
Docker इमेज चुनें
पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)
यदि आवश्यक हो तो environment variables जोड़ें
स्टार्टअप कमांड दर्ज करें
भुगतान चुनें: CLORE, BTCया USDT/USDC
ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें
अपने सर्वर तक पहुँचें
कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर
वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें
SSH:
ssh -p <port> root@<proxy-address>
Text Generation WebUI क्यों?
GGUF, GPTQ, AWQ, EXL2, HF प्रारूपों का समर्थन करता है
अंतर्निर्मित चैट, नोटबुक और API मोड
एक्सटेंशन: आवाज़, पात्र, मल्टीमॉडल
फाइन-ट्यूनिंग समर्थन
चलते-चलते मॉडल स्विच करना
आवश्यकताएँ
7B (Q4)
6GB
RTX 3060
13B (Q4)
10GB
RTX 3080
30B (Q4)
20GB
RTX 4090
70B (Q4)
40GB
A100
त्वरित डिप्लॉय
Docker इमेज:
पोर्ट:
पर्यावरण:
मैन्युअल इंस्टॉलेशन
इमेज:
पोर्ट:
कमांड:
अपनी सेवा तक पहुँचना
डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:
पर जाएँ मेरे ऑर्डर पेज
अपने ऑर्डर पर क्लिक करें
खोजें
http_pubURL (उदा.,abc123.clorecloud.net)
उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।
WebUI तक पहुंचें
तैनाती के लिए प्रतीक्षा करें
में पोर्ट 7860 मैपिंग खोजें मेरे ऑर्डर
खोलें:
http://<proxy>:<port>
मॉडल डाउनलोड करें
HuggingFace से (WebUI में)
पर जाएँ मॉडल टैब
मॉडल का नाम दर्ज करें:
bartowski/Meta-Llama-3.1-8B-Instruct-GGUFक्लिक करें डाउनलोड करें
कमांड लाइन के माध्यम से
अनुशंसित मॉडल
चैट के लिए:
कोडिंग के लिए:
रोलप्ले के लिए:
मॉडल लोड करना
GGUF (अधिकांश उपयोगकर्ताओं के लिए अनुशंसित)
मॉडल टैब → मॉडल फ़ोल्डर चुनें
मॉडल लोडर: llama.cpp
सेट करें n-gpu-layers:
RTX 3090: 35-40
RTX 4090: 45-50
A100: 80+
क्लिक करें लोड करें
GPTQ (तेज़, क्वांटाइज़्ड)
GPTQ मॉडल डाउनलोड करें
मॉडल लोडर: ExLlama_HF या AutoGPTQ
मॉडल लोड करें
EXL2 (सर्वश्रेष्ठ गति)
EXL2 मॉडल डाउनलोड करें
मॉडल लोडर: ExLlamav2_HF
लोड करें
चैट कॉन्फ़िगरेशन
पात्र सेटअप
पर जाएँ पैरामीटर → पात्र
पात्र कार्ड बनाएँ या लोड करें
सेट करें:
नाम
संदर्भ/व्यक्तित्व
उदाहरण संवाद
इंस्ट्रक्ट मोड
निर्देश-ट्यून किए गए मॉडलों के लिए:
पैरामीटर → निर्देश टेम्पलेट
अपने मॉडल से मेल खाने वाला टेम्पलेट चुनें:
Llama-2-chat
Mistral
ChatML
Alpaca
API उपयोग
API सक्षम करें
से शुरू करें --api फ़्लैग (डिफ़ॉल्ट पोर्ट 5000)
OpenAI-संगत API
नेटिव API
एक्सटेंशन
एक्सटेंशन इंस्टॉल करना
एक्सटेंशन सक्षम करें
सेशन टैब → एक्सटेंशन
वांछित एक्सटेंशनों के लिए बॉक्स चेक करें
क्लिक करें लागू करें और पुनः प्रारंभ करें
लोकप्रिय एक्सटेंशन
silero_tts
आवाज़ आउटपुट
whisper_stt
आवाज़ इनपुट
superbooga
दस्तावेज़ Q&A
sd_api_pictures
छवि निर्माण
मल्टीमॉडल
छवि समझ
प्रदर्शन ट्यूनिंग
GGUF सेटिंग्स
मेमोरी अनुकूलन
सीमित VRAM के लिए:
गति अनुकूलन
फाइन-ट्यूनिंग (LoRA)
ट्रेनिंग टैब
पर जाएँ ट्रेनिंग टैब
बेस मॉडल लोड करें
डेटासेट अपलोड करें (JSON प्रारूप)
कॉन्फ़िगर करें:
LoRA रैंक: 8-32
लर्निंग रेट: 1e-4
एपोक्स: 3-5
प्रशिक्षण शुरू करें
डेटासेट प्रारूप
अपना काम सहेजना
समस्या निवारण
मॉडल लोड नहीं होगा
VRAM उपयोग जाँचें:
nvidia-smiकम करें
n_gpu_layersछोटा क्वांटाइज़ेशन उपयोग करें (Q4_K_M → Q4_K_S)
धीमी जनरेशन
बढ़ाएँ
n_gpu_layersGGUF के बजाय EXL2 का उपयोग करें
सक्रिय करें
--no-mmap
मेमोरी समाप्त
जनरेशन के दौरान - `n_ctx` (संदर्भ लंबाई) कम करें - केवल CPU के लिए `--n-gpu-layers 0` का उपयोग करें - छोटा मॉडल आज़माएँ
लागत का अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।
पैसे बचाएँ:
का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं
से भुगतान करें CLORE टोकन
विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें
अंतिम अपडेट
क्या यह उपयोगी था?