For the complete documentation index, see llms.txt. This page is also available as Markdown.

Text Generation WebUI

Clore.ai GPUs पर LLM इन्फ़रेंस के लिए text-generation-webui चलाएँ

सभी मॉडल प्रारूपों के समर्थन के साथ सबसे लोकप्रिय LLM इंटरफ़ेस चलाएँ।

CLORE.AI पर किराए पर लेना

  1. विज़िट करें CLORE.AI मार्केटप्लेस

  2. GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें

  3. चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)

  4. अपना ऑर्डर कॉन्फ़िगर करें:

    • Docker इमेज चुनें

    • पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)

    • यदि आवश्यक हो तो environment variables जोड़ें

    • स्टार्टअप कमांड दर्ज करें

  5. भुगतान चुनें: CLORE, BTCया USDT/USDC

  6. ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें

अपने सर्वर तक पहुँचें

  • कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर

  • वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें

  • SSH: ssh -p <port> root@<proxy-address>

Text Generation WebUI क्यों?

  • GGUF, GPTQ, AWQ, EXL2, HF प्रारूपों का समर्थन करता है

  • अंतर्निर्मित चैट, नोटबुक और API मोड

  • एक्सटेंशन: आवाज़, पात्र, मल्टीमॉडल

  • फाइन-ट्यूनिंग समर्थन

  • चलते-चलते मॉडल स्विच करना

आवश्यकताएँ

मॉडल आकार
न्यूनतम VRAM
अनुशंसित

7B (Q4)

6GB

RTX 3060

13B (Q4)

10GB

RTX 3080

30B (Q4)

20GB

RTX 4090

70B (Q4)

40GB

A100

त्वरित डिप्लॉय

Docker इमेज:

पोर्ट:

पर्यावरण:

मैन्युअल इंस्टॉलेशन

इमेज:

पोर्ट:

कमांड:

अपनी सेवा तक पहुँचना

डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:

  1. पर जाएँ मेरे ऑर्डर पेज

  2. अपने ऑर्डर पर क्लिक करें

  3. खोजें http_pub URL (उदा., abc123.clorecloud.net)

उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।

WebUI तक पहुंचें

  1. तैनाती के लिए प्रतीक्षा करें

  2. में पोर्ट 7860 मैपिंग खोजें मेरे ऑर्डर

  3. खोलें: http://<proxy>:<port>

मॉडल डाउनलोड करें

HuggingFace से (WebUI में)

  1. पर जाएँ मॉडल टैब

  2. मॉडल का नाम दर्ज करें: bartowski/Meta-Llama-3.1-8B-Instruct-GGUF

  3. क्लिक करें डाउनलोड करें

कमांड लाइन के माध्यम से

अनुशंसित मॉडल

चैट के लिए:

कोडिंग के लिए:

रोलप्ले के लिए:

मॉडल लोड करना

GGUF (अधिकांश उपयोगकर्ताओं के लिए अनुशंसित)

  1. मॉडल टैब → मॉडल फ़ोल्डर चुनें

  2. मॉडल लोडर: llama.cpp

  3. सेट करें n-gpu-layers:

    • RTX 3090: 35-40

    • RTX 4090: 45-50

    • A100: 80+

  4. क्लिक करें लोड करें

GPTQ (तेज़, क्वांटाइज़्ड)

  1. GPTQ मॉडल डाउनलोड करें

  2. मॉडल लोडर: ExLlama_HF या AutoGPTQ

  3. मॉडल लोड करें

EXL2 (सर्वश्रेष्ठ गति)

  1. EXL2 मॉडल डाउनलोड करें

  2. मॉडल लोडर: ExLlamav2_HF

  3. लोड करें

चैट कॉन्फ़िगरेशन

पात्र सेटअप

  1. पर जाएँ पैरामीटरपात्र

  2. पात्र कार्ड बनाएँ या लोड करें

  3. सेट करें:

    • नाम

    • संदर्भ/व्यक्तित्व

    • उदाहरण संवाद

इंस्ट्रक्ट मोड

निर्देश-ट्यून किए गए मॉडलों के लिए:

  1. पैरामीटरनिर्देश टेम्पलेट

  2. अपने मॉडल से मेल खाने वाला टेम्पलेट चुनें:

    • Llama-2-chat

    • Mistral

    • ChatML

    • Alpaca

API उपयोग

API सक्षम करें

से शुरू करें --api फ़्लैग (डिफ़ॉल्ट पोर्ट 5000)

OpenAI-संगत API

नेटिव API

एक्सटेंशन

एक्सटेंशन इंस्टॉल करना

एक्सटेंशन सक्षम करें

  1. सेशन टैब → एक्सटेंशन

  2. वांछित एक्सटेंशनों के लिए बॉक्स चेक करें

  3. क्लिक करें लागू करें और पुनः प्रारंभ करें

लोकप्रिय एक्सटेंशन

एक्सटेंशन
उद्देश्य

silero_tts

आवाज़ आउटपुट

whisper_stt

आवाज़ इनपुट

superbooga

दस्तावेज़ Q&A

sd_api_pictures

छवि निर्माण

मल्टीमॉडल

छवि समझ

प्रदर्शन ट्यूनिंग

GGUF सेटिंग्स

मेमोरी अनुकूलन

सीमित VRAM के लिए:

गति अनुकूलन

फाइन-ट्यूनिंग (LoRA)

ट्रेनिंग टैब

  1. पर जाएँ ट्रेनिंग टैब

  2. बेस मॉडल लोड करें

  3. डेटासेट अपलोड करें (JSON प्रारूप)

  4. कॉन्फ़िगर करें:

    • LoRA रैंक: 8-32

    • लर्निंग रेट: 1e-4

    • एपोक्स: 3-5

  5. प्रशिक्षण शुरू करें

डेटासेट प्रारूप

अपना काम सहेजना

समस्या निवारण

मॉडल लोड नहीं होगा

  • VRAM उपयोग जाँचें: nvidia-smi

  • कम करें n_gpu_layers

  • छोटा क्वांटाइज़ेशन उपयोग करें (Q4_K_M → Q4_K_S)

धीमी जनरेशन

  • बढ़ाएँ n_gpu_layers

  • GGUF के बजाय EXL2 का उपयोग करें

  • सक्रिय करें --no-mmap

जनरेशन के दौरान - `n_ctx` (संदर्भ लंबाई) कम करें - केवल CPU के लिए `--n-gpu-layers 0` का उपयोग करें - छोटा मॉडल आज़माएँ

लागत का अनुमान

CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):

GPU
प्रति घंटा दर
प्रति दिन दर
4-घंटे का सत्र

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।

पैसे बचाएँ:

  • का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं

  • से भुगतान करें CLORE टोकन

  • विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें

अंतिम अपडेट

क्या यह उपयोगी था?