Open WebUI
Clore.ai GPUs पर LLM चलाने के लिए ChatGPT-जैसा इंटरफ़ेस
CLORE.AI GPU पर LLM चलाने के लिए ChatGPT जैसे सुंदर इंटरफ़ेस।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं जिन्हें द्वारा किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
Open WebUI क्यों?
ChatGPT जैसी UI - परिचित, परिष्कृत इंटरफ़ेस
मल्टी-मॉडल - मॉडलों के बीच आसानी से स्विच करें
RAG अंतर्निहित - संदर्भ के लिए दस्तावेज़ अपलोड करें
उपयोगकर्ता प्रबंधन - मल्टी-यूज़र समर्थन
इतिहास - बातचीत का स्थायित्व
Ollama एकीकरण - बॉक्स से काम करता है
CLORE.AI पर त्वरित डिप्लॉय
Docker इमेज:
ghcr.io/open-webui/open-webui:cudaपोर्ट:
22/tcp
8080/httpकमांड:
अपनी सेवा तक पहुँचना
डिप्लॉयमेंट के बाद, अपना खोजें http_pub URL में मेरे ऑर्डर:
जाएँ मेरे ऑर्डर पृष्ठ
अपने ऑर्डर पर क्लिक करें
खोजें
http_pubURL (उदा.,abc123.clorecloud.net)
उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए उदाहरणों में।
जांचें कि यह काम कर रहा है
प्रतिक्रिया:
यदि आपको HTTP 502 मिलता है, तो 1-2 मिनट प्रतीक्षा करें - सेवा अभी भी शुरू हो रही है।
इंस्टॉलेशन
Ollama के साथ (अनुशंसित)
ऑल-इन-वन (Bundled Ollama)
पहली सेटअप
खोलें
http://your-server:8080एडमिन खाता बनाएं (पहला उपयोगकर्ता एडमिन बन जाता है)
Settings → Models → Pull a model पर जाएँ
बातचीत शुरू करें!
विशेषताएँ
चैट इंटरफ़ेस
Markdown रेंडरिंग
कोड हाइलाइटिंग
इमेज जेनरेशन (समर्थित मॉडलों के साथ)
वॉइस इनपुट/आउटपुट
फ़ाइल अटैचमेंट
मॉडल प्रबंधन
UI से सीधे मॉडल खींचें
कस्टम मॉडल बनाएं
डिफ़ॉल्ट मॉडल सेट करें
मॉडल-विशिष्ट सेटिंग्स
RAG (डॉक्यूमेंट चैट)
चैट में "+" पर क्लिक करें
PDF, TXT, या अन्य दस्तावेज़ अपलोड करें
सामग्री के बारे में प्रश्न पूछें
उपयोगकर्ता प्रबंधन
कई उपयोगकर्ता
भूमिका-आधारित पहुंच
API कुंजी प्रबंधन
उपयोग ट्रैकिंग
कॉन्फ़िगरेशन
पर्यावरण चर
मुख्य सेटिंग्स
OLLAMA_BASE_URL
Ollama API URL
http://localhost:11434
WEBUI_AUTH
प्रमाणीकरण सक्षम करें
True
WEBUI_NAME
इंस्टेंस नाम
वेबUI खोलें
DEFAULT_MODELS
डिफ़ॉल्ट मॉडल
-
ENABLE_RAG_WEB_SEARCH
RAG में वेब खोज
False
रिमोट Ollama से कनेक्ट करें
Docker Compose
API संदर्भ
Open WebUI कई API endpoints प्रदान करता है:
/health
GET
हेल्थ जाँच
/api/version
GET
Open WebUI संस्करण प्राप्त करें
/api/config
GET
कॉन्फ़िगरेशन प्राप्त करें
/ollama/api/tags
GET
Ollama मॉडलों की सूची (प्रॉक्सी किया गया)
/ollama/api/chat
POST
Ollama के साथ चैट (प्रॉक्सी किया गया)
स्वास्थ्य जांच
प्रतिक्रिया: true
वर्ज़न प्राप्त करें
प्रतिक्रिया:
मॉडलों की सूची (Ollama प्रॉक्सी के माध्यम से)
टिप्स
तेज़ उत्तर
क्वांटाइज्ड मॉडल (Q4_K_M) का उपयोग करें
सेटिंग्स में स्ट्रीमिंग सक्षम करें
आवश्यक होने पर संदर्भ लंबाई कम करें
बेहतर गुणवत्ता
बड़े मॉडलों (13B+) का उपयोग करें
Q8 क्वांटाइज़ेशन का उपयोग करें
मॉडल सेटिंग्स में टेम्परेचर समायोजित करें
संसाधन बचाएँ
सेट करें
OLLAMA_KEEP_ALIVE=5mअनुपयोग किए गए मॉडलों को अनलोड करें
टेस्टिंग के लिए छोटे मॉडल इस्तेमाल करें
GPU आवश्यकताएँ
के समान Ollama.
Open WebUI स्वयं न्यूनतम संसाधन (~500MB RAM) का उपयोग करता है।
समस्याओं का निवारण
Ollama से कनेक्ट नहीं हो पा रहा
मॉडल दिखाई नहीं रहे
Settings में Ollama कनेक्शन की जाँच करें
मॉडल सूची रिफ्रेश करें
CLI के माध्यम से मॉडल खींचें:
ollama pull modelname
धीमा प्रदर्शन
जाँच करें कि GPU उपयोग हो रहा है:
nvidia-smiछोटे/क्वांटाइज्ड मॉडल आज़माएँ
समानांतर उपयोगकर्ताओं की संख्या कम करें
लागत अनुमान
बेसिक (7B)
RTX 3060
~$0.03
स्टैंडर्ड (13B)
RTX 3090
~$0.06
एडवांस्ड (34B)
RTX 4090
~$0.10
एंटरप्राइस (70B)
A100
~$0.17
अगले कदम
Ollama - CLI उपयोग
LocalAI - और बैकएंड
RAG + LangChain - उन्नत RAG
अंतिम अपडेट
क्या यह उपयोगी था?