For the complete documentation index, see llms.txt. This page is also available as Markdown.
GPT4All Local LLM
GPT4All को Clore.ai पर डिप्लॉय करें — Docker का उपयोग करके OpenAI-compatible API server के साथ privacy-first local LLMs चलाएँ, अधिकतम प्रदर्शन के लिए optional CUDA acceleration वाले GGUF models को सपोर्ट करते हुए।
अवलोकन
GPT4All Nomic AI द्वारा का एक सबसे लोकप्रिय ओपन-सोर्स लोकल LLM प्रोजेक्ट है, जिसके पास है 72,000+ GitHub स्टार्स. यह आपको अपने स्वयं के हार्डवेयर पर बड़े भाषा मॉडल पूरी तरह ऑफ़लाइन चलाने देता है — कोई इंटरनेट कनेक्शन आवश्यक नहीं, कोई डेटा तीसरे पक्ष को भेजा नहीं जाता।
GPT4All अपने परिष्कृत डेस्कटॉप एप्लिकेशन के लिए सबसे ज्यादा जाना जाता है, लेकिन इसमें एक Python लाइब्रेरी (gpt4all पैकेज) और एक बिल्ट-इन OpenAI-अनुकूल API सर्वर पर चल रहा है 4891. Clore.ai पर, आप GPT4All को एक रेंट किए गए GPU पर Docker कंटेनर में डिप्लॉय कर सकते हैं, इसे HTTP पर सर्व कर सकते हैं, और किसी भी OpenAI-समर्थित क्लाइंट को इससे कनेक्ट कर सकते हैं।
Docker नोट: GPT4All सर्वर कम्पोनेंट के लिए कोई आधिकारिक Docker इमेज प्रकाशित नहीं करता। यह गाइड कस्टम Docker सेटअप का उपयोग करता है जिसमें gpt4all Python पैकेज शामिल है। अधिक प्रोडक्शन-रेडी Docker विकल्प के लिए जो उसी GGUF मॉडल फ़ाइलों को चलाता हैदेखें LocalAI वैकल्पिक अनुभाग — LocalAI Docker-प्रथम है और एक ही मॉडल फॉर्मेट का समर्थन करता है।
मुख्य विशेषताएँ:
🔒 100% ऑफ़लाइन — सभी इनफ़रेंस स्थानीय रूप से चलते हैं
🤖 OpenAI-अनुकूल REST API (पोर्ट 4891)
📚 LocalDocs — आपके अपने दस्तावेज़ों पर RAG
🧩 सभी लोकप्रिय GGUF मॉडल फॉर्मैट्स का समर्थन करता है
🐍 पूर्ण Python API के साथ pip install gpt4all
💬 खूबसूरत डेस्कटॉप UI (सर्वर के लिए प्रासंगिक नहीं, लेकिन लोकल परीक्षण के लिए अच्छा)
आवश्यकताएँ
हार्डवेयर आवश्यकताएँ
टियर
GPU
VRAM
RAM
स्टोरेज
Clore.ai मूल्य
केवल CPU
कोई नहीं
—
16 GB
50 GB SSD
~$0.02/घंटा (CPU सर्वर)
एंट्री GPU
RTX 3060 12GB
12 GB
16 GB
50 GB SSD
~$0.10/घं
अनुशंसित
RTX 3090
24 GB
32 GB
100 GB SSD
~$0.20/घंटा
हाई-एंड
RTX 4090
24 GB
64 GB
200 GB SSD
~$0.35/घंटा
नोट: GPT4All GPU समर्थन अंदर से llama.cpp के माध्यम से CUDA का उपयोग करता है। vLLM के विपरीत, यह समर्थन विशेष CUDA कंप्यूट क्षमता की आवश्यकता नहीं रखता — सामान्यतः RTX 10xx और नए काम करते हैं।
फ़िल्टर: Docker सक्षम, GPU: RTX 3090 (7B–13B मॉडलों के लिए)
इमेज के साथ डिप्लॉय करें: nvidia/cuda:12.1.0-runtime-ubuntu22.04
खुले पोर्ट्स: 4891 (GPT4All API), 22 (SSH)
कम से कम आवंटित करें 50 GB डिस्क स्पेस
स्टेप 2 — SSH के माध्यम से कनेक्ट करें
चरण 3 — GPT4All Docker इमेज बनाएं
चूँकि आधिकारिक GPT4All Docker इमेज नहीं है, हम एक बनाएँगे:
चरण 4 — API सर्वर स्क्रिप्ट बनाएं
चरण 5 — बनायें और चलाएँ
चरण 6 — API का परीक्षण करें
वैकल्पिक: LocalAI Docker इमेज
एक अधिक मजबूत, प्रोडक्शन-रेडी Docker डिप्लॉयमेंट के लिए जो उसी GGUF मॉडलों को चलाता है GPT4All के समान, LocalAI अनुशंसित विकल्प है। इसका आधिकारिक Docker इमेज है, CUDA समर्थन है, और यह सक्रिय रूप से मेंटेन किया जाता है:
कॉन्फ़िगरेशन
GPT4All सर्वर के लिए पर्यावरण चर
वैरिएबल
डिफ़ॉल्ट
विवरण
MODEL_NAME
mistral-7b-instruct...
मॉडल फ़ाइलनाम या GPT4All हब नाम
MODEL_PATH
/models
मॉडल फ़ाइलों वाली डायरेक्टरी
DEVICE
gpu
gpu, cpu, या metal (macOS)
N_CTX
4096
कॉन्टेक्स्ट विंडो आकार (टोकन्स)
API_HOST
0.0.0.0
बाइंड पता
API_PORT
4891
API सर्वर के लिए पोर्ट
Docker Compose सेटअप
GPU त्वरक
GPU उपयोग सत्यापित करना
GPT4All Python लाइब्रेरी उपयोग करता है llama.cpp अंदर से CUDA समर्थन के साथ:
GPU लेयर्स का चयन करना
The gpu_layers (या n_gpu_layers) पैरामीटर नियंत्रित करता है कि मॉडल का कितना भाग GPU बनाम CPU पर चलता है:
CPU फॉलबैक मोड
यदि कोई GPU उपलब्ध नहीं है (उदाहरण के लिए, परीक्षण के लिए CPU-ओनली Clore.ai सर्वर):
⚠️ CPU इनफ़रेंस GPU की तुलना में 10–50× धीमा है CPU-ओनली सर्वरों के लिए, छोटे मॉडल (Phi-3 Mini, TinyLlama) का उपयोग करें और 2–5 टोकन/सेकंड की उम्मीद रखें।
टिप्स और सर्वोत्तम प्रथाएँ
📥 मॉडलों को पहले से डाउनलोड करना
स्टार्टअप पर ऑटो-डाउनलोड पर निर्भर रहने के बजाय, तेज़ रिस्टार्ट के लिए मॉडलों को पहले से डाउनलोड करें:
🔌 Python एप्लिकेशंस के साथ उपयोग करना
💰 Clore.ai पर लागत अनुकूलन
समस्याओं का निवारण
मॉडल लोड होने में विफल — फ़ाइल नहीं मिली
CUDA त्रुटि: इस आर्किटेक्चर के लिए कोई कर्नेल इमेज नहीं
💡 सिफारिश: यदि आप लोकल LLMs के लिए सबसे सरल Docker डिप्लॉयमेंट चाहते हैं, तो विचार करें Ollama इसके बजाय — इसके पास आधिकारिक Docker इमेज है, बिल्ट-इन GPU समर्थन है, और यह सर्वर-साइड डिप्लॉयमेंट के लिए विशेष रूप से डिज़ाइन किया गया है। GPT4All की ताकत इसका सुंदर डेस्कटॉप UI और LocalDocs (RAG) फीचर है, जो सर्वर मोड में उपलब्ध नहीं होते।
# मॉडल लोड के बाद GPU VRAM उपयोग जांचें
watch -n 2 nvidia-smi
# कंटेनर के अंदर जांचें कि CUDA उपलब्ध है
docker exec gpt4all-server python3 -c "
from gpt4all import GPT4All
devices = GPT4All.list_gpus()
print('Available GPUs:', devices)
"
# server.py में — सभी लेयर्स को GPU पर ज़ोर दें
model = GPT4All(
model_name=MODEL_NAME,
model_path=MODEL_PATH,
device="gpu",
n_ctx=N_CTX,
# अतिरिक्त llama.cpp पैरामीटर जो पास किए जाते हैं:
# n_gpu_layers=99 # सभी लेयर्स GPU पर
)
# अधिकतम GPU लेयर्स के साथ पुनर्निर्माण और पुनः प्रारंभ करें
docker stop gpt4all-server && docker rm gpt4all-server
docker run -d \
--name gpt4all-server \
--gpus all \
-p 4891:4891 \
-v /workspace/models:/models \
-e DEVICE=gpu \
-e MODEL_NAME=mistral-7b-instruct-v0.1.Q4_0.gguf \
gpt4all-server:latest
# डायरेक्ट Python उपयोग (बिना Docker API के)
from gpt4all import GPT4All
model = GPT4All(
model_name="mistral-7b-instruct-v0.1.Q4_0.gguf",
model_path="/workspace/models",
device="gpu"
)
# सरल जनरेशन
with model.chat_session():
response = model.generate("Explain GPU computing in simple terms", max_tokens=200)
print(response)
# OpenAI क्लाइंट के साथ API सर्वर का उपयोग करना
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:4891/v1",
api_key="not-needed"
)
completion = client.chat.completions.create(
model="mistral-7b-instruct-v0.1.Q4_0.gguf",
messages=[{"role": "user", "content": "Hello!"}]
)
print(completion.choices[0].message.content)
# RTX 3090 @ $0.20/घंटा — 7B मॉडलों के लिए उपयोग करें (सबसे अच्छा मूल्य)
# अनुमानित थ्रूपुट: Mistral 7B Q4 के लिए ~40 टोकन/सेकंड
# 1M जेनरेट किए गए टोकन्स की लागत: ~$0.005 (OpenAI की तुलना में बेहद सस्ता)
# RTX 4090 @ $0.35/घंटा — 13B मॉडलों या जब गति महत्व रखती है तब उपयोग करें
# अनुमानित थ्रूपुट: Mistral 7B Q4 के लिए ~60 टोकन/सेकंड
# बैच प्रोसेसिंग के लिए: मॉडल को प्रीलोड करें, सभी प्रॉम्प्ट प्रोसेस करें, बंद कर दें
docker run --rm \
--gpus all \
-v /workspace/models:/models \
-v /workspace/prompts:/prompts \
gpt4all-server:latest \
python3 -c "
from gpt4all import GPT4All
import json
model = GPT4All('mistral-7b-instruct-v0.1.Q4_0.gguf', '/models', device='gpu')
prompts = open('/prompts/batch.txt').readlines()
image_folder = "./images"
for p in prompts:
with model.chat_session():
results.append(model.generate(p.strip(), max_tokens=256))
json.dump(results, open('/prompts/results.json', 'w'))
print(f'Processed {len(results)} prompts')
"
# जाँचें कि मॉडल फ़ाइल मौजूद है और सही नाम है
ls -lh /workspace/models/
docker exec gpt4all-server ls /models/
# GPT4All मॉडल नामों के साथ केस-सेंसिटिव है
# ls आउटपुट से सटीक फ़ाइलनाम का उपयोग MODEL_NAME के रूप में करें
docker stop gpt4all-server && docker rm gpt4all-server
docker run -d --gpus all -p 4891:4891 \
-v /workspace/models:/models \
-e MODEL_NAME=mistral-7b-instruct-v0.1.Q4_0.gguf \
gpt4all-server:latest
# आपका GPU संभवतः CUDA संस्करण के साथ संगत नहीं हो सकता
# GPU कंप्यूट क्षमता जांचें
nvidia-smi --query-gpu=compute_cap --format=csv,noheader
# यदि < 6.0 है, तो CPU मोड का उपयोग करें
docker run -d --gpus all -p 4891:4891 \
-v /workspace/models:/models \
-e DEVICE=cpu \
-e MODEL_NAME=Phi-3-mini-4k-instruct.Q4_0.gguf \
gpt4all-server:latest
# स्टार्टअप लॉग्स जांचें
docker logs gpt4all-server | head -50
# मॉडल लोडिंग में 30–120 सेकंड लग सकते हैं
# प्रतीक्षा करें और पुन: प्रयास करें:
sleep 60 && curl http://localhost:4891/health
# जाँचें कि मॉडल फ़ाइल भ्रष्ट तो नहीं है
python3 -c "
from gpt4all import GPT4All
m = GPT4All('mistral-7b-instruct-v0.1.Q4_0.gguf', '/workspace/models')
print('Model OK:', m)
"
# पोर्ट बाइंडिंग सत्यापित करें
docker ps | grep 4891
# यह दिखाना चाहिए: 0.0.0.0:4891->4891/tcp
# जाँचें कि Clore.ai के फ़ायरवॉल नियम हैं या नहीं
# Clore.ai सर्वर सेटिंग्स में, सुनिश्चित करें कि पोर्ट 4891 खुले के रूप में सूचीबद्ध है
# आंतरिक रूप से परीक्षण करें:
curl http://127.0.0.1:4891/health
# नोट: Clore.ai पोर्ट्स को रैंडमली मैप करता है — अपने सर्वर डैशबोर्ड में दिखाए गए पोर्ट का उपयोग करें