Ollama
Clore.ai GPUs पर Ollama के साथ LLMs को लोकली चलाएँ
CLORE.AI GPU पर LLMs को स्थानीय रूप से चलाने का सबसे आसान तरीका।
सभी उदाहरण उन GPU सर्वरों पर चलाए जा सकते हैं जो इनके माध्यम से किराए पर लिए गए हों CLORE.AI Marketplace.
सर्वर आवश्यकताएँ
RAM
8GB
16GB+
VRAM
6GB
8GB+
नेटवर्क
100Mbps
500Mbps+
स्टार्टअप समय
~30 सेकंड
-
Ollama क्यों?
एक-कमांड सेटअप - Python नहीं, कोई निर्भरता नहीं
मॉडल लाइब्रेरी - मॉडलों को डाउनलोड करें
ollama pullOpenAI-संगत API - सीधे बदले जाने योग्य विकल्प
GPU एक्सेलेरेशन - स्वचालित CUDA पहचान
मल्टी-मॉडल - एक साथ कई मॉडल चलाएँ (v0.6+)
CLORE.AI पर त्वरित डिप्लॉय
Docker इमेज:
पोर्ट्स:
कमांड:
सत्यापित करें कि यह काम कर रहा है
डिप्लॉयमेंट के बाद, अपना खोजें http_pub URL मेरे ऑर्डर्स में और परीक्षण करें:
यदि आपको HTTP 502 मिलता है, तो 30-60 सेकंड प्रतीक्षा करें - सेवा अभी भी शुरू हो रही है।
अपनी सेवा तक पहुँचना
जब CLORE.AI पर डिप्लॉय किया गया हो, तो अपने Ollama इंस्टेंस तक पहुँचें इस के माध्यम से http_pub URL:
इंस्टॉलेशन
Docker का उपयोग करके (अनुशंसित)
मैन्युअल इंस्टॉलेशन
यह एकल कमांड Ollama का नवीनतम संस्करण इंस्टॉल करती है, systemd service सेट करती है, और GPU पहचान को स्वचालित रूप से कॉन्फ़िगर करती है। Ubuntu, Debian, Fedora, और अधिकांश आधुनिक Linux वितरणों पर काम करती है।
मॉडल चलाना
Pull और Run
लोकप्रिय मॉडल
llama3.2
3B
तेज़, सामान्य-उद्देश्य
llama3.1
8B
बेहतर गुणवत्ता
llama3.1:70b
70B
सर्वोत्तम गुणवत्ता
mistral
7B
तेज़, अच्छी गुणवत्ता
mixtral
47B
MoE, उच्च गुणवत्ता
codellama
7-34B
कोड जनरेशन
deepseek-coder-v2
16B
कोड के लिए सर्वोत्तम
deepseek-r1
7B-671B
रीज़निंग मॉडल
deepseek-r1:32b
32B
संतुलित रीज़निंग
qwen2.5
7B
बहुभाषी
qwen2.5:72b
72B
सर्वोत्तम Qwen गुणवत्ता
phi4
14B
Microsoft का नवीनतम
gemma2
9B
Google का मॉडल
मॉडल वैरिएंट्स
v0.6+ में नया
Ollama v0.6 ने उत्पादन वर्कलोड के लिए कई प्रमुख सुविधाएँ पेश कीं:
संरचित आउटपुट (JSON Schema)
मॉडल प्रतिक्रियाओं को एक विशिष्ट JSON schema से मिलाने के लिए बाध्य करें। विश्वसनीय, parseable आउटपुट की आवश्यकता वाले एप्लिकेशन बनाने के लिए उपयोगी:
संरचित आउटपुट के साथ Python उदाहरण:
OpenAI-संगत Embeddings Endpoint (/api/embed)
v0.6+ में नया: /api/embed endpoint पूरी तरह OpenAI-संगत है और batched inputs का समर्थन करता है:
OpenAI client सीधे इसके साथ काम करता है /v1/embeddings:
लोकप्रिय embedding मॉडल:
समवर्ती मॉडल लोडिंग
v0.6 से पहले, Ollama एक मॉडल को अनलोड करके दूसरा लोड करता था। V0.6+ उपलब्ध VRAM तक सीमित होकर एक साथ कई मॉडल चलाने का समर्थन करता है:
समवर्तीता कॉन्फ़िगर करें:
यह विशेष रूप से उपयोगी है:
विभिन्न मॉडलों का A/B परीक्षण
विभिन्न कार्यों के लिए विशेष मॉडल (कोडिंग + चैट)
बार-बार उपयोग होने वाले मॉडलों को VRAM में warm रखना
API उपयोग
चैट पूर्णता
OpenAI-संगत Endpoint
स्ट्रीमिंग
Embeddings
टेक्स्ट जनरेशन (चैट नहीं)
पूर्ण API संदर्भ
सभी endpoint दोनों के साथ काम करते हैं http://localhost:11434 (SSH के माध्यम से) और https://your-http-pub.clorecloud.net (बाहरी).
मॉडल प्रबंधन
/api/tags
GET
सभी डाउनलोड किए गए मॉडल सूचीबद्ध करें
/api/show
POST
मॉडल विवरण प्राप्त करें
/api/pull
POST
एक मॉडल डाउनलोड करें
/api/delete
DELETE
एक मॉडल हटाएँ
/api/ps
GET
वर्तमान में चल रहे मॉडल सूचीबद्ध करें
/api/version
GET
Ollama संस्करण प्राप्त करें
मॉडल सूची
प्रतिक्रिया:
मॉडल विवरण दिखाएँ
API के माध्यम से मॉडल pull करें
प्रतिक्रिया:
बड़े मॉडलों को डाउनलोड होने में कई मिनट लग सकते हैं। बहुत बड़े मॉडलों (30GB+) के लिए, SSH और CLI का उपयोग करने पर विचार करें: ollama pull model-name
मॉडल हटाएँ
चल रहे मॉडल सूचीबद्ध करें
प्रतिक्रिया:
संस्करण प्राप्त करें
प्रतिक्रिया:
Inference Endpoints
/api/generate
POST
टेक्स्ट पूर्णता
/api/chat
POST
चैट पूर्णता
/api/embeddings
POST
Embeddings जनरेट करें (लेगेसी)
/api/embed
POST
Embeddings जनरेट करें v0.6+ (batch, OpenAI-संगत)
/v1/chat/completions
POST
OpenAI-संगत चैट
/v1/embeddings
POST
OpenAI-संगत embeddings
कस्टम मॉडल निर्माण
API के माध्यम से विशिष्ट system prompt के साथ कस्टम मॉडल बनाएँ:
GPU कॉन्फ़िगरेशन
GPU उपयोग जाँचें
मल्टी-GPU
Ollama स्वतः उपलब्ध GPUs का उपयोग करता है। विशिष्ट GPU के लिए:
मेमोरी प्रबंधन
कस्टम मॉडल (Modelfile)
system prompts के साथ कस्टम मॉडल बनाएँ:
सेवा के रूप में चलाना
Systemd
प्रदर्शन सुझाव
उपयुक्त quantization का उपयोग करें
गति के लिए Q4_K_M
गुणवत्ता के लिए Q8_0
अधिकतम गुणवत्ता के लिए fp16
मॉडल को VRAM से मिलाएँ
8GB: 7B मॉडल (Q4)
16GB: 13B मॉडल या 7B (Q8)
24GB: 34B मॉडल (Q4)
48GB+: 70B मॉडल
मॉडल को लोडेड रखें
तेज़ SSD प्रदर्शन सुधारता है
मॉडल लोडिंग और KV cache को तेज़ storage से लाभ मिलता है
NVMe SSD वाले सर्वर 2-3x बेहतर प्रदर्शन प्राप्त कर सकते हैं
बेंचमार्क
जनरेशन गति (tokens/sec)
Llama 3.2 3B (Q4)
120
160
200
220
Llama 3.1 8B (Q4)
60
100
130
150
Llama 3.1 8B (Q8)
45
80
110
130
Mistral 7B (Q4)
70
110
140
160
Mixtral 8x7B (Q4)
-
35
55
75
Llama 3.1 70B (Q4)
-
-
18
35
DeepSeek-R1 7B (Q4)
65
105
135
155
DeepSeek-R1 32B (Q4)
-
-
22
42
Qwen2.5 72B (Q4)
-
-
15
30
Phi-4 14B (Q4)
-
50
75
90
बेंचमार्क जनवरी 2026 में अपडेट किए गए। वास्तविक गति सर्वर कॉन्फ़िगरेशन के आधार पर भिन्न हो सकती है।
पहले token तक का समय (ms)
3B
50
35
25
7-8B
120
80
60
13B
250
150
100
34B
600
350
200
70B
-
1200
500
Context Length बनाम VRAM (Q4)
7B
5GB
6GB
8GB
12GB
13B
8GB
10GB
14GB
22GB
34B
20GB
24GB
32GB
48GB
70B
40GB
48GB
64GB
96GB
GPU आवश्यकताएँ
3B
3GB
5GB
7-8B
5GB
9GB
13B
8GB
15GB
34B
20GB
38GB
70B
40GB
75GB
लागत का अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें:
कीमतें USD/दिन में हैं। दरें प्रदाता के अनुसार बदलती हैं — वर्तमान दरों के लिए देखें CLORE.AI Marketplace ।
समस्या निवारण
मॉडल लोड नहीं हो रहा है
धीमी जनरेशन
कनेक्शन अस्वीकृत
http_pub URL पर HTTP 502
इसका मतलब है कि सेवा अभी भी शुरू हो रही है। 30-60 सेकंड प्रतीक्षा करें और फिर पुनः प्रयास करें:
अगले चरण
Open WebUI - Ollama के लिए सुंदर चैट इंटरफ़ेस
vLLM - उच्च-थ्रूपुट प्रोडक्शन सर्विंग
DeepSeek-R1 - तर्क मॉडल
DeepSeek-V3 - सर्वश्रेष्ठ सामान्य मॉडल
Qwen2.5 - बहुभाषी विकल्प
Text Generation WebUI - उन्नत सुविधाएँ
अंतिम अपडेट
क्या यह उपयोगी था?