For the complete documentation index, see llms.txt. This page is also available as Markdown.

Ollama

Clore.ai GPUs पर Ollama के साथ LLMs को लोकली चलाएँ

CLORE.AI GPU पर LLMs को स्थानीय रूप से चलाने का सबसे आसान तरीका।

वर्तमान संस्करण: v0.6+ — यह गाइड Ollama v0.6 और उसके बाद के संस्करणों को कवर करती है। प्रमुख नई सुविधाओं में संरचित आउटपुट (JSON schema enforcement), OpenAI-संगत embeddings endpoint (/api/embed), और concurrent model loading (स्वैप किए बिना एक साथ कई मॉडल चलाना) शामिल हैं। विवरण के लिए देखें v0.6+ में नया

सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

RAM

8GB

16GB+

VRAM

6GB

8GB+

नेटवर्क

100Mbps

500Mbps+

स्टार्टअप समय

~30 सेकंड

-

Ollama हल्का है और अधिकांश GPU सर्वरों पर काम करता है। बड़े मॉडलों (13B+) के लिए, 16GB+ RAM और 12GB+ VRAM वाले सर्वर चुनें।

Ollama क्यों?

  • एक-कमांड सेटअप - Python नहीं, कोई निर्भरता नहीं

  • मॉडल लाइब्रेरी - मॉडलों को डाउनलोड करें ollama pull

  • OpenAI-संगत API - सीधे बदले जाने योग्य विकल्प

  • GPU एक्सेलेरेशन - स्वचालित CUDA पहचान

  • मल्टी-मॉडल - एक साथ कई मॉडल चलाएँ (v0.6+)

CLORE.AI पर त्वरित डिप्लॉय

Docker इमेज:

पोर्ट्स:

कमांड:

सत्यापित करें कि यह काम कर रहा है

डिप्लॉयमेंट के बाद, अपना खोजें http_pub URL मेरे ऑर्डर्स में और परीक्षण करें:

अपनी सेवा तक पहुँचना

जब CLORE.AI पर डिप्लॉय किया गया हो, तो अपने Ollama इंस्टेंस तक पहुँचें इस के माध्यम से http_pub URL:

सभी localhost:11434 नीचे दिए गए उदाहरण SSH के माध्यम से कनेक्ट होने पर काम करते हैं। बाहरी पहुँच के लिए, इसे अपने से बदलें https://your-http-pub.clorecloud.net/ URL.

इंस्टॉलेशन

Docker का उपयोग करके (अनुशंसित)

मैन्युअल इंस्टॉलेशन

यह एकल कमांड Ollama का नवीनतम संस्करण इंस्टॉल करती है, systemd service सेट करती है, और GPU पहचान को स्वचालित रूप से कॉन्फ़िगर करती है। Ubuntu, Debian, Fedora, और अधिकांश आधुनिक Linux वितरणों पर काम करती है।

मॉडल चलाना

Pull और Run

लोकप्रिय मॉडल

मॉडल
आकार
उपयोग का मामला

llama3.2

3B

तेज़, सामान्य-उद्देश्य

llama3.1

8B

बेहतर गुणवत्ता

llama3.1:70b

70B

सर्वोत्तम गुणवत्ता

mistral

7B

तेज़, अच्छी गुणवत्ता

mixtral

47B

MoE, उच्च गुणवत्ता

codellama

7-34B

कोड जनरेशन

deepseek-coder-v2

16B

कोड के लिए सर्वोत्तम

deepseek-r1

7B-671B

रीज़निंग मॉडल

deepseek-r1:32b

32B

संतुलित रीज़निंग

qwen2.5

7B

बहुभाषी

qwen2.5:72b

72B

सर्वोत्तम Qwen गुणवत्ता

phi4

14B

Microsoft का नवीनतम

gemma2

9B

Google का मॉडल

मॉडल वैरिएंट्स

v0.6+ में नया

Ollama v0.6 ने उत्पादन वर्कलोड के लिए कई प्रमुख सुविधाएँ पेश कीं:

संरचित आउटपुट (JSON Schema)

मॉडल प्रतिक्रियाओं को एक विशिष्ट JSON schema से मिलाने के लिए बाध्य करें। विश्वसनीय, parseable आउटपुट की आवश्यकता वाले एप्लिकेशन बनाने के लिए उपयोगी:

संरचित आउटपुट के साथ Python उदाहरण:

OpenAI-संगत Embeddings Endpoint (/api/embed)

v0.6+ में नया: /api/embed endpoint पूरी तरह OpenAI-संगत है और batched inputs का समर्थन करता है:

OpenAI client सीधे इसके साथ काम करता है /v1/embeddings:

लोकप्रिय embedding मॉडल:

समवर्ती मॉडल लोडिंग

v0.6 से पहले, Ollama एक मॉडल को अनलोड करके दूसरा लोड करता था। V0.6+ उपलब्ध VRAM तक सीमित होकर एक साथ कई मॉडल चलाने का समर्थन करता है:

समवर्तीता कॉन्फ़िगर करें:

यह विशेष रूप से उपयोगी है:

  • विभिन्न मॉडलों का A/B परीक्षण

  • विभिन्न कार्यों के लिए विशेष मॉडल (कोडिंग + चैट)

  • बार-बार उपयोग होने वाले मॉडलों को VRAM में warm रखना

API उपयोग

चैट पूर्णता

जोड़ें "stream": false ताकि streaming के बजाय पूरी प्रतिक्रिया एक बार में मिले।

OpenAI-संगत Endpoint

स्ट्रीमिंग

Embeddings

टेक्स्ट जनरेशन (चैट नहीं)

पूर्ण API संदर्भ

सभी endpoint दोनों के साथ काम करते हैं http://localhost:11434 (SSH के माध्यम से) और https://your-http-pub.clorecloud.net (बाहरी).

मॉडल प्रबंधन

Endpoint
Method
विवरण

/api/tags

GET

सभी डाउनलोड किए गए मॉडल सूचीबद्ध करें

/api/show

POST

मॉडल विवरण प्राप्त करें

/api/pull

POST

एक मॉडल डाउनलोड करें

/api/delete

DELETE

एक मॉडल हटाएँ

/api/ps

GET

वर्तमान में चल रहे मॉडल सूचीबद्ध करें

/api/version

GET

Ollama संस्करण प्राप्त करें

मॉडल सूची

प्रतिक्रिया:

मॉडल विवरण दिखाएँ

API के माध्यम से मॉडल pull करें

प्रतिक्रिया:

मॉडल हटाएँ

चल रहे मॉडल सूचीबद्ध करें

प्रतिक्रिया:

संस्करण प्राप्त करें

प्रतिक्रिया:

Inference Endpoints

Endpoint
Method
विवरण

/api/generate

POST

टेक्स्ट पूर्णता

/api/chat

POST

चैट पूर्णता

/api/embeddings

POST

Embeddings जनरेट करें (लेगेसी)

/api/embed

POST

Embeddings जनरेट करें v0.6+ (batch, OpenAI-संगत)

/v1/chat/completions

POST

OpenAI-संगत चैट

/v1/embeddings

POST

OpenAI-संगत embeddings

कस्टम मॉडल निर्माण

API के माध्यम से विशिष्ट system prompt के साथ कस्टम मॉडल बनाएँ:

GPU कॉन्फ़िगरेशन

GPU उपयोग जाँचें

मल्टी-GPU

Ollama स्वतः उपलब्ध GPUs का उपयोग करता है। विशिष्ट GPU के लिए:

मेमोरी प्रबंधन

कस्टम मॉडल (Modelfile)

system prompts के साथ कस्टम मॉडल बनाएँ:

सेवा के रूप में चलाना

Systemd

प्रदर्शन सुझाव

  1. उपयुक्त quantization का उपयोग करें

    • गति के लिए Q4_K_M

    • गुणवत्ता के लिए Q8_0

    • अधिकतम गुणवत्ता के लिए fp16

  2. मॉडल को VRAM से मिलाएँ

    • 8GB: 7B मॉडल (Q4)

    • 16GB: 13B मॉडल या 7B (Q8)

    • 24GB: 34B मॉडल (Q4)

    • 48GB+: 70B मॉडल

  3. मॉडल को लोडेड रखें

  4. तेज़ SSD प्रदर्शन सुधारता है

    • मॉडल लोडिंग और KV cache को तेज़ storage से लाभ मिलता है

    • NVMe SSD वाले सर्वर 2-3x बेहतर प्रदर्शन प्राप्त कर सकते हैं

बेंचमार्क

जनरेशन गति (tokens/sec)

मॉडल
RTX 3060
RTX 3090
RTX 4090
A100 40GB

Llama 3.2 3B (Q4)

120

160

200

220

Llama 3.1 8B (Q4)

60

100

130

150

Llama 3.1 8B (Q8)

45

80

110

130

Mistral 7B (Q4)

70

110

140

160

Mixtral 8x7B (Q4)

-

35

55

75

Llama 3.1 70B (Q4)

-

-

18

35

DeepSeek-R1 7B (Q4)

65

105

135

155

DeepSeek-R1 32B (Q4)

-

-

22

42

Qwen2.5 72B (Q4)

-

-

15

30

Phi-4 14B (Q4)

-

50

75

90

बेंचमार्क जनवरी 2026 में अपडेट किए गए। वास्तविक गति सर्वर कॉन्फ़िगरेशन के आधार पर भिन्न हो सकती है।

पहले token तक का समय (ms)

मॉडल
RTX 3090
RTX 4090
A100

3B

50

35

25

7-8B

120

80

60

13B

250

150

100

34B

600

350

200

70B

-

1200

500

Context Length बनाम VRAM (Q4)

मॉडल
2K ctx
4K ctx
8K ctx
16K ctx

7B

5GB

6GB

8GB

12GB

13B

8GB

10GB

14GB

22GB

34B

20GB

24GB

32GB

48GB

70B

40GB

48GB

64GB

96GB

GPU आवश्यकताएँ

मॉडल
Q4 VRAM
Q8 VRAM

3B

3GB

5GB

7-8B

5GB

9GB

13B

8GB

15GB

34B

20GB

38GB

70B

40GB

75GB

लागत का अनुमान

CLORE.AI मार्केटप्लेस की सामान्य दरें:

GPU
VRAM
मूल्य/दिन
इसके लिए उपयुक्त

24GB

$0.30–1.00

13B-34B मॉडल

24GB

$0.50–2.00

34B मॉडल, तेज़

RTX 4070

12GB

$0.20–0.50

7B मॉडल

A100 80GB

80GB

$1.50–3.00

70B मॉडल

कीमतें USD/दिन में हैं। दरें प्रदाता के अनुसार बदलती हैं — वर्तमान दरों के लिए देखें CLORE.AI Marketplace

समस्या निवारण

मॉडल लोड नहीं हो रहा है

धीमी जनरेशन

कनेक्शन अस्वीकृत

http_pub URL पर HTTP 502

इसका मतलब है कि सेवा अभी भी शुरू हो रही है। 30-60 सेकंड प्रतीक्षा करें और फिर पुनः प्रयास करें:

अगले चरण

  • Open WebUI - Ollama के लिए सुंदर चैट इंटरफ़ेस

  • vLLM - उच्च-थ्रूपुट प्रोडक्शन सर्विंग

  • DeepSeek-R1 - तर्क मॉडल

  • DeepSeek-V3 - सर्वश्रेष्ठ सामान्य मॉडल

  • Qwen2.5 - बहुभाषी विकल्प

  • Text Generation WebUI - उन्नत सुविधाएँ

अंतिम अपडेट

क्या यह उपयोगी था?