For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral & Mixtral

Clore.ai GPUs पर Mistral और Mixtral मॉडल चलाएँ

नए संस्करण उपलब्ध हैं! देखें Mistral Small 3.1 (24B, Apache 2.0, RTX 4090 पर फिट होता है) और Mistral Large 3 (675B MoE, अग्रणी-श्रेणी).

उच्च-गुणवत्ता वाले पाठ जनरेशन के लिए Mistral और Mixtral मॉडल चलाएँ।

CLORE.AI पर किराए पर लेना

  1. विज़िट करें CLORE.AI मार्केटप्लेस

  2. GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें

  3. चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)

  4. अपना ऑर्डर कॉन्फ़िगर करें:

    • Docker इमेज चुनें

    • पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)

    • यदि आवश्यक हो तो environment variables जोड़ें

    • स्टार्टअप कमांड दर्ज करें

  5. भुगतान चुनें: CLORE, BTCया USDT/USDC

  6. ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें

अपने सर्वर तक पहुँचें

  • कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर

  • वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें

  • SSH: ssh -p <port> root@<proxy-address>

मॉडल अवलोकन

मॉडल
पैरामीटर
VRAM
विशेषता

Mistral-7B

7B

8GB

सामान्य प्रयोजन

Mistral-7B-Instruct

7B

8GB

चैट/निर्देश

Mixtral-8x7B

46.7B (12.9B सक्रिय)

24GB

MoE, सर्वोत्तम गुणवत्ता

Mixtral-8x22B

141B

80GB+

सबसे बड़ा MoE

त्वरित डिप्लॉय

Docker इमेज:

पोर्ट:

कमांड:

अपनी सेवा तक पहुँचना

डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:

  1. पर जाएँ मेरे ऑर्डर पेज

  2. अपने ऑर्डर पर क्लिक करें

  3. खोजें http_pub URL (उदा., abc123.clorecloud.net)

उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।

इंस्टॉलेशन विकल्प

Ollama का उपयोग करके (सबसे आसान)

vLLM का उपयोग करके

Transformers का उपयोग

Transformers के साथ Mistral-7B

Mixtral-8x7B

क्वांटाइज़्ड मॉडल (कम VRAM)

4-बिट क्वांटाइज़ेशन

llama.cpp के साथ GGUF

vLLM सर्वर (उत्पादन)

OpenAI-संगत API

स्ट्रीमिंग

फ़ंक्शन कॉलिंग

Mistral फ़ंक्शन कॉलिंग का समर्थन करता है:

Gradio इंटरफ़ेस

प्रदर्शन तुलना

थ्रूपुट (टोकन/सेकंड)

मॉडल
RTX 3060
RTX 3090
RTX 4090
A100 40GB

Mistral-7B FP16

45

80

120

150

Mistral-7B Q4

70

110

160

200

Mixtral-8x7B FP16

-

-

30

60

Mixtral-8x7B Q4

-

25

50

80

Mixtral-8x22B Q4

-

-

-

25

पहले टोकन तक का समय (TTFT)

मॉडल
RTX 3090
RTX 4090
A100

Mistral-7B

80ms

50ms

35ms

Mixtral-8x7B

-

150ms

90ms

Mixtral-8x22B

-

-

200ms

संदर्भ लंबाई बनाम VRAM (Mistral-7B)

संदर्भ
FP16
Q8
Q4

4K

15GB

9GB

5GB

8K

18GB

11GB

7GB

16K

24GB

15GB

9GB

32K

36GB

22GB

14GB

VRAM आवश्यकताएँ

मॉडल
FP16
8-बिट
4-बिट

Mistral-7B

14GB

8GB

5GB

Mixtral-8x7B

90GB

45GB

24GB

Mixtral-8x22B

180GB

90GB

48GB

उपयोग के मामले

कोड जनरेशन

डेटा विश्लेषण

रचनात्मक लेखन

समस्या निवारण

मेमोरी समाप्त

  • 4-बिट क्वांटाइज़ेशन का उपयोग करें

  • Mixtral के बजाय Mistral-7B का उपयोग करें

  • max_model_len कम करें

धीमी जनरेशन

  • उत्पादन के लिए vLLM का उपयोग करें

  • फ्लैश अटेंशन सक्षम करें

  • मल्टी-GPU के लिए टेन्सर पैरललिज़्म का उपयोग करें

खराब आउटपुट गुणवत्ता

  • तापमान समायोजित करें (0.1-0.9)

  • इंस्ट्रक्ट संस्करण का उपयोग करें

  • बेहतर सिस्टम प्रॉम्प्ट्स

लागत का अनुमान

CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):

GPU
प्रति घंटा दर
प्रति दिन दर
4-घंटे का सत्र

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।

पैसे बचाएँ:

  • का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं

  • से भुगतान करें CLORE टोकन

  • विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें

अगले चरण

  • vLLM - उत्पादन सर्विंग

  • Ollama - आसान परिनियोजन

  • DeepSeek-V3 - सर्वोत्तम तर्क मॉडल

  • Qwen2.5 - बहुभाषी विकल्प

अंतिम अपडेट

क्या यह उपयोगी था?