Mistral & Mixtral
Clore.ai GPUs पर Mistral और Mixtral मॉडल चलाएँ
उच्च-गुणवत्ता वाले पाठ जनरेशन के लिए Mistral और Mixtral मॉडल चलाएँ।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
CLORE.AI पर किराए पर लेना
विज़िट करें CLORE.AI मार्केटप्लेस
GPU प्रकार, VRAM और कीमत के अनुसार फ़िल्टर करें
चुनें ऑन-डिमांड (स्थिर दर) या स्पॉट (बोली मूल्य)
अपना ऑर्डर कॉन्फ़िगर करें:
Docker इमेज चुनें
पोर्ट सेट करें (SSH के लिए TCP, वेब UI के लिए HTTP)
यदि आवश्यक हो तो environment variables जोड़ें
स्टार्टअप कमांड दर्ज करें
भुगतान चुनें: CLORE, BTCया USDT/USDC
ऑर्डर बनाएं और डिप्लॉयमेंट की प्रतीक्षा करें
अपने सर्वर तक पहुँचें
कनेक्शन विवरण यहाँ खोजें मेरे ऑर्डर
वेब इंटरफ़ेस: HTTP पोर्ट URL का उपयोग करें
SSH:
ssh -p <port> root@<proxy-address>
मॉडल अवलोकन
Mistral-7B
7B
8GB
सामान्य प्रयोजन
Mistral-7B-Instruct
7B
8GB
चैट/निर्देश
Mixtral-8x7B
46.7B (12.9B सक्रिय)
24GB
MoE, सर्वोत्तम गुणवत्ता
Mixtral-8x22B
141B
80GB+
सबसे बड़ा MoE
त्वरित डिप्लॉय
Docker इमेज:
पोर्ट:
कमांड:
अपनी सेवा तक पहुँचना
डिप्लॉयमेंट के बाद, अपना http_pub URL यहाँ मेरे ऑर्डर:
पर जाएँ मेरे ऑर्डर पेज
अपने ऑर्डर पर क्लिक करें
खोजें
http_pubURL (उदा.,abc123.clorecloud.net)
उपयोग करें https://YOUR_HTTP_PUB_URL की बजाय localhost नीचे दिए गए उदाहरणों में।
इंस्टॉलेशन विकल्प
Ollama का उपयोग करके (सबसे आसान)
vLLM का उपयोग करके
Transformers का उपयोग
Transformers के साथ Mistral-7B
Mixtral-8x7B
क्वांटाइज़्ड मॉडल (कम VRAM)
4-बिट क्वांटाइज़ेशन
llama.cpp के साथ GGUF
vLLM सर्वर (उत्पादन)
OpenAI-संगत API
स्ट्रीमिंग
फ़ंक्शन कॉलिंग
Mistral फ़ंक्शन कॉलिंग का समर्थन करता है:
Gradio इंटरफ़ेस
प्रदर्शन तुलना
थ्रूपुट (टोकन/सेकंड)
Mistral-7B FP16
45
80
120
150
Mistral-7B Q4
70
110
160
200
Mixtral-8x7B FP16
-
-
30
60
Mixtral-8x7B Q4
-
25
50
80
Mixtral-8x22B Q4
-
-
-
25
पहले टोकन तक का समय (TTFT)
Mistral-7B
80ms
50ms
35ms
Mixtral-8x7B
-
150ms
90ms
Mixtral-8x22B
-
-
200ms
संदर्भ लंबाई बनाम VRAM (Mistral-7B)
4K
15GB
9GB
5GB
8K
18GB
11GB
7GB
16K
24GB
15GB
9GB
32K
36GB
22GB
14GB
VRAM आवश्यकताएँ
Mistral-7B
14GB
8GB
5GB
Mixtral-8x7B
90GB
45GB
24GB
Mixtral-8x22B
180GB
90GB
48GB
उपयोग के मामले
कोड जनरेशन
डेटा विश्लेषण
रचनात्मक लेखन
समस्या निवारण
मेमोरी समाप्त
4-बिट क्वांटाइज़ेशन का उपयोग करें
Mixtral के बजाय Mistral-7B का उपयोग करें
max_model_len कम करें
धीमी जनरेशन
उत्पादन के लिए vLLM का उपयोग करें
फ्लैश अटेंशन सक्षम करें
मल्टी-GPU के लिए टेन्सर पैरललिज़्म का उपयोग करें
खराब आउटपुट गुणवत्ता
तापमान समायोजित करें (0.1-0.9)
इंस्ट्रक्ट संस्करण का उपयोग करें
बेहतर सिस्टम प्रॉम्प्ट्स
लागत का अनुमान
CLORE.AI मार्केटप्लेस की सामान्य दरें (2024 तक):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
मूल्य प्रदाता और मांग के अनुसार बदलते हैं। देखें CLORE.AI मार्केटप्लेस वर्तमान दरों के लिए।
पैसे बचाएँ:
का उपयोग करें स्पॉट बाधित किए जा सकने वाले कार्य के लिए मार्केट — लगभग एक-तिहाई सर्वरों की स्पॉट कीमत ऑन-डिमांड से कम होती है (मध्य ~13% छूट), बाकी उससे मेल खाते हैं
से भुगतान करें CLORE टोकन
विभिन्न प्रदाताओं के बीच कीमतों की तुलना करें
अगले चरण
vLLM - उत्पादन सर्विंग
Ollama - आसान परिनियोजन
DeepSeek-V3 - सर्वोत्तम तर्क मॉडल
Qwen2.5 - बहुभाषी विकल्प
अंतिम अपडेट
क्या यह उपयोगी था?