For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral Small 3.1

Clore.ai पर Mistral Small 3.1 (24B) डिप्लॉय करें — आदर्श सिंगल-GPU प्रोडक्शन मॉडल

Mistral Small 3.1, जिसे Mistral AI ने मार्च 2025 में जारी किया, एक है 24 अरब पैरामीटर वाला डेंस मॉडल जो अपनी क्षमता से कहीं ऊपर प्रदर्शन करता है। 128K कॉन्टेक्स्ट विंडो, मूल विज़न क्षमताओं, सर्वोत्तम-श्रेणी की फ़ंक्शन कॉलिंग, और एक Apache 2.0 लाइसेंस, शायद यह एकल RTX 4090 पर चलाने योग्य सबसे अच्छा मॉडल है। क्वांटाइज़ किए जाने पर यह अधिकांश बेंचमार्क पर GPT-4o Mini और Claude 3.5 Haiku से बेहतर प्रदर्शन करता है, और उपभोक्ता हार्डवेयर पर आराम से फिट हो जाता है।

मुख्य विशेषताएँ

  • 24B डेंस पैरामीटर — MoE की कोई जटिलता नहीं, तैनाती सीधी-सादी

  • 128K संदर्भ विंडो — RULER 128K स्कोर 81.2%, GPT-4o Mini (65.8%) से बेहतर

  • मूल विज़न — छवियों, चार्टों, दस्तावेज़ों और स्क्रीनशॉट का विश्लेषण करें

  • Apache 2.0 लाइसेंस — व्यावसायिक और व्यक्तिगत उपयोग के लिए पूरी तरह खुला

  • उन्नत फ़ंक्शन कॉलिंग — JSON आउटपुट के साथ मूल टूल उपयोग, एजेंटिक वर्कफ़्लो के लिए आदर्श

  • बहुभाषी — CJK, अरबी, हिंदी और यूरोपीय भाषाओं सहित 25+ भाषाएँ

आवश्यकताएँ

घटक
क्वांटाइज़्ड (Q4)
पूर्ण परिशुद्धता (BF16)

GPU

1× RTX 4090 24GB

2× RTX 4090 या 1× H100

VRAM

~16GB

~55GB

RAM

32GB

64GB

डिस्क

20GB

50GB

CUDA

12.8+

12.8+

Clore.ai की अनुशंसा: क्वांटाइज़्ड इन्फ़रेंस के लिए RTX 4090 ($0.14–0.42/घंटा) — सर्वोत्तम मूल्य/प्रदर्शन अनुपात

Ollama के साथ त्वरित शुरुआत

Mistral Small 3.1 को चलाने का सबसे तेज़ तरीका:

OpenAI-संगत API के रूप में Ollama

विज़न के साथ Ollama

vLLM सेटअप (प्रोडक्शन)

उच्च थ्रूपुट और समवर्ती अनुरोधों वाले प्रोडक्शन वर्कलोड के लिए:

एकल GPU पर सर्व करें (केवल पाठ)

विज़न के साथ सर्व करें (2 GPU अनुशंसित)

सर्वर से क्वेरी करें

HuggingFace Transformers

सीधे Python एकीकरण और प्रयोग के लिए:

फ़ंक्शन कॉलिंग का उदाहरण

Mistral Small 3.1 टूल उपयोग के लिए सबसे अच्छे छोटे मॉडलों में से एक है:

Docker त्वरित शुरुआत

Clore.ai उपयोगकर्ताओं के लिए सुझाव

  • RTX 4090 सबसे उपयुक्त विकल्प है: $0.14–0.42/घंटा पर, एकल RTX 4090 Mistral Small 3.1 को क्वांटाइज़्ड रूप में आसानी से चलाता है। सामान्य-उद्देश्य LLM के लिए Clore.ai पर सर्वोत्तम लागत/प्रदर्शन अनुपात।

  • कम तापमान का उपयोग करें: Mistral AI अनुशंसा करता है temperature=0.15 अधिकांश कार्यों के लिए। अधिक तापमान इस मॉडल के साथ असंगत आउटपुट पैदा करते हैं।

  • RTX 3090 भी काम करता है: $0.07–0.21/घंटा पर, RTX 3090 (24GB) Ollama के साथ Q4 क्वांटाइज़्ड मॉडल आराम से चलाता है। 4090 से थोड़ा धीमा, लेकिन आधी कीमत।

  • त्वरित सेटअप के लिए Ollama, प्रोडक्शन के लिए vLLM: Ollama आपको 60 सेकंड में एक काम करने वाला मॉडल देता है। समवर्ती API अनुरोधों और अधिक थ्रूपुट के लिए vLLM पर स्विच करें।

  • फ़ंक्शन कॉलिंग इसे खास बनाती है: कई 24B मॉडल चैट कर सकते हैं — बहुत कम ही भरोसेमंद रूप से टूल्स कॉल कर पाते हैं। Mistral Small 3.1 की फ़ंक्शन कॉलिंग GPT-4o Mini के समकक्ष है। एजेंट, API बैकएंड और ऑटोमेशन पाइपलाइन आत्मविश्वास के साथ बनाएँ।

समस्या निवारण

समस्या
समाधान

OutOfMemoryError RTX 4090 पर

Ollama के माध्यम से क्वांटाइज़्ड मॉडल का उपयोग करें या load_in_4bit=True Transformers में। पूर्ण BF16 के लिए ~55GB चाहिए।

Ollama मॉडल नहीं मिला

उपयोग करें ollama run mistral-small3.1 (आधिकारिक लाइब्रेरी का नाम)।

vLLM टोकनाइज़र त्रुटियाँ

हमेशा पास करें --tokenizer-mode mistral --config-format mistral --load-format mistral.

खराब आउटपुट गुणवत्ता

सेट करें temperature=0.15. एक सिस्टम प्रॉम्प्ट जोड़ें। Mistral Small तापमान के प्रति संवेदनशील है।

1 GPU पर विज़न काम नहीं कर रहा

विज़न सुविधाओं के लिए अधिक VRAM चाहिए। उपयोग करें --tensor-parallel-size 2 या कम करें --max-model-len.

फ़ंक्शन कॉल खाली लौटते हैं

जोड़ें --tool-call-parser mistral --enable-auto-tool-choice vLLM serve के लिए।

अधिक पढ़ें

अंतिम अपडेट

क्या यह उपयोगी था?