Mistral.rs
Rust में लिखित बेहद तेज़ LLM इन्फ़रेंस — GGUF, GGML, SafeTensors समर्थन और OpenAI-संगत API के साथ प्रोडक्शन-रेडी सर्वर।
🦀 Rust में निर्मित अधिकतम प्रदर्शन के लिए | GGUF और विज़न मॉडल समर्थन | Apache-2.0 लाइसेंस
Mistral.rs क्या है?
Mistral.rs एक उच्च-प्रदर्शन LLM इन्फ़रेंस इंजन है जो पूरी तरह से लिखा गया है Rust. मूल रूप से Mistral मॉडलों पर केंद्रित, यह अब आधुनिक LLMs की पूरी दुनिया का समर्थन करता है। Rust की नींव प्रदान करती है:
शून्य-लागत अमूर्तताएँ — इन्फ़रेंस के दौरान कोई garbage collection pause नहीं
मेमोरी सुरक्षा — null pointer exceptions या memory leaks नहीं
निर्धारित प्रदर्शन — JVM/Python overhead के बिना स्थिर latency
कंपाइल-समय अनुकूलन — SIMD, threading, और GPU kernels को build time पर अनुकूलित किया गया
मुख्य विशेषताएँ
GGUF समर्थन — कोई भी quantized model चलाएँ (Q4_K_M, Q8_0, आदि)
ISQ (इन-सिटू क्वांटाइज़ेशन) — load time पर तुरंत quantize करें
PagedAttention — continuous batching के साथ कुशल KV cache
विज़न भाषा मॉडल — LLaVA, Phi-3 Vision, Idefics समर्थन
अनुमानात्मक decoding — draft models के साथ तेज़ इन्फ़रेंस
X-LoRA — स्केलेबल fine-tuned adapter समर्थन
OpenAI-संगत REST API — सीधे-प्रयोग योग्य प्रतिस्थापन
समर्थित मॉडल परिवार
Llama 2/3
GGUF, SafeTensors
Rust CUDA
Mistral/Mixtral
GGUF, SafeTensors
Rust CUDA
Phi-2/3
GGUF, SafeTensors
Rust CUDA
Gemma
GGUF, SafeTensors
Rust CUDA
Qwen 2
GGUF, SafeTensors
Rust CUDA
Starcoder 2
GGUF
Rust CUDA
LLaVA 1.5/1.6
SafeTensors
विज़न
Phi-3 Vision
SafeTensors
विज़न
Clore.ai पर त्वरित शुरुआत
चरण 1: एक GPU सर्वर खोजें
पर clore.ai मार्केटप्लेस:
न्यूनतम: 8GB VRAM (7B Q4 मॉडलों के लिए)
अनुशंसित: बड़े मॉडलों के लिए RTX 3090/4090 (24GB)
CUDA 11.8+ आवश्यक है
चरण 2: Mistral.rs Docker परिनियोजित करें
पोर्ट मैपिंग:
22
SSH पहुँच
8080
REST API सर्वर
उपलब्ध इमेज वेरिएंट:
चरण 3: कनेक्ट करें और सत्यापित करें
सर्वर चलाना
GGUF मॉडल के साथ त्वरित शुरुआत
Mistral 7B (SafeTensors) सर्व करें
इन-सिटू क्वांटाइज़ेशन (ISQ) के साथ सर्व करें
ISQ मॉडल को load time पर quantize करता है — पहले से quantized मॉडल की आवश्यकता नहीं:
विज़न भाषा मॉडल
अनुमानात्मक decoding
अनुमानात्मक decoding प्रदान कर सकता है 2–3x गति वृद्धि अधिकांश संवादात्मक वर्कलोड के लिए, जहाँ छोटा draft model अगले टोकनों की सही भविष्यवाणी करता है।
API उपयोग
OpenAI-संगत एंडपॉइंट
/v1/chat/completions
POST
चैट पूर्णताएँ
/v1/completions
POST
पाठ पूर्णताएँ
/v1/models
GET
मॉडल सूची
/v1/images/generations
POST
छवि निर्माण (VLMs)
/v1/re_isq
POST
लोड किए गए मॉडल को पुनः क्वांटाइज़ करें
/health
GET
स्वास्थ्य जाँच
Python उदाहरण
स्ट्रीमिंग प्रतिक्रिया
विज़न/छवि इनपुट
cURL उदाहरण
कॉन्फ़िगरेशन विकल्प
सर्वर फ़्लैग
ISQ क्वांटाइज़ेशन संदर्भ
Q2K
2
★★☆☆☆
~2.5GB
Q3K
3
★★★☆☆
~3.5GB
Q4_0
4
★★★★☆
~4.5GB
Q4K
4
★★★★☆
~4.5GB
Q5K
5
★★★★★
~5.5GB
Q6K
6
★★★★★
~6.5GB
Q8_0
8
★★★★★
~8GB
HQQ4
4
★★★★☆
~4.5GB
HQQ8
8
★★★★★
~8GB
उन्नत सुविधाएँ
X-LoRA (LoRA एडाप्टरों का मिश्रण)
प्रति टोकन गतिशील रूप से चुने गए कई fine-tuned adapters चलाएँ:
रनटाइम पर पुनः-क्वांटाइज़ करें
अनुरोध लॉगिंग
प्रदर्शन ट्यूनिंग
थ्रूपुट के लिए अनुकूलित करें
कम latency के लिए अनुकूलित करें
प्रदर्शन मॉनिटर करें
Docker Compose
स्रोत से बिल्ड करना
यदि Docker image आपकी CUDA version से मेल नहीं खाती:
बिल्ड समय: Rust संकलन धीमा है। पूर्ण बिल्ड में 10–20 मिनट लगने की उम्मीद करें। उपयोग करें sccache इन्क्रिमेंटल बिल्ड को तेज़ करने के लिए: cargo install sccache && RUSTC_WRAPPER=sccache cargo build --release --features cuda
समस्या निवारण
CUDA लाइब्रेरी नहीं मिली
मॉडल डाउनलोड विफल
पोर्ट 8080 उपयोग में है
क्वांटाइज़ेशन के दौरान मेमोरी समाप्त
ISQ बनाम GGUF: ISQ load time पर GPU मेमोरी का उपयोग करके quantize करता है (अस्थायी स्पाइक)। यदि आपके पास VRAM कम है, तो TheBloke या इसी तरह के pre-quantized GGUF files उपयोग करें — वे लोडिंग के दौरान कम peak memory लेते हैं।
Clore.ai GPU अनुशंसाएँ
Mistral.rs एक Rust-native इंजन है — इसका कम overhead मतलब Python-based servers की तुलना में आपको प्रति GPU डॉलर अधिक throughput मिलता है।
RTX 3090
24 GB
$0.07–0.21/hr
सबसे अच्छा बजट विकल्प — 7B Q4/Q8, विज़न मॉडल
~120 tok/s
RTX 4090
24 GB
$0.14–0.42/hr
उच्च-थ्रूपुट 7B–34B, speculative decoding
~200 tok/s
यहाँ RTX 3090 क्यों उत्कृष्ट है: Mistral.rs के Rust CUDA kernels Python GIL overhead और garbage collection pauses से बचते हैं, जो Python servers को नुकसान पहुँचाते हैं। Mistral 7B Q4_K_M चलाने वाला RTX 3090 लगभग ~120 tok/s देता है — वही hardware पर vLLM के बराबर, लेकिन लागत का एक अंश ($0.07–0.21/घंटा बनाम cloud providers द्वारा $0.07–0.21/घंटा)।
अनुमानात्मक decoding: एक बड़े मॉडल (34B) को एक छोटे draft model (3B) के साथ जोड़ें ताकि गुणवत्ता में कोई कमी बिना 2–3× गति वृद्धि मिले। RTX 4090 इस पैटर्न के लिए आदर्श है।
संसाधन
🐙 GitHub: github.com/EricLBuehler/mistral.rs
📦 कंटेनर रजिस्ट्री: ghcr.io/ericlbuehler/mistral.rs
📚 दस्तावेज़ीकरण: ericlbuehler.github.io/mistral.rs
💬 Discord: discord.gg/SZrecqK8qw
🤗 GGUF मॉडल: huggingface.co/TheBloke
अंतिम अपडेट
क्या यह उपयोगी था?