For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral.rs

Rust में लिखित बेहद तेज़ LLM इन्फ़रेंस — GGUF, GGML, SafeTensors समर्थन और OpenAI-संगत API के साथ प्रोडक्शन-रेडी सर्वर।

🦀 Rust में निर्मित अधिकतम प्रदर्शन के लिए | GGUF और विज़न मॉडल समर्थन | Apache-2.0 लाइसेंस


Mistral.rs क्या है?

Mistral.rs एक उच्च-प्रदर्शन LLM इन्फ़रेंस इंजन है जो पूरी तरह से लिखा गया है Rust. मूल रूप से Mistral मॉडलों पर केंद्रित, यह अब आधुनिक LLMs की पूरी दुनिया का समर्थन करता है। Rust की नींव प्रदान करती है:

  • शून्य-लागत अमूर्तताएँ — इन्फ़रेंस के दौरान कोई garbage collection pause नहीं

  • मेमोरी सुरक्षा — null pointer exceptions या memory leaks नहीं

  • निर्धारित प्रदर्शन — JVM/Python overhead के बिना स्थिर latency

  • कंपाइल-समय अनुकूलन — SIMD, threading, और GPU kernels को build time पर अनुकूलित किया गया

मुख्य विशेषताएँ

  • GGUF समर्थन — कोई भी quantized model चलाएँ (Q4_K_M, Q8_0, आदि)

  • ISQ (इन-सिटू क्वांटाइज़ेशन) — load time पर तुरंत quantize करें

  • PagedAttention — continuous batching के साथ कुशल KV cache

  • विज़न भाषा मॉडल — LLaVA, Phi-3 Vision, Idefics समर्थन

  • अनुमानात्मक decoding — draft models के साथ तेज़ इन्फ़रेंस

  • X-LoRA — स्केलेबल fine-tuned adapter समर्थन

  • OpenAI-संगत REST API — सीधे-प्रयोग योग्य प्रतिस्थापन

समर्थित मॉडल परिवार

परिवार
फ़ॉर्मेट
इंजन

Llama 2/3

GGUF, SafeTensors

Rust CUDA

Mistral/Mixtral

GGUF, SafeTensors

Rust CUDA

Phi-2/3

GGUF, SafeTensors

Rust CUDA

Gemma

GGUF, SafeTensors

Rust CUDA

Qwen 2

GGUF, SafeTensors

Rust CUDA

Starcoder 2

GGUF

Rust CUDA

LLaVA 1.5/1.6

SafeTensors

विज़न

Phi-3 Vision

SafeTensors

विज़न


Clore.ai पर त्वरित शुरुआत

चरण 1: एक GPU सर्वर खोजें

पर clore.ai मार्केटप्लेस:

  • न्यूनतम: 8GB VRAM (7B Q4 मॉडलों के लिए)

  • अनुशंसित: बड़े मॉडलों के लिए RTX 3090/4090 (24GB)

  • CUDA 11.8+ आवश्यक है

चरण 2: Mistral.rs Docker परिनियोजित करें

पोर्ट मैपिंग:

कंटेनर पोर्ट
उद्देश्य

22

SSH पहुँच

8080

REST API सर्वर

उपलब्ध इमेज वेरिएंट:

चरण 3: कनेक्ट करें और सत्यापित करें


सर्वर चलाना

GGUF मॉडल के साथ त्वरित शुरुआत

Mistral 7B (SafeTensors) सर्व करें

इन-सिटू क्वांटाइज़ेशन (ISQ) के साथ सर्व करें

ISQ मॉडल को load time पर quantize करता है — पहले से quantized मॉडल की आवश्यकता नहीं:

विज़न भाषा मॉडल

अनुमानात्मक decoding


API उपयोग

OpenAI-संगत एंडपॉइंट

एंडपॉइंट
विधि
विवरण

/v1/chat/completions

POST

चैट पूर्णताएँ

/v1/completions

POST

पाठ पूर्णताएँ

/v1/models

GET

मॉडल सूची

/v1/images/generations

POST

छवि निर्माण (VLMs)

/v1/re_isq

POST

लोड किए गए मॉडल को पुनः क्वांटाइज़ करें

/health

GET

स्वास्थ्य जाँच

Python उदाहरण

स्ट्रीमिंग प्रतिक्रिया

विज़न/छवि इनपुट

cURL उदाहरण


कॉन्फ़िगरेशन विकल्प

सर्वर फ़्लैग

ISQ क्वांटाइज़ेशन संदर्भ

ISQ विकल्प
बिट्स
गुणवत्ता
VRAM (7B)

Q2K

2

★★☆☆☆

~2.5GB

Q3K

3

★★★☆☆

~3.5GB

Q4_0

4

★★★★☆

~4.5GB

Q4K

4

★★★★☆

~4.5GB

Q5K

5

★★★★★

~5.5GB

Q6K

6

★★★★★

~6.5GB

Q8_0

8

★★★★★

~8GB

HQQ4

4

★★★★☆

~4.5GB

HQQ8

8

★★★★★

~8GB

HQQ (Half-Quadratic Quantization) अक्सर समान बिट स्तर पर GGUF Q4 की तुलना में बेहतर गुणवत्ता देता है, खासकर निर्देश-पालन कार्यों के लिए।


उन्नत सुविधाएँ

X-LoRA (LoRA एडाप्टरों का मिश्रण)

प्रति टोकन गतिशील रूप से चुने गए कई fine-tuned adapters चलाएँ:

रनटाइम पर पुनः-क्वांटाइज़ करें

अनुरोध लॉगिंग


प्रदर्शन ट्यूनिंग

थ्रूपुट के लिए अनुकूलित करें

कम latency के लिए अनुकूलित करें

प्रदर्शन मॉनिटर करें


Docker Compose


स्रोत से बिल्ड करना

यदि Docker image आपकी CUDA version से मेल नहीं खाती:


समस्या निवारण

CUDA लाइब्रेरी नहीं मिली

मॉडल डाउनलोड विफल

पोर्ट 8080 उपयोग में है

क्वांटाइज़ेशन के दौरान मेमोरी समाप्त


Clore.ai GPU अनुशंसाएँ

Mistral.rs एक Rust-native इंजन है — इसका कम overhead मतलब Python-based servers की तुलना में आपको प्रति GPU डॉलर अधिक throughput मिलता है।

GPU
VRAM
Clore.ai मूल्य
अनुशंसित उपयोग
थ्रूपुट (Mistral 7B Q4)

RTX 3090

24 GB

$0.07–0.21/hr

सबसे अच्छा बजट विकल्प — 7B Q4/Q8, विज़न मॉडल

~120 tok/s

RTX 4090

24 GB

$0.14–0.42/hr

उच्च-थ्रूपुट 7B–34B, speculative decoding

~200 tok/s

A100 40GB

40 GB

प्रोडक्शन 34B–70B Q4 सर्विंग

~160 tok/s

A100 80GB

80 GB

पूर्ण-परिशुद्धता 70B, multi-model

~185 tok/s

यहाँ RTX 3090 क्यों उत्कृष्ट है: Mistral.rs के Rust CUDA kernels Python GIL overhead और garbage collection pauses से बचते हैं, जो Python servers को नुकसान पहुँचाते हैं। Mistral 7B Q4_K_M चलाने वाला RTX 3090 लगभग ~120 tok/s देता है — वही hardware पर vLLM के बराबर, लेकिन लागत का एक अंश ($0.07–0.21/घंटा बनाम cloud providers द्वारा $0.07–0.21/घंटा)।

अनुमानात्मक decoding: एक बड़े मॉडल (34B) को एक छोटे draft model (3B) के साथ जोड़ें ताकि गुणवत्ता में कोई कमी बिना 2–3× गति वृद्धि मिले। RTX 4090 इस पैटर्न के लिए आदर्श है।


संसाधन

अंतिम अपडेट

क्या यह उपयोगी था?