LiteLLM AI Gateway
Clore.ai GPUs पर 100+ LLMs के लिए AI Gateway प्रॉक्सी के रूप में LiteLLM डिप्लॉय करें
LiteLLM एक ओपन-सोर्स AI गेटवे है जो 100+ भाषा मॉडल प्रदाताओं के लिए एकीकृत OpenAI-संगत API प्रदान करता है — जिनमें OpenAI, Anthropic, Azure, Bedrock, HuggingFace, और स्थानीय रूप से होस्ट किए गए मॉडल शामिल हैं। इसे CLORE.AI पर डिप्लॉय करें ताकि आप अपनी सभी LLM API कॉल्स को लागत ट्रैकिंग, दर-सीमांकन, और फ़ॉलबैक लॉजिक के साथ एक ही endpoint से रूट, लोड-बैलेंस और प्रबंधित कर सकें।
LiteLLM की असली ताकत बड़े पैमाने पर दिखती है: स्थानीय+क्लाउड मिश्रित स्टैक चलाने वाली टीमें एप्लिकेशन कोड को छुए बिना मॉडल तुरंत बदल सकती हैं। बदलें gpt-4o के साथ mistral-7b-local को कॉन्फ़िग में, रीस्टार्ट करें — हो गया।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
RAM
4 GB
8 GB+
VRAM
लागू नहीं (केवल प्रॉक्सी)
उपलब्ध नहीं
डिस्क
10 GB
20 GB+
GPU
आवश्यक नहीं
वैकल्पिक (स्थानीय मॉडलों के लिए)
CLORE.AI पर त्वरित परिनियोजन
Docker इमेज: ghcr.io/berriai/litellm:main-latest
पोर्ट: 22/tcp, 4000/http
Environment Variables:
OPENAI_API_KEY
sk-xxx...
OpenAI API कुंजी
ANTHROPIC_API_KEY
sk-ant-xxx...
Anthropic API कुंजी
AZURE_API_KEY
xxx...
Azure OpenAI कुंजी
LITELLM_MASTER_KEY
sk-my-master-key
प्रॉक्सी के लिए मास्टर प्रामाणिकरण कुंजी
DATABASE_URL
postgresql://...
लागत ट्रैकिंग के लिए PostgreSQL
STORE_MODEL_IN_DB
True
मॉडल कॉन्फ़िगरेशन को DB में स्थायी रूप से सहेजें
चरण-दर-चरण सेटअप
1. CLORE.AI पर एक सर्वर किराए पर लें
LiteLLM केवल CPU वाले सर्वरों पर भी बढ़िया काम करता है। जाएँ CLORE.AI मार्केटप्लेस और इनके लिए फ़िल्टर करें:
केवल प्रॉक्सी सेटअप के लिए सबसे कम कीमत वाले CPU सर्वर
यदि आप स्थानीय मॉडल भी चलाना चाहते हैं तो GPU सर्वर (RTX 3090+)
2. अपने Server में SSH करें
3. एक कॉन्फ़िग फ़ाइल बनाएं
LiteLLM मॉडल परिभाषित करने के लिए YAML कॉन्फ़िग फ़ाइल का उपयोग करता है:
4. LiteLLM लॉन्च करें
बेसिक लॉन्च:
लागत ट्रैकिंग के लिए PostgreSQL के साथ:
सबसे पहले, PostgreSQL कंटेनर शुरू करें:
Docker Compose का उपयोग करना (अनुशंसित):
5. सर्वर सत्यापित करें
6. CLORE.AI HTTP प्रॉक्सी के माध्यम से पहुँचें
पोर्ट 4000 के लिए आपका CLORE.AI http_pub URL:
इसे अपने रूप में उपयोग करें api_base किसी भी OpenAI-संगत क्लाइंट में।
उपयोग के उदाहरण
उदाहरण 1: प्रॉक्सी के माध्यम से प्रत्यक्ष API कॉल
उदाहरण 2: LiteLLM प्रॉक्सी के साथ OpenAI Python SDK
उदाहरण 3: LiteLLM Python SDK (प्रत्यक्ष)
उदाहरण 4: फ़ॉलबैक कॉन्फ़िगरेशन
मॉडलों के बीच स्वचालित फ़ॉलबैक कॉन्फ़िगर करें:
उदाहरण 5: लागत ट्रैकिंग डैशबोर्ड
PostgreSQL सक्षम करने के बाद, खर्च विश्लेषण तक पहुँचें:
कॉन्फ़िगरेशन
वर्चुअल कुंजियाँ (प्रति-उपयोगकर्ता API कुंजियाँ)
दर सीमाओं और बजट के साथ अलग-अलग कुंजियाँ बनाएं:
लोड बैलेंसिंग
कैशिंग
दर सीमांकन
प्रदर्शन सुझाव
1. दोहराए जाने वाले prompts के लिए कैशिंग सक्षम करें
सामान्य प्रश्नों वाले RAG या chatbot अनुप्रयोगों के लिए, Redis caching लागत को 30–70% तक घटाता है और cache hit पर P50 latency को <5ms तक लाता है:
2. Async अनुरोधों का उपयोग करें
3. स्थानीय मॉडल रूटिंग
सस्ते/सरल अनुरोधों को Clore.ai GPUs पर स्थानीय मॉडलों तक, और जटिल अनुरोधों को GPT-4 तक रूट करें:
एक सामान्य सेटअप: Mistral 7B या Llama 3 8B को Clore.ai RTX 3090 ($0.07–0.21/hr) पर स्थानीय रूप से चलाएँ, वहाँ 80% ट्रैफ़िक संभालें, और जटिल कार्यों को GPT-4o पर बढ़ाएँ। केवल क्लाउड पर निर्भर रहने की तुलना में 3–5× लागत बचत आम है।
4. टाइमआउट और पुनः प्रयास सेट करें
Clore.ai GPU अनुशंसाएँ
LiteLLM स्वयं को GPU की आवश्यकता नहीं — यह एक प्रॉक्सी है। GPU का चुनाव केवल तब मायने रखता है जब आप इसके साथ-साथ स्थानीय inference को सह-डिप्लॉय कर रहे हों।
Mistral 7B / Llama 3 8B (bf16)
RTX 3090 24 GB
आराम से फिट होता है, ~200 tok/s throughput
Mixtral 8×7B या Llama 3 70B (AWQ)
RTX 4090 24 GB
3090 से तेज़ memory bandwidth; 70B AWQ 4-bit फिट होता है
Llama 3 70B (bf16) या multi-model serving
A100 80 GB
एक साथ कई 7–13B मॉडल चलाएँ; कम latency के लिए HBM2e
एकल डेवलपर के लिए अनुशंसित स्टैक: RTX 3090 + Mistral 7B + LiteLLM gateway. Clore.ai पर कुल लागत: $0.07–0.21/hr। लगभग 50 req/min आसानी से संभालता है, जटिल कार्यों के लिए GPT-4o फ़ॉलबैक के साथ।
टीम / प्रोडक्शन स्टैक: A100 80GB, Llama 3 70B + LiteLLM + PostgreSQL चलाएँ। 20+ समकालिक उपयोगकर्ताओं को सेवा देता है, पूर्ण लागत ट्रैकिंग, और अधिकांश अनुरोधों के लिए शून्य cloud LLM खर्च।
समस्या निवारण
समस्या: "model not found"
सुनिश्चित करें कि आपके अनुरोध में model name ठीक वही है जो इसमें है config.yaml:
समस्या: "authentication failed"
अपना LITELLM_MASTER_KEY environment variable जांचें और उसे Bearer token के रूप में उपयोग करें।
समस्या: कॉन्फ़िग परिवर्तन परिलक्षित नहीं हो रहे
कॉन्फ़िग परिवर्तन के बाद कंटेनर रीस्टार्ट करें:
समस्या: पहली request पर उच्च latency
LiteLLM स्टार्टअप पर model configs लोड करता है। कनेक्शन स्थापित होने के कारण शुरुआती कुछ अनुरोध धीमे हो सकते हैं।
समस्या: डेटाबेस कनेक्शन त्रुटियाँ
समस्या: प्रदाताओं से 429 rate limit त्रुटियाँ
फ़ॉलबैक कॉन्फ़िगर करें:
Clore.ai GPU अनुशंसाएँ
LiteLLM एक API gateway/proxy है — यह स्वयं inference नहीं करता। GPU चयन इस बात पर निर्भर करता है कि आप cloud APIs की ओर रूट कर रहे हैं या स्थानीय मॉडलों की ओर।
केवल cloud API प्रॉक्सी
केवल CPU
~$0.02/hr
OpenAI, Anthropic, Gemini की ओर रूट करें — GPU की आवश्यकता नहीं
स्थानीय vLLM backend
RTX 3090 (24GB)
$0.07–0.21/hr
LiteLLM को frontend के रूप में उपयोग करके self-hosted 7B–13B मॉडल
स्थानीय vLLM backend
RTX 4090 (24GB)
$0.14–0.42/hr
उच्च throughput वाले 7B–34B स्थानीय मॉडल
लिंक्स
अंतिम अपडेट
क्या यह उपयोगी था?