For the complete documentation index, see llms.txt. This page is also available as Markdown.

LiteLLM AI Gateway

Clore.ai GPUs पर 100+ LLMs के लिए AI Gateway प्रॉक्सी के रूप में LiteLLM डिप्लॉय करें

LiteLLM एक ओपन-सोर्स AI गेटवे है जो 100+ भाषा मॉडल प्रदाताओं के लिए एकीकृत OpenAI-संगत API प्रदान करता है — जिनमें OpenAI, Anthropic, Azure, Bedrock, HuggingFace, और स्थानीय रूप से होस्ट किए गए मॉडल शामिल हैं। इसे CLORE.AI पर डिप्लॉय करें ताकि आप अपनी सभी LLM API कॉल्स को लागत ट्रैकिंग, दर-सीमांकन, और फ़ॉलबैक लॉजिक के साथ एक ही endpoint से रूट, लोड-बैलेंस और प्रबंधित कर सकें।

LiteLLM की असली ताकत बड़े पैमाने पर दिखती है: स्थानीय+क्लाउड मिश्रित स्टैक चलाने वाली टीमें एप्लिकेशन कोड को छुए बिना मॉडल तुरंत बदल सकती हैं। बदलें gpt-4o के साथ mistral-7b-local को कॉन्फ़िग में, रीस्टार्ट करें — हो गया।

सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

RAM

4 GB

8 GB+

VRAM

लागू नहीं (केवल प्रॉक्सी)

उपलब्ध नहीं

डिस्क

10 GB

20 GB+

GPU

आवश्यक नहीं

वैकल्पिक (स्थानीय मॉडलों के लिए)

LiteLLM स्वयं एक CPU-आधारित प्रॉक्सी है और इसे GPU की आवश्यकता नहीं होती। हालांकि, इसे CLORE.AI GPU सर्वर पर डिप्लॉय करना तब समझ में आता है जब आप LiteLLM के साथ उसी मशीन पर स्थानीय मॉडल (Ollama, TGI, vLLM के माध्यम से) को एकीकृत गेटवे के रूप में चलाना चाहते हैं।

CLORE.AI पर त्वरित परिनियोजन

Docker इमेज: ghcr.io/berriai/litellm:main-latest

पोर्ट: 22/tcp, 4000/http

Environment Variables:

वेरिएबल
उदाहरण
विवरण

OPENAI_API_KEY

sk-xxx...

OpenAI API कुंजी

ANTHROPIC_API_KEY

sk-ant-xxx...

Anthropic API कुंजी

AZURE_API_KEY

xxx...

Azure OpenAI कुंजी

LITELLM_MASTER_KEY

sk-my-master-key

प्रॉक्सी के लिए मास्टर प्रामाणिकरण कुंजी

DATABASE_URL

postgresql://...

लागत ट्रैकिंग के लिए PostgreSQL

STORE_MODEL_IN_DB

True

मॉडल कॉन्फ़िगरेशन को DB में स्थायी रूप से सहेजें

चरण-दर-चरण सेटअप

1. CLORE.AI पर एक सर्वर किराए पर लें

LiteLLM केवल CPU वाले सर्वरों पर भी बढ़िया काम करता है। जाएँ CLORE.AI मार्केटप्लेस और इनके लिए फ़िल्टर करें:

  • केवल प्रॉक्सी सेटअप के लिए सबसे कम कीमत वाले CPU सर्वर

  • यदि आप स्थानीय मॉडल भी चलाना चाहते हैं तो GPU सर्वर (RTX 3090+)

2. अपने Server में SSH करें

3. एक कॉन्फ़िग फ़ाइल बनाएं

LiteLLM मॉडल परिभाषित करने के लिए YAML कॉन्फ़िग फ़ाइल का उपयोग करता है:

4. LiteLLM लॉन्च करें

बेसिक लॉन्च:

लागत ट्रैकिंग के लिए PostgreSQL के साथ:

सबसे पहले, PostgreSQL कंटेनर शुरू करें:

Docker Compose का उपयोग करना (अनुशंसित):

5. सर्वर सत्यापित करें

6. CLORE.AI HTTP प्रॉक्सी के माध्यम से पहुँचें

पोर्ट 4000 के लिए आपका CLORE.AI http_pub URL:

इसे अपने रूप में उपयोग करें api_base किसी भी OpenAI-संगत क्लाइंट में।


उपयोग के उदाहरण

उदाहरण 1: प्रॉक्सी के माध्यम से प्रत्यक्ष API कॉल

उदाहरण 2: LiteLLM प्रॉक्सी के साथ OpenAI Python SDK

उदाहरण 3: LiteLLM Python SDK (प्रत्यक्ष)

उदाहरण 4: फ़ॉलबैक कॉन्फ़िगरेशन

मॉडलों के बीच स्वचालित फ़ॉलबैक कॉन्फ़िगर करें:

उदाहरण 5: लागत ट्रैकिंग डैशबोर्ड

PostgreSQL सक्षम करने के बाद, खर्च विश्लेषण तक पहुँचें:


कॉन्फ़िगरेशन

वर्चुअल कुंजियाँ (प्रति-उपयोगकर्ता API कुंजियाँ)

दर सीमाओं और बजट के साथ अलग-अलग कुंजियाँ बनाएं:

लोड बैलेंसिंग

कैशिंग

दर सीमांकन


प्रदर्शन सुझाव

1. दोहराए जाने वाले prompts के लिए कैशिंग सक्षम करें

सामान्य प्रश्नों वाले RAG या chatbot अनुप्रयोगों के लिए, Redis caching लागत को 30–70% तक घटाता है और cache hit पर P50 latency को <5ms तक लाता है:

2. Async अनुरोधों का उपयोग करें

3. स्थानीय मॉडल रूटिंग

सस्ते/सरल अनुरोधों को Clore.ai GPUs पर स्थानीय मॉडलों तक, और जटिल अनुरोधों को GPT-4 तक रूट करें:

एक सामान्य सेटअप: Mistral 7B या Llama 3 8B को Clore.ai RTX 3090 ($0.07–0.21/hr) पर स्थानीय रूप से चलाएँ, वहाँ 80% ट्रैफ़िक संभालें, और जटिल कार्यों को GPT-4o पर बढ़ाएँ। केवल क्लाउड पर निर्भर रहने की तुलना में 3–5× लागत बचत आम है।

4. टाइमआउट और पुनः प्रयास सेट करें


Clore.ai GPU अनुशंसाएँ

LiteLLM स्वयं को GPU की आवश्यकता नहीं — यह एक प्रॉक्सी है। GPU का चुनाव केवल तब मायने रखता है जब आप इसके साथ-साथ स्थानीय inference को सह-डिप्लॉय कर रहे हों।

स्थानीय मॉडल
GPU
क्यों

Mistral 7B / Llama 3 8B (bf16)

RTX 3090 24 GB

आराम से फिट होता है, ~200 tok/s throughput

Mixtral 8×7B या Llama 3 70B (AWQ)

RTX 4090 24 GB

3090 से तेज़ memory bandwidth; 70B AWQ 4-bit फिट होता है

Llama 3 70B (bf16) या multi-model serving

A100 80 GB

एक साथ कई 7–13B मॉडल चलाएँ; कम latency के लिए HBM2e

एकल डेवलपर के लिए अनुशंसित स्टैक: RTX 3090 + Mistral 7B + LiteLLM gateway. Clore.ai पर कुल लागत: $0.07–0.21/hr। लगभग 50 req/min आसानी से संभालता है, जटिल कार्यों के लिए GPT-4o फ़ॉलबैक के साथ।

टीम / प्रोडक्शन स्टैक: A100 80GB, Llama 3 70B + LiteLLM + PostgreSQL चलाएँ। 20+ समकालिक उपयोगकर्ताओं को सेवा देता है, पूर्ण लागत ट्रैकिंग, और अधिकांश अनुरोधों के लिए शून्य cloud LLM खर्च।


समस्या निवारण

समस्या: "model not found"

सुनिश्चित करें कि आपके अनुरोध में model name ठीक वही है जो इसमें है config.yaml:

समस्या: "authentication failed"

अपना LITELLM_MASTER_KEY environment variable जांचें और उसे Bearer token के रूप में उपयोग करें।

समस्या: कॉन्फ़िग परिवर्तन परिलक्षित नहीं हो रहे

कॉन्फ़िग परिवर्तन के बाद कंटेनर रीस्टार्ट करें:

समस्या: पहली request पर उच्च latency

LiteLLM स्टार्टअप पर model configs लोड करता है। कनेक्शन स्थापित होने के कारण शुरुआती कुछ अनुरोध धीमे हो सकते हैं।

समस्या: डेटाबेस कनेक्शन त्रुटियाँ

समस्या: प्रदाताओं से 429 rate limit त्रुटियाँ

फ़ॉलबैक कॉन्फ़िगर करें:


Clore.ai GPU अनुशंसाएँ

LiteLLM एक API gateway/proxy है — यह स्वयं inference नहीं करता। GPU चयन इस बात पर निर्भर करता है कि आप cloud APIs की ओर रूट कर रहे हैं या स्थानीय मॉडलों की ओर।

सेटअप
GPU
Clore.ai मूल्य
उपयोग-प्रकरण

केवल cloud API प्रॉक्सी

केवल CPU

~$0.02/hr

OpenAI, Anthropic, Gemini की ओर रूट करें — GPU की आवश्यकता नहीं

स्थानीय vLLM backend

RTX 3090 (24GB)

$0.07–0.21/hr

LiteLLM को frontend के रूप में उपयोग करके self-hosted 7B–13B मॉडल

स्थानीय vLLM backend

RTX 4090 (24GB)

$0.14–0.42/hr

उच्च throughput वाले 7B–34B स्थानीय मॉडल

स्थानीय vLLM backend

A100 40GB

70B मॉडल, production स्थानीय serving

सबसे सामान्य सेटअप: अपने Clore.ai-hosted vLLM/Ollama इंस्टेंस के सामने एकीकृत प्रॉक्सी के रूप में LiteLLM चलाएँ। इससे आपको provider fallbacks, rate limiting, cost tracking, और OpenAI-संगत routing मिलता है — जबकि सभी inference स्थानीय और सस्ते रहते हैं।

उदाहरण लागत: LiteLLM प्रॉक्सी को CPU-only instance ($0.07–0.21/hr) पर चलाएँ और इसे RTX 3090 ($0.07–0.21/hr) पर मौजूद vLLM सर्वर की ओर पॉइंट करें। Fallbacks, logging, और rate limiting के साथ production-ready, self-hosted LLM API के लिए कुल लागत $0.07–0.21/hr।


लिंक्स

अंतिम अपडेट

क्या यह उपयोगी था?