LitGPT
LitGPT यह PyTorch Lightning पर निर्मित 20+ बड़े भाषा मॉडलों के प्रीट्रेनिंग, फाइनट्यूनिंग, और डिप्लॉयमेंट के लिए एक उच्च-प्रदर्शन लाइब्रेरी है। 12K+ GitHub stars के साथ, यह उन इंजीनियरों के लिए एक पसंदीदा टूलकिट है जिन्हें HuggingFace Transformers के abstraction overhead के बिना साफ़, हैक करने योग्य LLM प्रशिक्षण कोड चाहिए।
LitGPT में प्रत्येक मॉडल लगभग 1,000 लाइनों का साफ़ PyTorch है — 10 स्तर गहरी inheritance chains नहीं, कोई जादू नहीं। आप Llama 3 implementation को एक दोपहर में end-to-end पढ़ सकते हैं और उसे आत्मविश्वास के साथ संशोधित कर सकते हैं।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
LitGPT क्या है?
LitGPT एक एकीकृत प्रशिक्षण इंटरफ़ेस के साथ state-of-the-art LLMs के production-ready implementations प्रदान करता है:
20+ समर्थित मॉडल — Llama 3, Gemma 2, Mistral, Phi-3, Falcon, StableLM, और अधिक
शुरुआत से प्रीट्रेन करें — Flash Attention, FSDP, और gradient checkpointing के साथ पूर्ण प्रीट्रेनिंग
कुशलता से फाइनट्यून करें — पूर्ण फाइनट्यूनिंग, LoRA, QLoRA, और एडाप्टर विधियाँ
आत्मविश्वास के साथ सर्व करें — क्वांटाइज़ेशन के साथ अंतर्निहित इन्फ़रेंस सर्वर
मल्टी-GPU समर्थन — DDP, FSDP, tensor parallelism तुरंत उपलब्ध
मेमोरी-कुशल — 4-बिट क्वांटाइज़ेशन, gradient checkpointing, activation checkpointing
सर्वर आवश्यकताएँ
GPU
RTX 3090 (24 GB)
A100 80 GB / H100
VRAM
16 GB (7B LoRA)
80 GB+ (70B पूर्ण)
RAM
32 GB
64 GB+
CPU
8 कोर
16+ cores
स्टोरेज
100 GB
500 GB+
ओएस
Ubuntu 20.04+
Ubuntu 22.04
Python
3.10+
3.11
CUDA
12.8+
12.8+
कार्य के अनुसार VRAM आवश्यकताएँ
इन्फ़रेंस (4-बिट)
Llama-3 8B
~6 GB
LoRA फाइनट्यून
Llama-3 8B
~16 GB
पूर्ण फाइनट्यून
Llama-3 8B
~80 GB
LoRA फाइनट्यून
Llama-3 70B
~48 GB (2×A100)
पूर्ण फाइनट्यून
Llama-3 70B
~640 GB (8×A100)
QLoRA फाइनट्यून
Llama-3 8B
~8 GB
पोर्ट्स
22
SSH
टर्मिनल पहुँच और फ़ाइल ट्रांसफ़र
8000
LitGPT इन्फ़रेंस सर्वर
मॉडल सर्विंग के लिए REST API
Docker के साथ त्वरित शुरुआत
Clore.ai पर स्थापना
चरण 1 — सर्वर किराए पर लें
पर जाएँ Clore.ai मार्केटप्लेस
इसके लिए फ़िल्टर करें VRAM ≥ 24 GB (RTX 3090 या बेहतर)
चुनें PyTorch या CUDA 12.8 बेस इमेज
पोर्ट खोलें 22 और 8000 अपने ऑर्डर सेटिंग्स में
चुनें स्टोरेज ≥ 200 GB मॉडल वेट्स के लिए
चरण 2 — SSH के माध्यम से कनेक्ट करें
चरण 3 — LitGPT इंस्टॉल करें
चरण 4 — इंस्टॉलेशन सत्यापित करें
अपेक्षित आउटपुट:
मॉडल डाउनलोड करना
LitGPT Hugging Face से मॉडल डाउनलोड करता है:
HuggingFace टोकन सेट करें
इन्फ़रेंस (Chat & Generate)
फाइनट्यूनिंग
LoRA फाइनट्यूनिंग (अनुशंसित)
LoRA छोटे-सेट adapter पैरामीटर (आमतौर पर कुल वेट्स का 0.1–1%) प्रशिक्षित करता है, जबकि बेस मॉडल frozen रहता है। 10K उदाहरणों पर Llama 3 8B LoRA को RTX 3090 पर लगभग 2 घंटे लगते हैं, के साथ r=16.
QLoRA (4-बिट + LoRA)
सीमित VRAM पर बड़े मॉडल फाइनट्यून करने के लिए QLoRA का उपयोग करें। Llama 3 8B 24 GB वाली एकल RTX 3090 पर फिट हो जाता है:
पूर्ण फाइनट्यूनिंग
Multi-GPU Training
मॉडल सर्व करना (REST API)
Python क्लाइंट
शुरुआत से प्रीट्रेनिंग
अपनी स्वयं की डेटा पर शुरुआत से कस्टम LLM प्रशिक्षित करने के लिए:
मॉडल्स को कन्वर्ट और एक्सपोर्ट करना
मॉडल्स का मूल्यांकन
Clore.ai GPU अनुशंसाएँ
Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं। आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता bare metal के रूप में अनुरोध पर बेची जाती है। देखें GPU मूल्य और उपलब्धता किसी deployment का आकार तय करने से पहले।
LitGPT तीन अलग-अलग workloads को कवर करता है — inference, LoRA finetuning, और full pretraining — जिनमें प्रत्येक की GPU आवश्यकताएँ अलग होती हैं।
इन्फ़रेंस / चैट (7–8B मॉडल)
RTX 3090
24 GB
Llama 3 8B को bf16 में फिट करता है; ~95 tok/s जनरेशन
LoRA फाइनट्यून (7–8B मॉडल)
RTX 3090
24 GB
बजट विकल्प; QLoRA VRAM को 10 GB से कम रखता है
LoRA फाइनट्यून (7–8B), तेज़ iteration
RTX 4090
24 GB
~35% 3090 से तेज़; 2 घंटे के काम को ~1.4 घंटे तक घटाता है
पूर्ण फाइनट्यून (7B) या QLoRA (70B)
A100 40 GB
40 GB
40 GB में 7B पूर्ण-परिशुद्धता या 70B 4-बिट फिट हो जाता है
पूर्ण फाइनट्यून (13B+) या प्रीट्रेन रन
A100 80 GB
80 GB
सबसे अधिक throughput; 8B पर ~2,800 tok/sec प्रशिक्षण
अधिकांश उपयोगकर्ताओं के लिए अनुशंसित: RTX 3090 की जोड़ी (2×24 GB = FSDP के साथ 48 GB प्रभावी). 70B मॉडल्स पर QLoRA, या tensor parallelism के साथ 7B मॉडल्स पर पूर्ण फाइनट्यून संभालता है. Clore.ai पर लागत: दो 3090 के लिए $0.07–0.21/घंटा.
प्रीट्रेनिंग या >70B फाइनट्यूनिंग के लिए: FSDP के साथ 4×A100 80GB का उपयोग करें. LitGPT का FSDP इंटीग्रेशन sharding को पारदर्शी रूप से संभालता है — बस पास करें --devices 4 --strategy fsdp.
समस्या निवारण
CUDA मेमोरी समाप्त
डाउनलोड विफल / HuggingFace 401
Training loss कम नहीं हो रही
सर्वर पोर्ट 8000 पहुँच योग्य नहीं है
मल्टी-GPU प्रशिक्षण अटक जाता है
उपयोगी लिंक
GitHub: https://github.com/Lightning-AI/litgpt ⭐ 12K+
दस्तावेज़ीकरण: https://lightning.ai/docs/litgpt
PyTorch Lightning: https://lightning.ai
HuggingFace मॉडल: https://huggingface.co/models
Discord: https://discord.gg/lightning-ai
Clore.ai मार्केटप्लेस: https://clore.ai/marketplace
अंतिम अपडेट
क्या यह उपयोगी था?