For the complete documentation index, see llms.txt. This page is also available as Markdown.

LitGPT

LitGPT यह PyTorch Lightning पर निर्मित 20+ बड़े भाषा मॉडलों के प्रीट्रेनिंग, फाइनट्यूनिंग, और डिप्लॉयमेंट के लिए एक उच्च-प्रदर्शन लाइब्रेरी है। 12K+ GitHub stars के साथ, यह उन इंजीनियरों के लिए एक पसंदीदा टूलकिट है जिन्हें HuggingFace Transformers के abstraction overhead के बिना साफ़, हैक करने योग्य LLM प्रशिक्षण कोड चाहिए।

LitGPT में प्रत्येक मॉडल लगभग 1,000 लाइनों का साफ़ PyTorch है — 10 स्तर गहरी inheritance chains नहीं, कोई जादू नहीं। आप Llama 3 implementation को एक दोपहर में end-to-end पढ़ सकते हैं और उसे आत्मविश्वास के साथ संशोधित कर सकते हैं।


LitGPT क्या है?

LitGPT एक एकीकृत प्रशिक्षण इंटरफ़ेस के साथ state-of-the-art LLMs के production-ready implementations प्रदान करता है:

  • 20+ समर्थित मॉडल — Llama 3, Gemma 2, Mistral, Phi-3, Falcon, StableLM, और अधिक

  • शुरुआत से प्रीट्रेन करें — Flash Attention, FSDP, और gradient checkpointing के साथ पूर्ण प्रीट्रेनिंग

  • कुशलता से फाइनट्यून करें — पूर्ण फाइनट्यूनिंग, LoRA, QLoRA, और एडाप्टर विधियाँ

  • आत्मविश्वास के साथ सर्व करें — क्वांटाइज़ेशन के साथ अंतर्निहित इन्फ़रेंस सर्वर

  • मल्टी-GPU समर्थन — DDP, FSDP, tensor parallelism तुरंत उपलब्ध

  • मेमोरी-कुशल — 4-बिट क्वांटाइज़ेशन, gradient checkpointing, activation checkpointing


सर्वर आवश्यकताएँ

घटक
न्यूनतम
अनुशंसित

GPU

RTX 3090 (24 GB)

A100 80 GB / H100

VRAM

16 GB (7B LoRA)

80 GB+ (70B पूर्ण)

RAM

32 GB

64 GB+

CPU

8 कोर

16+ cores

स्टोरेज

100 GB

500 GB+

ओएस

Ubuntu 20.04+

Ubuntu 22.04

Python

3.10+

3.11

CUDA

12.8+

12.8+

कार्य के अनुसार VRAM आवश्यकताएँ

कार्य
मॉडल
VRAM

इन्फ़रेंस (4-बिट)

Llama-3 8B

~6 GB

LoRA फाइनट्यून

Llama-3 8B

~16 GB

पूर्ण फाइनट्यून

Llama-3 8B

~80 GB

LoRA फाइनट्यून

Llama-3 70B

~48 GB (2×A100)

पूर्ण फाइनट्यून

Llama-3 70B

~640 GB (8×A100)

QLoRA फाइनट्यून

Llama-3 8B

~8 GB


पोर्ट्स

पोर्ट
सेवा
नोट्स

22

SSH

टर्मिनल पहुँच और फ़ाइल ट्रांसफ़र

8000

LitGPT इन्फ़रेंस सर्वर

मॉडल सर्विंग के लिए REST API


Docker के साथ त्वरित शुरुआत


Clore.ai पर स्थापना

चरण 1 — सर्वर किराए पर लें

  1. इसके लिए फ़िल्टर करें VRAM ≥ 24 GB (RTX 3090 या बेहतर)

  2. चुनें PyTorch या CUDA 12.8 बेस इमेज

  3. पोर्ट खोलें 22 और 8000 अपने ऑर्डर सेटिंग्स में

  4. चुनें स्टोरेज ≥ 200 GB मॉडल वेट्स के लिए

चरण 2 — SSH के माध्यम से कनेक्ट करें

चरण 3 — LitGPT इंस्टॉल करें

चरण 4 — इंस्टॉलेशन सत्यापित करें

अपेक्षित आउटपुट:


मॉडल डाउनलोड करना

LitGPT Hugging Face से मॉडल डाउनलोड करता है:

HuggingFace टोकन सेट करें


इन्फ़रेंस (Chat & Generate)


फाइनट्यूनिंग

LoRA फाइनट्यूनिंग (अनुशंसित)

LoRA छोटे-सेट adapter पैरामीटर (आमतौर पर कुल वेट्स का 0.1–1%) प्रशिक्षित करता है, जबकि बेस मॉडल frozen रहता है। 10K उदाहरणों पर Llama 3 8B LoRA को RTX 3090 पर लगभग 2 घंटे लगते हैं, के साथ r=16.

QLoRA (4-बिट + LoRA)

सीमित VRAM पर बड़े मॉडल फाइनट्यून करने के लिए QLoRA का उपयोग करें। Llama 3 8B 24 GB वाली एकल RTX 3090 पर फिट हो जाता है:

पूर्ण फाइनट्यूनिंग

Multi-GPU Training


मॉडल सर्व करना (REST API)

Python क्लाइंट


शुरुआत से प्रीट्रेनिंग

अपनी स्वयं की डेटा पर शुरुआत से कस्टम LLM प्रशिक्षित करने के लिए:


मॉडल्स को कन्वर्ट और एक्सपोर्ट करना


मॉडल्स का मूल्यांकन


Clore.ai GPU अनुशंसाएँ

LitGPT तीन अलग-अलग workloads को कवर करता है — inference, LoRA finetuning, और full pretraining — जिनमें प्रत्येक की GPU आवश्यकताएँ अलग होती हैं।

वर्कलोड
GPU
VRAM
नोट्स

इन्फ़रेंस / चैट (7–8B मॉडल)

RTX 3090

24 GB

Llama 3 8B को bf16 में फिट करता है; ~95 tok/s जनरेशन

LoRA फाइनट्यून (7–8B मॉडल)

RTX 3090

24 GB

बजट विकल्प; QLoRA VRAM को 10 GB से कम रखता है

LoRA फाइनट्यून (7–8B), तेज़ iteration

RTX 4090

24 GB

~35% 3090 से तेज़; 2 घंटे के काम को ~1.4 घंटे तक घटाता है

पूर्ण फाइनट्यून (7B) या QLoRA (70B)

A100 40 GB

40 GB

40 GB में 7B पूर्ण-परिशुद्धता या 70B 4-बिट फिट हो जाता है

पूर्ण फाइनट्यून (13B+) या प्रीट्रेन रन

A100 80 GB

80 GB

सबसे अधिक throughput; 8B पर ~2,800 tok/sec प्रशिक्षण

अधिकांश उपयोगकर्ताओं के लिए अनुशंसित: RTX 3090 की जोड़ी (2×24 GB = FSDP के साथ 48 GB प्रभावी). 70B मॉडल्स पर QLoRA, या tensor parallelism के साथ 7B मॉडल्स पर पूर्ण फाइनट्यून संभालता है. Clore.ai पर लागत: दो 3090 के लिए $0.07–0.21/घंटा.

प्रीट्रेनिंग या >70B फाइनट्यूनिंग के लिए: FSDP के साथ 4×A100 80GB का उपयोग करें. LitGPT का FSDP इंटीग्रेशन sharding को पारदर्शी रूप से संभालता है — बस पास करें --devices 4 --strategy fsdp.


समस्या निवारण

CUDA मेमोरी समाप्त

डाउनलोड विफल / HuggingFace 401

Training loss कम नहीं हो रही

सर्वर पोर्ट 8000 पहुँच योग्य नहीं है

मल्टी-GPU प्रशिक्षण अटक जाता है


उपयोगी लिंक

अंतिम अपडेट

क्या यह उपयोगी था?