For the complete documentation index, see llms.txt. This page is also available as Markdown.

फ़ाइन-ट्यूनिंग टूल्स तुलना

Clore.ai GPU सर्वरों पर LLMs को प्रशिक्षित करने के लिए सही fine-tuning framework चुनें।

फाइन-ट्यूनिंग एक पूर्व-प्रशिक्षित LLM को आपके विशिष्ट कार्य या डोमेन के अनुसार अनुकूलित करती है। यह गाइड चार प्रमुख ओपन-सोर्स टूल्स की तुलना करती है: Unsloth, Axolotl, LLaMA-Factory, और TRL — गति, मेमोरी दक्षता, समर्थित मॉडल, और उपयोग में आसानी को कवर करते हुए।


त्वरित निर्णय मैट्रिक्स

Unsloth
Axolotl
LLaMA-Factory
TRL

इसके लिए सर्वश्रेष्ठ

गति + मेमोरी

कॉन्फ़िगरेशन-आधारित प्रशिक्षण

शुरुआती लोगों के लिए अनुकूल

अनुसंधान + RLHF

गति बनाम आधाररेखा

2-5× तेज

~1× (मानक)

~1× (मानक)

~1× (मानक)

मेमोरी में कमी

70-80% कम

QLoRA मानक

QLoRA मानक

मानक

RLHF/DPO/PPO

बेसिक

✅ (मूल)

वेबUI

GitHub स्टार्स

23K+

9K+

37K+

10K+

लाइसेंस

LGPL (गैर-व्यावसायिक उपयोग के लिए मुफ्त)

Apache 2.0

Apache 2.0

Apache 2.0


अवलोकन

Unsloth

Unsloth का पूरा ध्यान एक ही चीज़ पर है: फाइन-ट्यूनिंग को जितना संभव हो उतना तेज़ और मेमोरी-कुशल बनाना। यह Triton में प्रमुख ऑपरेशनों को पुनर्लेखित करता है और CUDA kernels को अनुकूलित करता है।

दर्शन: अधिकतम गति, न्यूनतम VRAM — कोई समझौता नहीं।

Axolotl

Axolotl HuggingFace Transformers को YAML-आधारित कॉन्फ़िगरेशन सिस्टम के साथ लपेटता है। यह प्रशिक्षण सेटअप की जटिलता को संभालता है ताकि आप डेटा और हाइपरपैरामीटर्स पर ध्यान दे सकें।

दर्शन: सब कुछ YAML में, नीचे पूरी लचीलापन।

LLaMA-Factory

LLaMA-Factory सबसे व्यापक मॉडल रेंज (100+) और प्रशिक्षण विधियों को सपोर्ट करता है, साथ ही कॉन्फ़िगरेशन के लिए एक वेब UI भी देता है। यह गैर-शोधकर्ताओं के लिए सबसे सुलभ विकल्प है।

दर्शन: सब कुछ काम करता है, सभी के लिए।

TRL (Transformer Reinforcement Learning)

TRL HuggingFace की आधिकारिक RLHF लाइब्रेरी है। यह PPO, DPO, ORPO, और अन्य alignment training methods के लिए मानक है।

दर्शन: अनुसंधान-प्रथम, alignment training मूल रूप से शामिल।


गति बेंचमार्क

प्रशिक्षण गति तुलना (tokens/second)

टेस्ट सेटअप: LLaMA 3.1 8B, LoRA r=16, 4-बिट क्वांटाइज़ेशन, बैच साइज़ 4, A100 80GB

टूल
टोकन/सेकंड
बनाम आधाररेखा
मेमोरी (VRAM)

Unsloth (4-बिट)

~4,200

2.8×

~8GB

Axolotl (QLoRA)

~1,500

1.0×

~16GB

LLaMA-Factory (QLoRA)

~1,480

~1.0×

~16GB

TRL (QLoRA)

~1,450

~0.97×

~18GB

Unsloth (पूर्ण 16-बिट)

~2,800

1.9×

~22GB

VRAM उपयोग तुलना

LLaMA 3.1 8B को प्रशिक्षित करते समय, अनुक्रम लंबाई 2048:

विधि
Unsloth
Axolotl
LLaMA-Factory
TRL

पूर्ण fine-tune (bf16)

60GB

70GB

72GB

74GB

LoRA (bf16)

18GB

24GB

25GB

26GB

QLoRA (4-बिट)

8GB

16GB

16GB

18GB

QLoRA (4-बिट, लंबा ctx)

12GB

24GB

24GB

26GB

8B मॉडल के लिए न्यूनतम GPU:

  • Unsloth: RTX 3080 (10GB) ✅

  • अन्य: RTX 3090 (24GB) आवश्यक


समर्थित मॉडल

मॉडल समर्थन मैट्रिक्स

मॉडल परिवार
Unsloth
Axolotl
LLaMA-Factory
TRL

LLaMA 3.x

LLaMA 2

Mistral

Mixtral MoE

Gemma 2

Phi-3/3.5

Qwen 2.5

DeepSeek

Falcon

GPT-NeoX

आंशिक

T5/FLAN

BERT/RoBERTa

विज़न LLMs

आंशिक

आंशिक

प्रशिक्षण विधि समर्थन

विधि
Unsloth
Axolotl
LLaMA-Factory
TRL

पूर्ण फाइन-ट्यून

LoRA

QLoRA

DoRA

PEFT

SFT

✅ (मूल)

DPO

✅ (मूल)

PPO

✅ (मूल)

ORPO

KTO

✅ (मूल)

GRPO

CPT (निरंतर pretraining)


Unsloth: गहन विश्लेषण

इसे तेज़ क्या बनाता है

  1. Triton kernels: Flash Attention, cross-entropy loss, और LoRA को Triton में पुनर्लेखित करता है

  2. फ्यूज्ड ऑपरेशन्स: कई CUDA ops को एक kernel में जोड़ता है

  3. स्मार्ट gradient checkpointing: "unsloth" mode ~30% अधिक मेमोरी बचाता है

  4. कुशल backprop: बड़े मध्यवर्ती tensors को materialize करने से बचता है

Clore.ai पर स्थापना

पूर्ण प्रशिक्षण स्क्रिप्ट

कमज़ोरियाँ: कोई PPO नहीं, केवल समर्थित मॉडल सूची तक सीमित, LGPL लाइसेंस (व्यावसायिक उपयोग के लिए जाँचें)


Axolotl: गहन विश्लेषण

कॉन्फ़िगरेशन-प्रथम दृष्टिकोण

जब आप पुनरुत्पादनीय, संस्करण-नियंत्रित प्रशिक्षण कॉन्फ़िगरेशन चाहते हैं, तब Axolotl चमकता है:

इसके लिए सर्वश्रेष्ठ: जो टीमें पुनरुत्पादनीय, config-versioned training runs चाहती हैं


LLaMA-Factory: गहन विश्लेषण

WebUI वॉकथ्रू

WebUI टैब्स:

  1. ट्रेन — base model, dataset, method कॉन्फ़िगर करें

  2. मूल्यांकन करें — MMLU, CMMLU बेंचमार्क चलाएँ

  3. चैट — इंटरैक्टिव inference

  4. एक्सपोर्ट — LoRA को merge करें, GGUF में quantize करें

CLI प्रशिक्षण उदाहरण

इसके लिए सर्वश्रेष्ठ: शुरुआती लोग, वे टीमें जो WebUI चाहती हैं, बिना गहरे शोध ज्ञान के DPO/RLHF


TRL: गहन विश्लेषण

RLHF पाइपलाइन उदाहरण

TRL alignment training के लिए पसंदीदा टूल है:

इसके लिए सर्वश्रेष्ठ: alignment research, RLHF, DPO, PPO, ORPO implementations


सही टूल चुनना

निर्णय प्रवाह

टीम प्रकार के अनुसार

टीम
सिफारिश
कारण

व्यक्तिगत शोधकर्ता

Unsloth

गति + Jupyter notebooks

ML engineer

Axolotl

कॉन्फ़िग-चालित, पुनरुत्पादनीय

उत्पाद टीम

LLaMA-Factory

WebUI, व्यापक मॉडल समर्थन

alignment टीम

TRL

मूल RLHF primitives

स्टार्टअप

Unsloth + TRL

ज़रूरत पड़ने पर गति + alignment


Clore.ai GPU अनुशंसाएँ

कार्य
न्यूनतम GPU
अनुशंसित
टूल

7-8B LoRA (QLoRA)

RTX 3080 (10GB)

RTX 3090

Unsloth

13B LoRA

RTX 3090 (24GB)

A6000 (48GB)

Unsloth/Axolotl

70B LoRA

A100 (80GB)

2×A100

Axolotl/TRL

8B पूर्ण FT

A100 (40GB)

A100 (80GB)

कोई भी

DPO/PPO 7B

RTX 4090 (24GB)

A6000 (48GB)

TRL


उपयोगी लिंक


सारांश

टूल
इसके लिए सर्वश्रेष्ठ
मुख्य लाभ

Unsloth

गति-महत्वपूर्ण प्रशिक्षण, छोटे GPUs

2-5× तेज, 70% कम VRAM

Axolotl

कॉन्फ़िग-चालित, पुनरुत्पादनीय रन

YAML-first, कई डेटा formats

LLaMA-Factory

100+ मॉडल, WebUI, शुरुआती लोग

सबसे अधिक मॉडल समर्थन, GUI

TRL

RLHF, DPO, alignment research

मूल alignment training

अधिकांश Clore.ai उपयोग मामलों के लिए: शुरू करें Unsloth (गति + मेमोरी दक्षता), जोड़ें TRL यदि आपको DPO या PPO alignment training की आवश्यकता हो।

अंतिम अपडेट

क्या यह उपयोगी था?