> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/getting-started/gpu-comparison.md).

# जीपीयू तुलना

Clore.ai पर AI वर्कलोड के लिए पूर्ण GPU तुलना गाइड

AI वर्कलोड्स के लिए CLORE.AI पर उपलब्ध GPU का संपूर्ण तुलना विवरण।

{% hint style="success" %}
पर सही GPU खोजें [CLORE.AI मार्केटप्लेस](https://clore.ai/marketplace).
{% endhint %}

## त्वरित अनुशंसा

| आपका कार्य           | किफायती विकल्प | सर्वोत्तम मूल्य | अधिकतम प्रदर्शन |
| -------------------- | -------------- | --------------- | --------------- |
| AI के साथ चैट (7B)   | RTX 3060 12GB  | RTX 3090 24GB   | RTX 5090 32GB   |
| AI के साथ चैट (70B)  | RTX 3090 24GB  | RTX 5090 32GB   | A100 80GB       |
| छवि निर्माण (SD 1.5) | RTX 3060 12GB  | RTX 3090 24GB   | RTX 5090 32GB   |
| छवि निर्माण (SDXL)   | RTX 3090 24GB  | RTX 4090 24GB   | RTX 5090 32GB   |
| छवि निर्माण (FLUX)   | RTX 3090 24GB  | RTX 5090 32GB   | A100 80GB       |
| वीडियो निर्माण       | RTX 4090 24GB  | RTX 5090 32GB   | A100 80GB       |
| मॉडल प्रशिक्षण       | A100 40GB      | A100 80GB       | H100 80GB       |

## उपभोक्ता GPU

### NVIDIA RTX 3060 12GB

**इसके लिए सर्वोत्तम:** किफायती AI, SD 1.5, छोटे LLMs

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 12GB GDDR6    |
| मेमोरी बैंडविड्थ   | 360 GB/s      |
| FP16 प्रदर्शन      | 12.7 TFLOPS   |
| टेंसर कोर          | 112 (3rd gen) |
| TDP                | 170W          |
| \~प्रति घंटा मूल्य | $0.02-0.04    |

**क्षमताएँ:**

* ✅ 7B मॉडलों के साथ Ollama (Q4)
* ✅ Stable Diffusion 1.5 (512x512)
* ✅ SDXL (768x768, धीमा)
* ⚠️ FLUX schnell (CPU ऑफ़लोड के साथ)
* ❌ बड़े मॉडल (>13B)
* ❌ वीडियो जनरेशन

***

### NVIDIA RTX 3070/3070 Ti 8GB

**इसके लिए सर्वोत्तम:** SD 1.5, हल्के कार्य

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 8GB GDDR6X    |
| मेमोरी बैंडविड्थ   | 448-608 GB/s  |
| FP16 प्रदर्शन      | 20.3 TFLOPS   |
| टेंसर कोर          | 184 (3rd gen) |
| TDP                | 220-290W      |
| \~प्रति घंटा मूल्य | $0.02-0.04    |

**क्षमताएँ:**

* ✅ 7B मॉडलों के साथ Ollama (Q4)
* ✅ Stable Diffusion 1.5 (512x512)
* ⚠️ SDXL (केवल कम रिज़ॉल्यूशन)
* ❌ FLUX (अपर्याप्त VRAM)
* ❌ मॉडल >7B
* ❌ वीडियो जनरेशन

***

### NVIDIA RTX 3080/3080 Ti 10-12GB

**इसके लिए सर्वोत्तम:** सामान्य AI कार्य, अच्छा संतुलन

| विशेष विवरण        | मान               |
| ------------------ | ----------------- |
| VRAM               | 10-12GB GDDR6X    |
| मेमोरी बैंडविड्थ   | 760-912 GB/s      |
| FP16 प्रदर्शन      | 29.8-34.1 TFLOPS  |
| टेंसर कोर          | 272-320 (3rd gen) |
| TDP                | 320-350W          |
| \~प्रति घंटा मूल्य | $0.04-0.06        |

**क्षमताएँ:**

* ✅ 13B मॉडलों के साथ Ollama
* ✅ Stable Diffusion 1.5/2.1
* ✅ SDXL (1024x1024)
* ⚠️ FLUX schnell (ऑफ़लोड के साथ)
* ❌ बड़े मॉडल (>13B)
* ❌ वीडियो जनरेशन

***

### NVIDIA RTX 3090/3090 Ti 24GB

**इसके लिए सर्वोत्तम:** SDXL, 13B-30B LLMs, ControlNet

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 24GB GDDR6X   |
| मेमोरी बैंडविड्थ   | 936 GB/s      |
| FP16 प्रदर्शन      | 35.6 TFLOPS   |
| टेंसर कोर          | 328 (3rd gen) |
| TDP                | 350-450W      |
| \~प्रति घंटा मूल्य | $0.05-0.08    |

**क्षमताएँ:**

* ✅ 30B मॉडलों के साथ Ollama
* ✅ 13B मॉडलों के साथ vLLM
* ✅ सभी Stable Diffusion मॉडल
* ✅ SDXL + ControlNet
* ✅ FLUX schnell (1024x1024)
* ⚠️ FLUX dev (ऑफ़लोड के साथ)
* ⚠️ वीडियो (छोटे क्लिप)

***

### NVIDIA RTX 4070 Ti 12GB

**इसके लिए सर्वोत्तम:** तेज़ SD 1.5, कुशल इनफ़रेंस

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 12GB GDDR6X   |
| मेमोरी बैंडविड्थ   | 504 GB/s      |
| FP16 प्रदर्शन      | 40.1 TFLOPS   |
| टेंसर कोर          | 184 (4th gen) |
| TDP                | 285W          |
| \~प्रति घंटा मूल्य | $0.04-0.06    |

**क्षमताएँ:**

* ✅ 7B मॉडलों के साथ Ollama (तेज़)
* ✅ Stable Diffusion 1.5 (बहुत तेज़)
* ✅ SDXL (768x768)
* ⚠️ FLUX schnell (सीमित रिज़ॉल्यूशन)
* ❌ बड़े मॉडल (>13B)
* ❌ वीडियो जनरेशन

***

### NVIDIA RTX 4080 16GB

**इसके लिए सर्वोत्तम:** SDXL प्रोडक्शन, 13B LLMs

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 16GB GDDR6X   |
| मेमोरी बैंडविड्थ   | 717 GB/s      |
| FP16 प्रदर्शन      | 48.7 TFLOPS   |
| टेंसर कोर          | 304 (4th gen) |
| TDP                | 320W          |
| \~प्रति घंटा मूल्य | $0.06-0.09    |

**क्षमताएँ:**

* ✅ 13B मॉडलों के साथ Ollama (तेज़)
* ✅ 7B मॉडलों के साथ vLLM
* ✅ सभी Stable Diffusion मॉडल
* ✅ SDXL + ControlNet
* ✅ FLUX schnell (1024x1024)
* ⚠️ FLUX dev (सीमित)
* ⚠️ छोटे वीडियो क्लिप

***

### NVIDIA RTX 4090 24GB

**इसके लिए सर्वोत्तम:** उच्च-स्तरीय उपभोक्ता प्रदर्शन, FLUX, वीडियो

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 24GB GDDR6X   |
| मेमोरी बैंडविड्थ   | 1008 GB/s     |
| FP16 प्रदर्शन      | 82.6 TFLOPS   |
| टेंसर कोर          | 512 (4th gen) |
| TDP                | 450W          |
| \~प्रति घंटा मूल्य | $0.08-0.12    |

**क्षमताएँ:**

* ✅ 30B मॉडलों के साथ Ollama (तेज़)
* ✅ 13B मॉडलों के साथ vLLM
* ✅ सभी छवि निर्माण मॉडल
* ✅ FLUX dev (1024x1024)
* ✅ वीडियो जनरेशन (छोटा)
* ✅ AnimateDiff
* ⚠️ 70B मॉडल (केवल Q4)

***

### NVIDIA RTX 5080 16GB *(नया — फ़रवरी 2025)*

**इसके लिए सर्वोत्तम:** तेज़ SDXL/FLUX, 13B-30B LLMs, उच्च-प्रदर्शन मिड-रेंज

| विशेष विवरण                 | मान           |
| --------------------------- | ------------- |
| VRAM                        | 16GB GDDR7    |
| मेमोरी बैंडविड्थ            | 960 GB/s      |
| FP16 प्रदर्शन               | \~80 TFLOPS   |
| टेंसर कोर                   | 336 (5th gen) |
| TDP                         | 360W          |
| \~Clore.ai प्रति घंटा मूल्य | $1.50-2.00    |

**क्षमताएँ:**

* ✅ 13B मॉडलों के साथ Ollama (तेज़)
* ✅ 13B मॉडलों के साथ vLLM
* ✅ सभी Stable Diffusion मॉडल
* ✅ SDXL + ControlNet (बहुत तेज़)
* ✅ FLUX schnell/dev (1024x1024)
* ✅ छोटे वीडियो क्लिप
* ⚠️ 30B मॉडल (केवल Q4)
* ❌ 70B मॉडल

***

### NVIDIA RTX 5090 32GB *(फ्लैगशिप — फ़रवरी 2025)*

**इसके लिए सर्वोत्तम:** अधिकतम उपभोक्ता प्रदर्शन, 70B मॉडल, उच्च-रिज़ॉल्यूशन वीडियो जनरेशन

| विशेष विवरण                 | मान           |
| --------------------------- | ------------- |
| VRAM                        | 32GB GDDR7    |
| मेमोरी बैंडविड्थ            | 1792 GB/s     |
| FP16 प्रदर्शन               | \~120 TFLOPS  |
| टेंसर कोर                   | 680 (5th gen) |
| TDP                         | 575W          |
| \~Clore.ai प्रति घंटा मूल्य | $3.00-4.00    |

**क्षमताएँ:**

* ✅ 70B मॉडलों के साथ Ollama (Q4, तेज़)
* ✅ 30B मॉडलों के साथ vLLM
* ✅ सभी छवि निर्माण मॉडल
* ✅ FLUX dev (1536x1536)
* ✅ वीडियो जनरेशन (लंबे क्लिप)
* ✅ AnimateDiff + ControlNet
* ✅ मॉडल प्रशिक्षण (LoRA, छोटे फाइन-ट्यून)
* ✅ DeepSeek-R1 32B distill (FP16)

## पेशेवर/डेटासेंटर GPU

{% hint style="warning" %}
**Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं।** आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता [bare metal](https://clore.ai/bare-metal) के रूप में अनुरोध पर बेची जाती है। देखें [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) किसी deployment का आकार तय करने से पहले।
{% endhint %}

### NVIDIA A100 40GB

**इसके लिए सर्वोत्तम:** प्रोडक्शन LLMs, प्रशिक्षण, बड़े मॉडल

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 40GB HBM2e    |
| मेमोरी बैंडविड्थ   | 1555 GB/s     |
| FP16 प्रदर्शन      | 77.97 TFLOPS  |
| टेंसर कोर          | 432 (3rd gen) |
| TDP                | 400W          |
| \~प्रति घंटा मूल्य | $0.15-0.20    |

**क्षमताएँ:**

* ✅ 70B मॉडलों के साथ Ollama (Q4)
* ✅ vLLM प्रोडक्शन सर्विंग
* ✅ सभी छवि निर्माण
* ✅ FLUX dev (उच्च गुणवत्ता)
* ✅ वीडियो जनरेशन
* ✅ मॉडल फाइन-ट्यूनिंग
* ⚠️ 70B FP16 (कसकर)

***

### NVIDIA A100 80GB

**इसके लिए सर्वोत्तम:** 70B+ मॉडल, वीडियो, प्रोडक्शन वर्कलोड

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 80GB HBM2e    |
| मेमोरी बैंडविड्थ   | 2039 GB/s     |
| FP16 प्रदर्शन      | 77.97 TFLOPS  |
| टेंसर कोर          | 432 (3rd gen) |
| TDP                | 400W          |
| \~प्रति घंटा मूल्य | $0.20-0.30    |

**क्षमताएँ:**

* ✅ 70B तक के सभी LLMs (FP16)
* ✅ vLLM उच्च-थ्रूपुट सर्विंग
* ✅ सभी छवि निर्माण
* ✅ लंबी वीडियो जनरेशन
* ✅ मॉडल प्रशिक्षण
* ✅ DeepSeek-V3 (आंशिक)
* ⚠️ 100B+ मॉडल

***

### NVIDIA H100 80GB

**इसके लिए सर्वोत्तम:** अधिकतम प्रदर्शन, सबसे बड़े मॉडल

| विशेष विवरण        | मान           |
| ------------------ | ------------- |
| VRAM               | 80GB HBM3     |
| मेमोरी बैंडविड्थ   | 3350 GB/s     |
| FP16 प्रदर्शन      | 267 TFLOPS    |
| टेंसर कोर          | 528 (4th gen) |
| TDP                | 700W          |
| \~प्रति घंटा मूल्य | $0.40-0.60    |

**क्षमताएँ:**

* ✅ अधिकतम गति के साथ सभी मॉडल
* ✅ 100B+ पैरामीटर वाले मॉडल
* ✅ मल्टी-मॉडल सर्विंग
* ✅ बड़े पैमाने पर प्रशिक्षण
* ✅ रियल-टाइम वीडियो जनरेशन
* ✅ DeepSeek-V3 (671B)

## प्रदर्शन तुलनाएँ

### LLM इनफ़रेंस (टोकन/सेकंड)

| GPU           | Llama 3 8B | Llama 3 70B | Mixtral 8x7B | Clore.ai $/घंटा |
| ------------- | ---------- | ----------- | ------------ | --------------- |
| RTX 3060 12GB | 25         | -           | -            | $0.02-0.04      |
| RTX 3090 24GB | 45         | 8\*         | 20\*         | $0.15-0.25      |
| RTX 4090 24GB | 80         | 15\*        | 35\*         | $0.35-0.55      |
| RTX 5080 16GB | 95         | -           | 40\*         | $1.50-2.00      |
| RTX 5090 32GB | 150        | 30\*        | 65\*         | $3.00-4.00      |
| A100 40GB     | 100        | 25          | 45           | $0.80-1.20      |
| A100 80GB     | 110        | 40          | 55           | $1.20-1.80      |
| H100 80GB     | 180        | 70          | 90           | $2.50-3.50      |

\*क्वांटाइज़ेशन के साथ (Q4/Q8)

### छवि जनरेशन गति

| GPU           | SD 1.5 (512) | SDXL (1024) | FLUX schnell | Clore.ai $/घंटा |
| ------------- | ------------ | ----------- | ------------ | --------------- |
| RTX 3060 12GB | 4 सेकंड      | 15 सेकंड    | 25 सेकंड\*   | $0.02-0.04      |
| RTX 3090 24GB | 2 सेकंड      | 7 सेकंड     | 12 सेकंड     | $0.15-0.25      |
| RTX 4090 24GB | 1 सेकंड      | 3 सेकंड     | 5 सेकंड      | $0.35-0.55      |
| RTX 5080 16GB | 0.8 सेकंड    | 2.5 सेकंड   | 4 सेकंड      | $1.50-2.00      |
| RTX 5090 32GB | 0.6 सेकंड    | 1.8 सेकंड   | 3 सेकंड      | $3.00-4.00      |
| A100 40GB     | 1.5 सेकंड    | 4 सेकंड     | 6 सेकंड      | $0.80-1.20      |
| A100 80GB     | 1.5 सेकंड    | 4 सेकंड     | 5 सेकंड      | $1.20-1.80      |

\*CPU ऑफ़लोड के साथ, कम रिज़ॉल्यूशन

### वीडियो जनरेशन (5 सेकंड क्लिप)

| GPU           | SVD      | Wan2.1   | Hunyuan  |
| ------------- | -------- | -------- | -------- |
| RTX 3090 24GB | 3 मिनट   | 5 मिनट\* | -        |
| RTX 4090 24GB | 1.5 मिनट | 3 मिनट   | 8 मिनट\* |
| RTX 5090 32GB | 1 मिनट   | 2 मिनट   | 5 मिनट   |
| A100 40GB     | 1 मिनट   | 2 मिनट   | 5 मिनट   |
| A100 80GB     | 45 सेकंड | 1.5 मिनट | 3 मिनट   |

\*सीमित रिज़ॉल्यूशन

## मूल्य/प्रदर्शन अनुपात

### कार्य के अनुसार सर्वोत्तम मूल्य

**चैट/LLM (7B-13B मॉडल):**

1. 🥇 RTX 3090 24GB - मूल्य/प्रदर्शन में सर्वश्रेष्ठ
2. 🥈 RTX 3060 12GB - सबसे कम लागत
3. 🥉 RTX 4090 24GB - सबसे तेज़

**छवि निर्माण (SDXL/FLUX):**

1. 🥇 RTX 3090 24GB - शानदार संतुलन
2. 🥈 RTX 4090 24GB - 2x तेज़
3. 🥉 A100 40GB - प्रोडक्शन स्थिरता

**बड़े मॉडल (70B+):**

1. 🥇 A100 40GB - 70B के लिए सर्वोत्तम मूल्य
2. 🥈 A100 80GB - पूर्ण परिशुद्धता
3. 🥉 RTX 4090 24GB - बजट विकल्प (केवल Q4)

**वीडियो जनरेशन:**

1. 🥇 A100 40GB - अच्छा संतुलन
2. 🥈 RTX 4090 24GB - उपभोक्ता विकल्प
3. 🥉 A100 80GB - सबसे लंबे क्लिप

**मॉडल प्रशिक्षण:**

1. 🥇 A100 40GB - मानक विकल्प
2. 🥈 A100 80GB - बड़े मॉडल
3. 🥉 RTX 4090 24GB - छोटे मॉडल/LoRA

## मल्टी-GPU कॉन्फ़िगरेशन

कुछ कार्यों को कई GPU से लाभ मिलता है:

| कॉन्फ़िगरेशन | उपयोग-प्रकरण             | कुल VRAM |
| ------------ | ------------------------ | -------- |
| 2x RTX 3090  | 70B इनफ़रेंस             | 48GB     |
| 2x RTX 4090  | तेज़ 70B, प्रशिक्षण      | 48GB     |
| 2x RTX 5090  | 70B FP16, तेज़ प्रशिक्षण | 64GB     |
| 4x RTX 5090  | 100B+ मॉडल               | 128GB    |
| 4x A100 40GB | 100B+ मॉडल               | 160GB    |
| 8x A100 80GB | DeepSeek-V3, Llama 405B  | 640GB    |

## अपना GPU चुनना

### निर्णय प्रवाहचार्ट

```
आपका मुख्य कार्य क्या है?
│
├─ चैट/LLM
│  ├─ मॉडल आकार?
│  │  ├─ ≤7B → RTX 3060 ($0.03–0.07/hr)
│  │  ├─ 7B-30B → RTX 3090 ($0.07–0.21/hr)
│  │  ├─ 30B-70B → RTX 5090 32GB या 2× RTX 4090
│  │  └─ 70B+ → RTX PRO 6000 96GB या 2× RTX 5090
│
├─ छवि निर्माण
│  ├─ मॉडल?
│  │  ├─ SD 1.5 → RTX 3060 ($0.03–0.07/hr)
│  │  ├─ SDXL → RTX 3090 ($0.07–0.21/hr)
│  │  └─ FLUX → RTX 4090 ($0.14–0.42/hr)
│
├─ वीडियो जनरेशन
│  ├─ लंबाई?
│  │  ├─ छोटा (2-5 सेकंड) → RTX 4090 ($0.14–0.42/hr)
│  │  └─ लंबा → 2× RTX 4090 या RTX PRO 6000
│
└─ प्रशिक्षण
   ├─ LoRA/छोटा → RTX 4090 ($0.14–0.42/hr)
   └─ पूर्ण फाइन-ट्यून → 2× RTX 4090 या RTX PRO 6000
```

## पैसे बचाने के सुझाव

1. **स्पॉट ऑर्डर का उपयोग करें** - लगभग एक-तिहाई सर्वर कीमतों में स्पॉट, ऑन-डिमांड से कम होते हैं, मध्यिका \~13% छूट
2. **छोटे से शुरू करें** - पहले सस्ते GPU पर परीक्षण करें
3. **मॉडल क्वांटाइज़ करें** - Q4/Q8 कम VRAM में बड़े मॉडल फिट कर देता है
4. **बैच प्रोसेसिंग** - एक साथ कई अनुरोधों को प्रोसेस करें
5. **ऑफ़-पीक घंटे** - बेहतर उपलब्धता और कभी-कभी कम कीमतें

> 📚 यह भी देखें: [2025 में AI प्रशिक्षण के लिए 10 सबसे सस्ते GPU](https://blog.clore.ai/top-10-cheapest-gpus-for-ai-training/) | [AI प्रशिक्षण के लिए सर्वोत्तम GPU — विस्तृत मार्गदर्शिका](https://blog.clore.ai/best-gpu-for-ai-training/)

## अगले चरण

* [मॉडल संगतता मैट्रिक्स](/guides/guides_v2-hi/getting-started/model-compatibility.md) - कौन-से मॉडल किन GPU पर चलते हैं
* [डॉकर इमेज कैटलॉग](/guides/guides_v2-hi/getting-started/docker-images.md) - तैयार-से-उपयोग इमेज
* [त्वरित शुरुआत मार्गदर्शिका](/guides/guides_v2-hi/quickstart.md) - 5 मिनट में शुरू करें


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/getting-started/gpu-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
