For the complete documentation index, see llms.txt. This page is also available as Markdown.

अवलोकन

CLORE.AI GPUs पर inference और चैट अनुप्रयोगों के लिए बड़े भाषा मॉडल (LLMs) चलाएँ।

लोकप्रिय उपकरण

टूल
उपयोग-प्रकरण
कठिनाई

LLM सेटअप का सबसे आसान तरीका

शुरुआती

ChatGPT जैसा इंटरफ़ेस

शुरुआती

उच्च-थ्रूपुट वाला प्रोडक्शन सर्विंग

मध्यम

कुशल GGUF इन्फ़रेंस

आसान

सुविधाओं से भरपूर चैट UI

आसान

सबसे तेज़ EXL2 इन्फ़रेंस

मध्यम

OpenAI-संगत API

मध्यम

तेज़ संरचित जनरेशन

मध्यम

HuggingFace सर्विंग समाधान

मध्यम

MMlab सर्विंग टूलकिट

मध्यम

अतिरिक्त सुविधाओं वाला vLLM फोर्क

मध्यम

मशीन लर्निंग संकलन

कठिन

एकीकृत API प्रॉक्सी

मध्यम

स्पार्स मॉडल इन्फ़रेंस

कठिन

Rust-आधारित इन्फ़रेंस इंजन

मध्यम

मॉडल गाइड

नवीनतम और सर्वश्रेष्ठ मॉडल

मॉडल
पैरामीटर
लाइसेंस
इस पर फिट बैठता है

27B dense

Apache 2.0

1× RTX 4090 (Q4)

119B / 6.5B सक्रिय

Apache 2.0

2× RTX 4090 (Q2)

~750B / 40B सक्रिय

MIT

10× RTX 5090 (Q2)

Flash 167GB · Pro 893GB

MIT

6–8× RTX 5090 (Flash)

428B / 23B सक्रिय

minimax-community

6–8× RTX 5090 (Q2–Q3)

550B / 55B सक्रिय

OpenMDW-1.1

4× RTX PRO 6000 (NVFP4)

2.8T

Kimi K3 लाइसेंस

मार्केटप्लेस पर कुछ नहीं

744B / 40B सक्रिय

MIT

बड़े रिग्स

Scout & Maverick

Llama समुदाय

1× RTX 4090 (Scout Q4)

671B MoE

MIT

बड़े रिग्स

0.5B–72B

Apache 2.0

कोई भी कार्ड

विशेषीकृत मॉडल

मॉडल
पैरामीटर
किसके लिए सर्वोत्तम

6.7B-33B

कोड जनरेशन

7B-34B

कोड पूर्णता

4.7B

तेज़ चीनी/अंग्रेज़ी

जल्द घोषित किया जाएगा

Zhipu AI का नवीनतम

जल्द घोषित किया जाएगा

Moonshot AI मॉडल

1T

विशाल ओपन-सोर्स LLM

24B

Liquid AI मॉडल

जल्द घोषित किया जाएगा

तेज़ इन्फ़रेंस मॉडल

कुशल मॉडल

मॉडल
पैरामीटर
किसके लिए सर्वोत्तम

2B-27B

कुशल इन्फ़रेंस

जल्द घोषित किया जाएगा

Google का नवीनतम कॉम्पैक्ट

14B

छोटा लेकिन सक्षम

7B / 8x7B

सामान्य प्रयोजन

675B MoE

एंटरप्राइज़-स्तरीय

जल्द घोषित किया जाएगा

Mistral का कुशल संस्करण

GPU सिफारिशें

मॉडल आकार
न्यूनतम GPU
अनुशंसित
Clore.ai लागत

7B (Q4)

RTX 3060 12GB

RTX 3090

$0.03–0.21/घंटा

13B (Q4)

RTX 3090 24GB

RTX 4090

$0.07–0.42/घंटा

27B (Q4)

RTX 3090 24GB

RTX 4090 / 5090

$0.07–0.77/घंटा

34B (Q4)

2× RTX 3090

1× RTX 5090

$0.14–0.77/घंटा

70B (Q4)

2× RTX 5090

1× RTX PRO 6000 96GB

$0.50–1.54/hr

120B+ (Q2)

2× RTX 4090

2× RTX 5090

$0.28–1.54/घंटा

400B+ (Q2)

8× RTX 5090

4× RTX PRO 6000

~$2.00–5.00/घंटा

क्वांटाइज़ेशन गाइड

फ़ॉर्मेट
VRAM उपयोग
गुणवत्ता
गति

Q2_K

सबसे कम

खराब

सबसे तेज़

Q4_K_M

कम

अच्छा

तेज़

Q5_K_M

मध्यम

उत्कृष्ट

मध्यम

Q8_0

उच्च

उत्कृष्ट

धीमा

FP16

सर्वोच्च

सर्वोत्तम

सबसे धीमा

यह भी देखें

अंतिम अपडेट

क्या यह उपयोगी था?