For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-4.7-Flash

Clore.ai पर Zhipu AI द्वारा GLM-4.7-Flash (30B MoE) डिप्लॉय करें — 59.2% SWE-bench प्रदर्शन वाला कुशल भाषा मॉडल

GLM-4.7-Flash एक 30 अरब पैरामीटर वाला Mixture-of-Experts Zhipu AI का भाषा मॉडल है जो प्रति टोकन केवल 3B पैरामीटर सक्रिय करता है। यह कोडिंग और तर्क-वितर्क कार्यों में असाधारण प्रदर्शन देता है, SWE-bench पर 59.2% हासिल करता है, जबकि FP16 इन्फरेंस के लिए केवल 10-12GB VRAM की आवश्यकता होती है। के अंतर्गत जारी किया गया MIT लाइसेंस, यह फ्रंटियर मॉडल गुणवत्ता को किफायती सिंगल-GPU लागत पर चाहने वाले डेवलपर्स के लिए एक आदर्श विकल्प है।

संक्षेप में

  • मॉडल आकार: 30B कुल / 3B सक्रिय पैरामीटर (MoE)

  • लाइसेंस: MIT (पूर्णतः व्यावसायिक)

  • संदर्भ: 128K टोकन

  • प्रदर्शन: 59.2% SWE-bench, 75.4% HumanEval

  • VRAM: ~10-12GB FP16, ~6GB INT8

  • गति: RTX 4090 पर ~45-60 tok/s

GLM-4.7-Flash क्यों?

कुशल प्रदर्शन: GLM-4.7-Flash अपने वज़न से कहीं बढ़कर प्रदर्शन करता है। केवल 3B सक्रिय पैरामीटर इस्तेमाल करने के बावजूद, यह कोडिंग बेंचमार्क्स पर कई 70B+ dense मॉडलों से बेहतर प्रदर्शन करता है। MoE आर्किटेक्चर 7B मॉडल इन्फरेंस लागत पर 30B मॉडल-स्तर की गुणवत्ता प्रदान करता है।

सिंगल-GPU के अनुकूल: बड़े मॉडलों के विपरीत, जिन्हें मल्टी-GPU सेटअप की आवश्यकता होती है, GLM-4.7-Flash एक अकेले RTX 4090 या A100 40GB पर आराम से चलता है। यह इसे डेवलपमेंट, फाइन-ट्यूनिंग और लागत-प्रभावी प्रोडक्शन डिप्लॉयमेंट के लिए एकदम उपयुक्त बनाता है।

कोडिंग विशेषज्ञ: 59.2% SWE-bench प्रदर्शन के साथ, GLM-4.7-Flash सॉफ्टवेयर इंजीनियरिंग कार्यों — कोड जनरेशन, डिबगिंग, रिफैक्टरिंग और तकनीकी दस्तावेज़ीकरण — में उत्कृष्ट है। यह गहरी संदर्भ-जागरूकता के साथ 20+ प्रोग्रामिंग भाषाओं को समझता है।

MIT लाइसेंस प्राप्त: कोई उपयोग प्रतिबंध नहीं। लाइसेंस संबंधी चिंताओं के बिना इसे व्यावसायिक रूप से डिप्लॉय, फाइन-ट्यून या संशोधित करें। पूरे वज़न और प्रशिक्षण रेसिपीज़ स्वतंत्र रूप से उपलब्ध हैं।

GPU सिफारिशें

GPU
VRAM
प्रदर्शन
दैनिक लागत*

RTX 4090

24GB

~50 tok/s

~$2.10

RTX 3090

24GB

~35 tok/s

~$1.10

A100 40GB

40GB

~80 tok/s

~$3.50

A100 80GB

80GB

~90 tok/s

~$4.00

H100

80GB

~120 tok/s

~$6.00

सर्वोत्तम मूल्य: RTX 4090, GLM-4.7-Flash के लिए प्रदर्शन और लागत का सर्वोत्तम संतुलन प्रदान करता है।

*Clore.ai बाज़ार के अनुमानित मूल्य

vLLM के साथ डिप्लॉय करें

vLLM इंस्टॉल करें

एकल GPU सेटअप

सर्वर से क्वेरी करें

SGLang के साथ डिप्लॉय करें

SGLang अक्सर MoE मॉडलों के लिए बेहतर थ्रूपुट प्रदान करता है:

Ollama के साथ परिनियोजन करें

स्थानीय विकास के लिए सरल सेटअप:

फिर REST API के माध्यम से क्वेरी करें:

Docker टेम्पलेट

बिल्ड और रन करें:

कोड जनरेशन उदाहरण

GLM-4.7-Flash जटिल कोड जनरेशन में उत्कृष्ट है:

Clore.ai उपयोगकर्ताओं के लिए सुझाव

  • मेमोरी अनुकूलन: उपयोग करें --dtype float16 VRAM उपयोग कम करने के लिए। 16GB GPUs के लिए, जोड़ें --max-model-len 16384 संदर्भ सीमित करने के लिए।

  • बैच प्रोसेसिंग: बढ़ाएँ --max-num-seqs कई अनुरोधों को सेवा देते समय अधिक थ्रूपुट के लिए।

  • क्वांटाइज़ेशन: RTX 3060/4060 (12GB) के लिए, ~6GB VRAM उपयोग हेतु AWQ या GPTQ quantized संस्करणों का उपयोग करें।

  • प्रीएम्प्शन: GLM-4.7-Flash व्यवधानों को सहजता से संभालता है — preemptible Clore.ai instances के लिए अच्छा।

  • संदर्भ लंबाई: डिफ़ॉल्ट 128K संदर्भ ज़रूरत से ज़्यादा हो सकता है। सेट करें --max-model-len 32768 अधिकांश अनुप्रयोगों के लिए।

समस्या निवारण

समस्या
समाधान

OutOfMemoryError

कम करें --max-model-len या उपयोग करें --dtype float16

मॉडल लोडिंग धीमी है

पहले से कैश करें: huggingface-cli download THUDM/glm-4-flash

इंपोर्ट त्रुटियाँ

transformers अपडेट करें: pip install transformers>=4.40.0

खराब प्रदर्शन

Flash Attention सक्षम करें: pip install flash-attn

कनेक्शन अस्वीकृत

फ़ायरवॉल जाँचें: ufw allow 8000

वैकल्पिक मॉडल

यदि GLM-4.7-Flash आपकी ज़रूरतों के अनुरूप नहीं है:

  • Qwen2.5-Coder-7B: बेहतर शुद्ध कोडिंग, छोटा फ़ुटप्रिंट

  • CodeQwen1.5-7B: चीनी + अंग्रेज़ी कोडिंग विशेषज्ञ

  • GLM-4-9B: बेहतर तर्क क्षमता वाला बड़ा भाई

  • DeepSeek-V3: सर्वोत्तम प्रदर्शन के लिए 671B MoE (मल्टी-GPU)

संसाधन

अंतिम अपडेट

क्या यह उपयोगी था?