For the complete documentation index, see llms.txt. This page is also available as Markdown.

Dia TTS (Nari Labs)

Nari Labs द्वारा Dia TTS के साथ भावना सहित बहु-प्रवक्ता संवाद जनरेट करें

Nari Labs का Dia एक उन्नत टेक्स्ट-टू-स्पीच मॉडल है जो इसमें विशेषज्ञ है यथार्थवादी बहु-वक्ता संवाद. पारंपरिक TTS के विपरीत, जो एक समय में एक ही वक्ता को संभालता है, Dia भावना, हँसी, हिचकिचाहट और अन्य गैर-मौखिक संकेतों के साथ कई वक्ताओं के बीच स्वाभाविक बातचीत उत्पन्न करता है। 1.6B पैरामीटर के साथ, यह किसी भी 8GB+ GPU पर चलता है।

मुख्य विशेषताएँ

  • बहु-वक्ता संवाद: एक ही पास में 2+ वक्ताओं के बीच बातचीत उत्पन्न करें

  • गैर-मौखिक संकेत: हँसी (हँसता है), हिचकिचाहट (आह भरता है), ठहराव — स्वतः अंतर्निहित

  • भावनात्मक वाणी: स्पष्ट भावना टैग के बिना स्वाभाविक उतार-चढ़ाव

  • 1.6B पैरामीटर: RTX 3070/3080 (8-10GB VRAM) पर फिट हो जाता है

  • Apache 2.0 लाइसेंस: पूर्ण व्यावसायिक उपयोग

  • HuggingFace एकीकरण: Transformers लाइब्रेरी के साथ काम करता है

आवश्यकताएँ

घटक
न्यूनतम
अनुशंसित

GPU

RTX 3070 (8GB)

RTX 3080 (10GB)

VRAM

8GB

10GB+

RAM

16GB

32GB

डिस्क

10GB

15GB

Python

3.9+

3.11

अनुशंसित Clore.ai GPU: RTX 3080 10GB ($0.05–0.19/घंटा)

इंस्टॉलेशन

त्वरित शुरुआत

मूल बहु-वक्ता संवाद

भावना और गैर-मौखिक संकेतों के साथ

एकल वक्ता

Gradio वेब UI

उपयोग के मामले

  • पॉडकास्ट जेनरेशन: स्क्रिप्ट से संवादात्मक पॉडकास्ट बनाएं

  • ऑडियोबुक संवाद: अलग-अलग आवाज़ों के साथ पात्रों की बातचीत उत्पन्न करें

  • गेम संवाद: स्वाभाविक भाषण पैटर्न के साथ NPC बातचीत

  • प्रशिक्षण डेटा: ASR प्रशिक्षण के लिए विविध भाषण डेटासेट उत्पन्न करें

  • चैटबॉट आवाज़ें: भावनात्मक प्रतिक्रियाओं के साथ बहु-चरणीय संवाद

Clore.ai उपयोगकर्ताओं के लिए सुझाव

  • RTX 3080 आदर्श है: 10GB VRAM $0.05–0.19/घंटा पर Dia को आसानी से संभालता है

  • बैच जनरेशन: अपने किराये के समय को अधिकतम करने के लिए लूप में कई संवादों को संसाधित करें

  • मॉडल्स को स्थायी संग्रहण में सहेजें: यदि आपके Clore इंस्टेंस में स्थायी डिस्क है, तो दोबारा डाउनलोड से बचने के लिए मॉडल को कैश करें

  • तापमान 0.7–0.9: कम = अधिक सुसंगत, अधिक = अधिक अभिव्यंजक/विविध

  • केवल अंग्रेज़ी: Dia वर्तमान में अंग्रेज़ी पर केंद्रित है — बहुभाषी के लिए Qwen3-TTS गाइड देखें

समस्या निवारण

समस्या
समाधान

CUDA out of memory

उपयोग करें model.to("cuda", torch_dtype=torch.float16) हाफ प्रिसीजन के लिए

वक्ताओं की आवाज़ें समान लगती हैं

प्रति वक्ता अधिक पाठ/संदर्भ जोड़ें; उच्च तापमान आज़माएँ

गैर-मौखिक संकेत अनदेखे हैं

सही प्रारूप सुनिश्चित करें: (हँसता है), (आह भरता है) कोष्ठकों में

ऑडियो गुणवत्ता कम

बढ़ाएँ num_steps यदि उपलब्ध हो तो पैरामीटर; 24kHz सैंपल रेट सुनिश्चित करें

अधिक पढ़ें

अंतिम अपडेट

क्या यह उपयोगी था?