For the complete documentation index, see llms.txt. This page is also available as Markdown.

StyleTTS2

Clore.ai GPUs पर Style diffusion के ज़रिए StyleTTS2 मानव-स्तर टेक्स्ट-टू-स्पीच चलाएँ

StyleTTS2 LJSpeech और LibriTTS बेंचमार्क पर ग्राउंड-ट्रुथ रिकॉर्डिंग्स से ऊपर मानव-मूल्यांकित स्वाभाविकता स्कोर प्राप्त करता है (MOS 4.55 बनाम 4.23 ग्राउंड ट्रुथ)। यह उपयोग करता है स्टाइल डिफ्यूज़न और प्रतिकूल प्रशिक्षण बोलने की शैलियों को एक गुप्त चर वितरण के रूप में मॉडल करने के लिए, जिससे एक छोटे संदर्भ क्लिप से अभिव्यक्तिपूर्ण सिंथेसिस और ज़ीरो-शॉट स्पीकर अनुकूलन संभव होता है।

पारंपरिक TTS प्रणालियों के विपरीत, StyleTTS2 एक छोटे संदर्भ ऑडियो क्लिप के साथ अनदेखे स्पीकर्स पर सामान्यीकरण कर सकता है, और ऐसा भाषण उत्पन्न करता है जो पेशेवर वॉयस कलाकारों को टक्कर देता है। इसे कई डेटासेट्स पर मानव-मूल्यांकित स्वाभाविकता स्कोर से अधिक प्रदर्शन करने के लिए बेंचमार्क किया गया है — ओपन-सोर्स TTS के लिए यह पहली बार है।

मुख्य विशेषताएँ:

  • मानव-स्तरीय स्वाभाविकता — LJSpeech पर मानव MOS स्कोर से आगे

  • ज़ीरो-शॉट स्पीकर अनुकूलन — किसी भी आवाज़ को एक छोटे ऑडियो नमूने से क्लोन करें

  • स्टाइल डिफ्यूज़न — अभिव्यंजक, विविध प्रोसोडी और बोलने की शैली

  • मल्टी-स्पीकर समर्थन — LibriTTS (2,300+ स्पीकर्स) पर प्रशिक्षित

  • हल्का इन्फ़रेंस — उपभोक्ता GPU पर कुशलतापूर्वक चलता है


सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

GPU

NVIDIA RTX 3070 (8 GB)

NVIDIA RTX 4090 (24 GB)

VRAM

6 GB

12–24 GB

RAM

16 GB

32 GB

CPU

4 कोर

8+ कोर

डिस्क

15 GB

30 GB

ओएस

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.7+

12.1+

Python

3.8+

3.10

पोर्ट्स

22, 7860

22, 7860

StyleTTS2 अपेक्षाकृत हल्का है — RTX 3070 या 3080 रीयल-टाइम इन्फ़रेंस को आराम से संभाल लेते हैं। बैच प्रोसेसिंग या एक साथ कई उपयोगकर्ताओं को सेवा देने के लिए, 4090 या A100 का उपयोग करें।


CLORE.AI पर त्वरित परिनियोजन

StyleTTS2 के लिए एक कस्टम Docker बिल्ड की आवश्यकता होती है क्योंकि कोई आधिकारिक पूर्व-निर्मित इमेज उपलब्ध नहीं है। सेटअप में लगभग 10 मिनट लगते हैं।

1. एक उपयुक्त सर्वर खोजें

पर जाएँ CLORE.AI मार्केटप्लेस और इनके अनुसार फ़िल्टर करें:

  • VRAM: ≥ 6 GB

  • GPU: RTX 3070, 3080, 3090, 4080, 4090, A100

  • डिस्क: ≥ 20 GB

2. अपना परिनियोजन कॉन्फ़िगर करें

Docker इमेज (बेस):

पोर्ट मैपिंग:

स्टार्टअप कमांड:

3. इंटरफ़ेस तक पहुँचें


चरण-दर-चरण सेटअप

चरण 1: अपने सर्वर में SSH करें

चरण 2: सिस्टम निर्भरताएँ इंस्टॉल करें

चरण 3: StyleTTS2 रिपॉज़िटरी क्लोन करें

चरण 4: Python वर्चुअल वातावरण बनाएं

चरण 5: निर्भरताएँ इंस्टॉल करें

चरण 6: पूर्व-प्रशिक्षित मॉडल डाउनलोड करें

चरण 7: Dockerfile बनाएं और चलाएँ

चरण 8: Gradio डेमो सीधे लॉन्च करें

इस पर पहुँचें http://<server-ip>:7860


उपयोग के उदाहरण

उदाहरण 1: Python API के माध्यम से बुनियादी TTS


उदाहरण 2: ज़ीरो-शॉट वॉयस क्लोनिंग


उदाहरण 3: अभिव्यंजक शैली नियंत्रण


उदाहरण 4: Gradio वेब इंटरफ़ेस


उदाहरण 5: बैच ऑडियोबुक जनरेशन


कॉन्फ़िगरेशन

config.yml के मुख्य पैरामीटर

इन्फ़रेंस पैरामीटर

पैरामीटर
सीमा
डिफ़ॉल्ट
प्रभाव

diffusion_steps

1–30

10

गुणवत्ता बनाम गति समझौता

alpha

0.0–1.0

0.3

संदर्भ से ध्वनिक शैली का भार

beta

0.0–1.0

0.7

संदर्भ से प्रोसोडिक शैली का भार

embedding_scale

1.0–3.0

1.5

कुल शैली तीव्रता

t

0.6–1.0

0.7

शोर स्तर (अधिक = अधिक विविधता)


प्रदर्शन सुझाव

1. डिफ्यूज़न चरणों का अनुकूलन करें

10 चरणों का डिफ़ॉल्ट गुणवत्ता और गति के बीच संतुलन बनाता है। रीयल-टाइम अनुप्रयोगों के लिए 5 चरणों का उपयोग करें; अधिकतम गुणवत्ता के लिए 20–30 का उपयोग करें।

2. torch.compile का उपयोग करें (PyTorch 2.0+)

3. मिश्रित-सटीकता इन्फ़रेंस

4. कई वाक्यों को बैच करें

जहाँ संभव हो, GPU उपयोग को अधिकतम करने और ओवरहेड कम करने के लिए कई वाक्यों को एक साथ संसाधित करें।

5. संदर्भ स्पीकर एम्बेडिंग कैश करें


समस्या निवारण

समस्या: espeak-ng नहीं मिला

समस्या: Phonemizer विफल होता है

समस्या: CUDA मेमोरी समाप्त

समस्या: ऑडियो गुणवत्ता खराब

  • बढ़ाएँ diffusion_steps 15–20 तक

  • सुनिश्चित करें कि संदर्भ ऑडियो साफ़ हो, कम से कम 16kHz

  • समायोजित करने का प्रयास करें alpha और beta पैरामीटर

  • एक लंबा संदर्भ ऑडियो क्लिप उपयोग करें (15–30 सेकंड)

समस्या: Hugging Face से मॉडल डाउनलोड विफल होता है


Clore.ai GPU अनुशंसाएँ

StyleTTS2 एक हल्का मॉडल है — LibriTTS चेकपॉइंट लगभग 300MB का है, और साधारण GPU पर भी इन्फ़रेंस तेज़ है।

GPU
VRAM
Clore.ai मूल्य
इन्फ़रेंस गति
किसके लिए सर्वोत्तम

केवल CPU

~$0.02/hr

~0.5× रीयल-टाइम

विकास, परीक्षण

RTX 3090

24 GB

$0.07–0.21/hr

~15× रीयल-टाइम

प्रोडक्शन API, वॉयस क्लोनिंग

RTX 4090

24 GB

$0.14–0.42/hr

~25× रीयल-टाइम

उच्च-सहवर्ती API

A100 40GB

40 GB

~40× रीयल-टाइम

बड़े-प्रमाण पर बैच ऑडियोबुक जनरेशन

$0.07–0.21/घंटा पर RTX 3090 StyleTTS2 के लिए सबसे उपयुक्त विकल्प है। मॉडल इतना छोटा है कि GPU समय पर आपका खर्च लगभग नगण्य होता है — सिंथेसाइज़ किए गए ऑडियो का पूरा एक घंटा GPU किराये में $0.01 से कम पड़ता है। ऑडियोबुक उत्पादन या वॉयस क्लोनिंग सेवाओं के लिए, यह बेहद किफायती है।

ज़ीरो-शॉट वॉयस क्लोनिंग गुणवत्ता सुझाव: 22kHz या 24kHz पर 15–30 सेकंड का साफ़ संदर्भ ऑडियो दें। स्टाइल डिफ्यूज़न मॉड्यूल को बोलने की शैली, गति और प्रोसोडी को सही तरह कैप्चर करने के लिए पर्याप्त ऑडियो की आवश्यकता होती है। शोरयुक्त या छोटे संदर्भ आउटपुट गुणवत्ता को काफ़ी घटा देते हैं।


लिंक्स

अंतिम अपडेट

क्या यह उपयोगी था?