StyleTTS2
Clore.ai GPUs पर Style diffusion के ज़रिए StyleTTS2 मानव-स्तर टेक्स्ट-टू-स्पीच चलाएँ
StyleTTS2 LJSpeech और LibriTTS बेंचमार्क पर ग्राउंड-ट्रुथ रिकॉर्डिंग्स से ऊपर मानव-मूल्यांकित स्वाभाविकता स्कोर प्राप्त करता है (MOS 4.55 बनाम 4.23 ग्राउंड ट्रुथ)। यह उपयोग करता है स्टाइल डिफ्यूज़न और प्रतिकूल प्रशिक्षण बोलने की शैलियों को एक गुप्त चर वितरण के रूप में मॉडल करने के लिए, जिससे एक छोटे संदर्भ क्लिप से अभिव्यक्तिपूर्ण सिंथेसिस और ज़ीरो-शॉट स्पीकर अनुकूलन संभव होता है।
पारंपरिक TTS प्रणालियों के विपरीत, StyleTTS2 एक छोटे संदर्भ ऑडियो क्लिप के साथ अनदेखे स्पीकर्स पर सामान्यीकरण कर सकता है, और ऐसा भाषण उत्पन्न करता है जो पेशेवर वॉयस कलाकारों को टक्कर देता है। इसे कई डेटासेट्स पर मानव-मूल्यांकित स्वाभाविकता स्कोर से अधिक प्रदर्शन करने के लिए बेंचमार्क किया गया है — ओपन-सोर्स TTS के लिए यह पहली बार है।
मुख्य विशेषताएँ:
मानव-स्तरीय स्वाभाविकता — LJSpeech पर मानव MOS स्कोर से आगे
ज़ीरो-शॉट स्पीकर अनुकूलन — किसी भी आवाज़ को एक छोटे ऑडियो नमूने से क्लोन करें
स्टाइल डिफ्यूज़न — अभिव्यंजक, विविध प्रोसोडी और बोलने की शैली
मल्टी-स्पीकर समर्थन — LibriTTS (2,300+ स्पीकर्स) पर प्रशिक्षित
हल्का इन्फ़रेंस — उपभोक्ता GPU पर कुशलतापूर्वक चलता है
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
GPU
NVIDIA RTX 3070 (8 GB)
NVIDIA RTX 4090 (24 GB)
VRAM
6 GB
12–24 GB
RAM
16 GB
32 GB
CPU
4 कोर
8+ कोर
डिस्क
15 GB
30 GB
ओएस
Ubuntu 20.04+
Ubuntu 22.04
CUDA
11.7+
12.1+
Python
3.8+
3.10
पोर्ट्स
22, 7860
22, 7860
CLORE.AI पर त्वरित परिनियोजन
StyleTTS2 के लिए एक कस्टम Docker बिल्ड की आवश्यकता होती है क्योंकि कोई आधिकारिक पूर्व-निर्मित इमेज उपलब्ध नहीं है। सेटअप में लगभग 10 मिनट लगते हैं।
1. एक उपयुक्त सर्वर खोजें
पर जाएँ CLORE.AI मार्केटप्लेस और इनके अनुसार फ़िल्टर करें:
VRAM: ≥ 6 GB
GPU: RTX 3070, 3080, 3090, 4080, 4090, A100
डिस्क: ≥ 20 GB
2. अपना परिनियोजन कॉन्फ़िगर करें
Docker इमेज (बेस):
पोर्ट मैपिंग:
स्टार्टअप कमांड:
3. इंटरफ़ेस तक पहुँचें
चरण-दर-चरण सेटअप
चरण 1: अपने सर्वर में SSH करें
चरण 2: सिस्टम निर्भरताएँ इंस्टॉल करें
चरण 3: StyleTTS2 रिपॉज़िटरी क्लोन करें
चरण 4: Python वर्चुअल वातावरण बनाएं
चरण 5: निर्भरताएँ इंस्टॉल करें
चरण 6: पूर्व-प्रशिक्षित मॉडल डाउनलोड करें
चरण 7: Dockerfile बनाएं और चलाएँ
चरण 8: Gradio डेमो सीधे लॉन्च करें
इस पर पहुँचें http://<server-ip>:7860
उपयोग के उदाहरण
उदाहरण 1: Python API के माध्यम से बुनियादी TTS
उदाहरण 2: ज़ीरो-शॉट वॉयस क्लोनिंग
उदाहरण 3: अभिव्यंजक शैली नियंत्रण
उदाहरण 4: Gradio वेब इंटरफ़ेस
उदाहरण 5: बैच ऑडियोबुक जनरेशन
कॉन्फ़िगरेशन
config.yml के मुख्य पैरामीटर
इन्फ़रेंस पैरामीटर
diffusion_steps
1–30
10
गुणवत्ता बनाम गति समझौता
alpha
0.0–1.0
0.3
संदर्भ से ध्वनिक शैली का भार
beta
0.0–1.0
0.7
संदर्भ से प्रोसोडिक शैली का भार
embedding_scale
1.0–3.0
1.5
कुल शैली तीव्रता
t
0.6–1.0
0.7
शोर स्तर (अधिक = अधिक विविधता)
प्रदर्शन सुझाव
1. डिफ्यूज़न चरणों का अनुकूलन करें
10 चरणों का डिफ़ॉल्ट गुणवत्ता और गति के बीच संतुलन बनाता है। रीयल-टाइम अनुप्रयोगों के लिए 5 चरणों का उपयोग करें; अधिकतम गुणवत्ता के लिए 20–30 का उपयोग करें।
2. torch.compile का उपयोग करें (PyTorch 2.0+)
3. मिश्रित-सटीकता इन्फ़रेंस
4. कई वाक्यों को बैच करें
जहाँ संभव हो, GPU उपयोग को अधिकतम करने और ओवरहेड कम करने के लिए कई वाक्यों को एक साथ संसाधित करें।
5. संदर्भ स्पीकर एम्बेडिंग कैश करें
समस्या निवारण
समस्या: espeak-ng नहीं मिला
समस्या: Phonemizer विफल होता है
समस्या: CUDA मेमोरी समाप्त
समस्या: ऑडियो गुणवत्ता खराब
बढ़ाएँ
diffusion_steps15–20 तकसुनिश्चित करें कि संदर्भ ऑडियो साफ़ हो, कम से कम 16kHz
समायोजित करने का प्रयास करें
alphaऔरbetaपैरामीटरएक लंबा संदर्भ ऑडियो क्लिप उपयोग करें (15–30 सेकंड)
समस्या: Hugging Face से मॉडल डाउनलोड विफल होता है
Clore.ai GPU अनुशंसाएँ
StyleTTS2 एक हल्का मॉडल है — LibriTTS चेकपॉइंट लगभग 300MB का है, और साधारण GPU पर भी इन्फ़रेंस तेज़ है।
केवल CPU
—
~$0.02/hr
~0.5× रीयल-टाइम
विकास, परीक्षण
RTX 3090
24 GB
$0.07–0.21/hr
~15× रीयल-टाइम
प्रोडक्शन API, वॉयस क्लोनिंग
RTX 4090
24 GB
$0.14–0.42/hr
~25× रीयल-टाइम
उच्च-सहवर्ती API
ज़ीरो-शॉट वॉयस क्लोनिंग गुणवत्ता सुझाव: 22kHz या 24kHz पर 15–30 सेकंड का साफ़ संदर्भ ऑडियो दें। स्टाइल डिफ्यूज़न मॉड्यूल को बोलने की शैली, गति और प्रोसोडी को सही तरह कैप्चर करने के लिए पर्याप्त ऑडियो की आवश्यकता होती है। शोरयुक्त या छोटे संदर्भ आउटपुट गुणवत्ता को काफ़ी घटा देते हैं।
लिंक्स
पेपर (arXiv): https://arxiv.org/abs/2306.07691
Hugging Face (LJSpeech): https://huggingface.co/yl4579/StyleTTS2-LJSpeech
Hugging Face (LibriTTS): https://huggingface.co/yl4579/StyleTTS2-LibriTTS
CLORE.AI मार्केटप्लेस: https://clore.ai/marketplace
अंतिम अपडेट
क्या यह उपयोगी था?