MeloTTS
Clore.ai GPUs पर MeloTTS उच्च-गुणवत्ता बहुभाषी TTS को तेज़ इन्फ़रेंस के साथ चलाएँ
MeloTTS एक उच्च-गुणवत्ता वाली, बहुभाषी टेक्स्ट-टू-स्पीच लाइब्रेरी है, जिसे विकसित किया गया है MyShell AI. यह कई भाषाओं और अंग्रेज़ी उच्चारणों में तेज़, प्राकृतिक-ध्वनि वाली स्पीच सिंथेसिस प्रदान करता है, जिसे शोध और प्रोडक्शन तैनाती दोनों के लिए डिज़ाइन किया गया है। MeloTTS को गति के लिए अनुकूलित किया गया है — यह CPU पर भी वास्तविक समय से काफ़ी तेज़ स्पीच जनरेट कर सकता है — जबकि व्यावसायिक उपयोग के लिए उपयुक्त उच्च ऑडियो गुणवत्ता बनाए रखता है।
MeloTTS वर्तमान में समर्थन करता है:
अंग्रेज़ी (अमेरिकी, ब्रिटिश, भारतीय, ऑस्ट्रेलियाई, डिफ़ॉल्ट)
चीनी (सरलीकृत एवं मिश्रित चीनी-अंग्रेज़ी)
जापानी
कोरियाई
स्पेनिश
फ़्रेंच
मुख्य विशेषताएँ:
⚡ तेज़ इन्फ़रेंस — CPU पर वास्तविक समय से तेज़, GPU पर बेहद तेज़
🌍 बहुभाषी — अंग्रेज़ी के लिए उच्चारण वैरिएंट सहित 6 भाषाएँ
🐳 Docker के लिए तैयार — आधिकारिक Docker इमेज उपलब्ध है
🔌 REST API — किसी भी अनुप्रयोग में एकीकरण के लिए HTTP API
📱 प्रोडक्शन-स्तरीय — MyShell के उपभोक्ता उत्पादों में उपयोग किया जाता है
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
GPU
NVIDIA GTX 1080 (8 GB)
NVIDIA RTX 3090 (24 GB)
VRAM
4 GB
8–16 GB
RAM
8 GB
16 GB
CPU
4 कोर
8 कोर
डिस्क
10 GB
20 GB
ओएस
Ubuntu 20.04+
Ubuntu 22.04
CUDA
11.7+ (वैकल्पिक)
12.1+
Python
3.8+
3.10
पोर्ट्स
22, 8888
22, 8888
CLORE.AI पर त्वरित परिनियोजन
ध्यान दें: MeloTTS का Docker Hub पर कोई आधिकारिक पूर्व-निर्मित Docker इमेज नहीं है (myshell-ai/melotts मौजूद नहीं है)। अनुशंसित तरीका यह है कि NVIDIA CUDA बेस इमेज का उपयोग करें और आधिकारिक GitHub रिपॉज़िटरी से pip के माध्यम से MeloTTS इंस्टॉल करें।
1. एक उपयुक्त सर्वर खोजें
पर जाएँ CLORE.AI मार्केटप्लेस और इनके अनुसार फ़िल्टर करें:
VRAM: ≥ 4 GB (या कम वॉल्यूम के लिए केवल CPU)
GPU: कोई भी NVIDIA GPU (GTX 1080+, RTX सीरीज़, A100)
डिस्क: ≥ 10 GB
2. अपना परिनियोजन कॉन्फ़िगर करें
Docker इमेज:
पोर्ट मैपिंग:
Environment Variables:
स्टार्टअप कमांड (सर्वर में SSH करने के बाद चलाएँ):
3. API तक पहुँचें
इसके साथ परीक्षण करें:
चरण-दर-चरण सेटअप
चरण 1: अपने सर्वर में SSH करें
चरण 2: कंटेनर बनाएं और चलाएँ
चूँकि MeloTTS का कोई पूर्व-निर्मित Docker Hub इमेज नहीं है, इसलिए NVIDIA CUDA बेस इमेज का उपयोग करें और MeloTTS को स्रोत से इंस्टॉल करें:
वैकल्पिक रूप से, स्रोत से एक कस्टम Docker इमेज बनाएं:
चरण 3: सेवा चल रही है या नहीं, सत्यापित करें
चरण 4: वैकल्पिक — Jupyter Notebook इंटरफ़ेस
यहाँ एक्सेस करें: http://<server-ip>:8888
चरण 5: pip से इंस्टॉल करें (Docker के बिना)
उपयोग के उदाहरण
उदाहरण 1: मूलभूत अंग्रेज़ी TTS (Python)
उदाहरण 2: बहुभाषी TTS
उदाहरण 3: REST API का उपयोग
उदाहरण 4: उच्च-गति बैच प्रोसेसिंग
उदाहरण 5: मिश्रित चीनी-अंग्रेज़ी TTS
कॉन्फ़िगरेशन
Docker Compose सेटअप
चूँकि MeloTTS की कोई आधिकारिक Docker Hub इमेज नहीं है, इसलिए NVIDIA CUDA बेस इमेज का उपयोग करें और स्टार्टअप पर MeloTTS को स्रोत से इंस्टॉल करें:
API कॉन्फ़िगरेशन विकल्प
--host
127.0.0.1
बाइंड एड्रेस (का उपयोग करें 0.0.0.0 सार्वजनिक के लिए)
--port
8888
API सर्वर पोर्ट
--workers
1
वर्कर प्रक्रियाओं की संख्या
--device
auto
cuda, cpuया auto
समर्थित भाषाएँ और स्पीकर
अंग्रेज़ी
EN
EN-Default, EN-US, EN-GB, EN-India, EN-Australia, EN-Brazil
चीनी
ZH
ZH
जापानी
JP
JP
कोरियाई
KR
KR
स्पेनिश
SP
SP
फ़्रेंच
FR
FR
प्रदर्शन सुझाव
1. GPU बनाम CPU बेंचमार्क
MeloTTS प्रदर्शन (RTF = Real-Time Factor, कम बेहतर है):
CPU (8 कोर)
~0.3x
तेज़, कम लोड के लिए बढ़िया
RTX 3080
~0.05x
वास्तविक समय से 20 गुना तेज़
RTX 4090
~0.02x
वास्तविक समय से 50 गुना तेज़
A100
~0.01x
वास्तविक समय से 100 गुना तेज़
2. थ्रूपुट के लिए अनुकूलित करें
3. मॉडल को पहले से गर्म करें
4. ऑडियो गुणवत्ता बनाम गति समायोजित करें
5. मेमोरी दक्षता
समस्या निवारण
समस्या: espeak-ng नहीं मिला
समस्या: NLTK डेटा अनुपलब्ध
समस्या: पोर्ट 8888 Jupyter से टकराता है
MeloTTS डिफ़ॉल्ट रूप से पोर्ट 8888 का उपयोग करता है, जो Jupyter Notebook से टकराता है। समाधान:
समस्या: चीनी पाठ सही से प्रदर्शित नहीं हो रहा
समस्या: Docker इमेज पुल विफल हो रहा है
समस्या: GPU पर इन्फ़रेंस धीमा है
Clore.ai GPU अनुशंसाएँ
MeloTTS हल्का है — यह कम वॉल्यूम के लिए CPU पर अच्छी तरह चलता है और GPU कंप्यूट के साथ रैखिक रूप से स्केल करता है। आपको महंगे हार्डवेयर की ज़रूरत नहीं है।
केवल CPU
—
~$0.02/hr
~0.3×
~3 req/min
RTX 3090
24 GB
$0.07–0.21/hr
~0.02× (50× वास्तविक समय)
~100 req/min
RTX 4090
24 GB
$0.14–0.42/hr
~0.01× (100× वास्तविक समय)
~200 req/min
प्रोडक्शन अनुशंसा: 10–50 समकालिक उपयोगकर्ताओं को सेवा देने वाले बहुभाषी TTS API के लिए RTX 3090 सबसे उपयुक्त विकल्प है। महंगे A100 में अपग्रेड करने के बजाय क्षैतिज रूप से (कई इंस्टेंस) स्केल करें — MeloTTS को उच्च-स्तरीय GPUs से अनुपातिक लाभ नहीं मिलता।
लिंक्स
Docker: कोई आधिकारिक Docker Hub इमेज नहीं — इससे इंस्टॉल करें GitHub स्रोत का उपयोग करके
nvidia/cuda:12.8.1-devel-ubuntu22.04बेस इमेजHugging Face: https://huggingface.co/myshell-ai/MeloTTS-English
MyShell AI: https://myshell.ai
CLORE.AI मार्केटप्लेस: https://clore.ai/marketplace
अंतिम अपडेट
क्या यह उपयोगी था?