For the complete documentation index, see llms.txt. This page is also available as Markdown.

MeloTTS

Clore.ai GPUs पर MeloTTS उच्च-गुणवत्ता बहुभाषी TTS को तेज़ इन्फ़रेंस के साथ चलाएँ

MeloTTS एक उच्च-गुणवत्ता वाली, बहुभाषी टेक्स्ट-टू-स्पीच लाइब्रेरी है, जिसे विकसित किया गया है MyShell AI. यह कई भाषाओं और अंग्रेज़ी उच्चारणों में तेज़, प्राकृतिक-ध्वनि वाली स्पीच सिंथेसिस प्रदान करता है, जिसे शोध और प्रोडक्शन तैनाती दोनों के लिए डिज़ाइन किया गया है। MeloTTS को गति के लिए अनुकूलित किया गया है — यह CPU पर भी वास्तविक समय से काफ़ी तेज़ स्पीच जनरेट कर सकता है — जबकि व्यावसायिक उपयोग के लिए उपयुक्त उच्च ऑडियो गुणवत्ता बनाए रखता है।

MeloTTS वर्तमान में समर्थन करता है:

  • अंग्रेज़ी (अमेरिकी, ब्रिटिश, भारतीय, ऑस्ट्रेलियाई, डिफ़ॉल्ट)

  • चीनी (सरलीकृत एवं मिश्रित चीनी-अंग्रेज़ी)

  • जापानी

  • कोरियाई

  • स्पेनिश

  • फ़्रेंच

मुख्य विशेषताएँ:

  • तेज़ इन्फ़रेंस — CPU पर वास्तविक समय से तेज़, GPU पर बेहद तेज़

  • 🌍 बहुभाषी — अंग्रेज़ी के लिए उच्चारण वैरिएंट सहित 6 भाषाएँ

  • 🐳 Docker के लिए तैयार — आधिकारिक Docker इमेज उपलब्ध है

  • 🔌 REST API — किसी भी अनुप्रयोग में एकीकरण के लिए HTTP API

  • 📱 प्रोडक्शन-स्तरीय — MyShell के उपभोक्ता उत्पादों में उपयोग किया जाता है


सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

GPU

NVIDIA GTX 1080 (8 GB)

NVIDIA RTX 3090 (24 GB)

VRAM

4 GB

8–16 GB

RAM

8 GB

16 GB

CPU

4 कोर

8 कोर

डिस्क

10 GB

20 GB

ओएस

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.7+ (वैकल्पिक)

12.1+

Python

3.8+

3.10

पोर्ट्स

22, 8888

22, 8888

MeloTTS अनोखे ढंग से कुशल है — यह एकल अनुरोधों के लिए CPU पर अच्छी तरह चलता है और बैच प्रोसेसिंग के लिए GPU से बहुत लाभ उठाता है। यहाँ तक कि एक बजट GPU भी थ्रूपुट को नाटकीय रूप से दोगुना कर देता है।


CLORE.AI पर त्वरित परिनियोजन

1. एक उपयुक्त सर्वर खोजें

पर जाएँ CLORE.AI मार्केटप्लेस और इनके अनुसार फ़िल्टर करें:

  • VRAM: ≥ 4 GB (या कम वॉल्यूम के लिए केवल CPU)

  • GPU: कोई भी NVIDIA GPU (GTX 1080+, RTX सीरीज़, A100)

  • डिस्क: ≥ 10 GB

2. अपना परिनियोजन कॉन्फ़िगर करें

Docker इमेज:

पोर्ट मैपिंग:

Environment Variables:

स्टार्टअप कमांड (सर्वर में SSH करने के बाद चलाएँ):

3. API तक पहुँचें

इसके साथ परीक्षण करें:


चरण-दर-चरण सेटअप

चरण 1: अपने सर्वर में SSH करें

चरण 2: कंटेनर बनाएं और चलाएँ

चूँकि MeloTTS का कोई पूर्व-निर्मित Docker Hub इमेज नहीं है, इसलिए NVIDIA CUDA बेस इमेज का उपयोग करें और MeloTTS को स्रोत से इंस्टॉल करें:

वैकल्पिक रूप से, स्रोत से एक कस्टम Docker इमेज बनाएं:

चरण 3: सेवा चल रही है या नहीं, सत्यापित करें

चरण 4: वैकल्पिक — Jupyter Notebook इंटरफ़ेस

यहाँ एक्सेस करें: http://<server-ip>:8888

चरण 5: pip से इंस्टॉल करें (Docker के बिना)


उपयोग के उदाहरण

उदाहरण 1: मूलभूत अंग्रेज़ी TTS (Python)


उदाहरण 2: बहुभाषी TTS


उदाहरण 3: REST API का उपयोग


उदाहरण 4: उच्च-गति बैच प्रोसेसिंग


उदाहरण 5: मिश्रित चीनी-अंग्रेज़ी TTS


कॉन्फ़िगरेशन

Docker Compose सेटअप

चूँकि MeloTTS की कोई आधिकारिक Docker Hub इमेज नहीं है, इसलिए NVIDIA CUDA बेस इमेज का उपयोग करें और स्टार्टअप पर MeloTTS को स्रोत से इंस्टॉल करें:

API कॉन्फ़िगरेशन विकल्प

पैरामीटर
डिफ़ॉल्ट
विवरण

--host

127.0.0.1

बाइंड एड्रेस (का उपयोग करें 0.0.0.0 सार्वजनिक के लिए)

--port

8888

API सर्वर पोर्ट

--workers

1

वर्कर प्रक्रियाओं की संख्या

--device

auto

cuda, cpuया auto

समर्थित भाषाएँ और स्पीकर

भाषा
कोड
स्पीकर IDs

अंग्रेज़ी

EN

EN-Default, EN-US, EN-GB, EN-India, EN-Australia, EN-Brazil

चीनी

ZH

ZH

जापानी

JP

JP

कोरियाई

KR

KR

स्पेनिश

SP

SP

फ़्रेंच

FR

FR


प्रदर्शन सुझाव

1. GPU बनाम CPU बेंचमार्क

MeloTTS प्रदर्शन (RTF = Real-Time Factor, कम बेहतर है):

डिवाइस
RTF
नोट्स

CPU (8 कोर)

~0.3x

तेज़, कम लोड के लिए बढ़िया

RTX 3080

~0.05x

वास्तविक समय से 20 गुना तेज़

RTX 4090

~0.02x

वास्तविक समय से 50 गुना तेज़

A100

~0.01x

वास्तविक समय से 100 गुना तेज़

2. थ्रूपुट के लिए अनुकूलित करें

3. मॉडल को पहले से गर्म करें

4. ऑडियो गुणवत्ता बनाम गति समायोजित करें

5. मेमोरी दक्षता


समस्या निवारण

समस्या: espeak-ng नहीं मिला

समस्या: NLTK डेटा अनुपलब्ध

समस्या: पोर्ट 8888 Jupyter से टकराता है

MeloTTS डिफ़ॉल्ट रूप से पोर्ट 8888 का उपयोग करता है, जो Jupyter Notebook से टकराता है। समाधान:

समस्या: चीनी पाठ सही से प्रदर्शित नहीं हो रहा

समस्या: Docker इमेज पुल विफल हो रहा है

समस्या: GPU पर इन्फ़रेंस धीमा है


Clore.ai GPU अनुशंसाएँ

MeloTTS हल्का है — यह कम वॉल्यूम के लिए CPU पर अच्छी तरह चलता है और GPU कंप्यूट के साथ रैखिक रूप से स्केल करता है। आपको महंगे हार्डवेयर की ज़रूरत नहीं है।

GPU
VRAM
Clore.ai मूल्य
RTF (वास्तविक समय गुणक)
क्षमता

केवल CPU

~$0.02/hr

~0.3×

~3 req/min

RTX 3090

24 GB

$0.07–0.21/hr

~0.02× (50× वास्तविक समय)

~100 req/min

RTX 4090

24 GB

$0.14–0.42/hr

~0.01× (100× वास्तविक समय)

~200 req/min

A100 40GB

40 GB

~0.005× (200× वास्तविक समय)

~400 req/min

TTS वर्कलोड्स के लिए सर्वोत्तम मूल्य: $0.07–0.21/घंटा पर RTX 3090, 50× वास्तविक-समय TTS गति प्रदान करता है। सैकड़ों उपयोगकर्ताओं को सेवा देने वाले प्रोडक्शन API के लिए यह पूरी तरह पर्याप्त है। केवल CPU वाले इंस्टेंस ($0.07–0.21/घंटा) विकास और कम-ट्रैफ़िक तैनाती के लिए ठीक काम करते हैं।

प्रोडक्शन अनुशंसा: 10–50 समकालिक उपयोगकर्ताओं को सेवा देने वाले बहुभाषी TTS API के लिए RTX 3090 सबसे उपयुक्त विकल्प है। महंगे A100 में अपग्रेड करने के बजाय क्षैतिज रूप से (कई इंस्टेंस) स्केल करें — MeloTTS को उच्च-स्तरीय GPUs से अनुपातिक लाभ नहीं मिलता।


लिंक्स

अंतिम अपडेट

क्या यह उपयोगी था?