MOSS-TTS (केवल CPU, 100M)
Clore.ai पर OpenMOSS (MOSI.AI + Fudan NLP) द्वारा MOSS-TTS — अल्ट्रा-लाइटवेट 100M-पैरामीटर CPU-प्रथम बहुभाषी टेक्स्ट-टू-स्पीच — चलाएँ।
MOSS-TTS OpenMOSS का एक ओपन-सोर्स स्पीच जेनरेशन परिवार है OpenMOSS (शंघाई इनोवेशन इंस्टीट्यूशन, के सहयोग से Fudan NLP और MOSI.AI, प्रो. शिपेंग क्यूई के नेतृत्व में)। प्रमुख MOSS-TTS-Nano केवल 100M पैरामीटरहै, और वास्तविक समय में चलता है एक 4-कोर CPU पर, बिना GPU के, आउटपुट देता है 48 kHz स्टीरियो, और समर्थन करता है 20 भाषाएँ ज़ीरो-शॉट वॉयस क्लोनिंग के साथ। पूरी श्रृंखला बहु-प्रवक्ता संवाद, वॉयस डिज़ाइन, और साउंड-इफ़ेक्ट जेनरेशन के लिए 8B तक स्केल होती है।
यदि Kokoro 82M-पैरामीटर वाले पश्चिमी-अंग्रेज़ी निच का मालिक है, तो MOSS-TTS-Nano का मालिक है CPU-प्रथम बहुभाषी निच: वही छोटे-मॉडल की सोच, लेकिन स्टीरियो 48 kHz, 20 भाषाएँ, वॉयस क्लोनिंग, और torch-रहित ONNX/GGUF पथ के साथ। जो कोई GPU के लिए भुगतान किए बिना TTS तैनात करना चाहता है — उसके लिए यही मॉडल है।
MOSS-TTS परिवार
MOSS-TTS-Nano-100M
100M
0 जीबी (CPU, 4 कोर)
रियल-टाइम, एज, IVR, डिवाइस पर
MOSS-TTS-Nano-100M-ONNX
100M
0 जीबी (CPU)
Torch-रहित प्रोडक्शन सर्विंग
MOSS-TTS-GGUF
100M (Q4_K_M)
0 जीबी (CPU)
llama.cpp-शैली की तैनातियाँ
MOSS-TTS-Local-Transformer
1.7B
4 GB
हल्का GPU, मजबूत वस्तुनिष्ठ गुणवत्ता
MOSS-TTS-Realtime
1.7B
4 GB
मल्टी-टर्न वॉयस एजेंट, 180 ms TTFB
MOSS-VoiceGenerator
1.7B
4 GB
टेक्स्ट प्रॉम्प्ट से वॉयस डिज़ाइन
MOSS-TTSD-v1.0
8B
8 GB
बहु-प्रवक्ता संवाद, लंबे पॉडकास्ट
MOSS-SoundEffect
8B
8 GB
अवधि नियंत्रण के साथ साउंड इफ़ेक्ट जेनरेशन
मुख्य विनिर्देश
डेवलपर
OpenMOSS टीम · MOSI.AI · Fudan NLP लैब
आर्किटेक्चर
ऑटोरेग्रेसीव (ऑडियो टोकनाइज़र + LLM)
सैंपल रेट
48 kHz, स्टीरियो
भाषाएँ
20 (zh, en, de, es, fr, ja, it, hu, ko, ru, fa, ar, pl, pt, cs, da, sv, el, tr, +1)
वॉइस क्लोनिंग
लगभग 3s के संदर्भ से ज़ीरो-शॉट
स्ट्रीमिंग
हाँ — CPU पर चंक-आधारित डिकोड
लाइसेंस
Apache 2.0
HuggingFace
MOSS-TTS क्यों?
बिना GPU तैनाती — Nano 4 CPU कोर पर चलता है, CUDA नहीं, Triton नहीं
48 kHz स्टीरियो आउटपुट — प्रसारण-स्तरीय, जो 100M से कम पैरामीटर वाले मॉडलों में दुर्लभ है
20 भाषाएँ — Kokoro (~5) की तुलना में समान आकार पर अधिक कवरेज
ज़ीरो-शॉट वॉइस क्लोनिंग लगभग 3s के संदर्भ ऑडियो से
Torch-रहित ONNX/GGUF पथ — 200 MB बाइनरी के साथ शिप करें
परिवार स्केल करता है — Nano से 8B TTSD तक वही tokenizer/API
Apache 2.0 — व्यावसायिक उपयोग, बिना किसी बंधन के
गंभीर शोध से — Fudan NLP + MOSI.AI, कोई शौकिया प्रोजेक्ट नहीं
आवश्यकताएँ
CPU
4 कोर (x86_64 / ARM64)
8 कोर
8 कोर
RAM
4 GB
8 GB
16 GB
GPU
— (आवश्यक नहीं)
— (वैकल्पिक)
RTX 3060 12 GB+
VRAM
0 जीबी
0 जीबी
4–8 जीबी
डिस्क
1 जीबी
2 जीबी
10 जीबी (8B + deps)
Python
3.12
3.12
3.12
Clore.ai टिप: Nano को सचमुच GPU की ज़रूरत नहीं है। यदि आपके पास पहले से अन्य काम के लिए Clore box है, तो TTS मुफ़्त है। यदि आप चाहते हैं बैच थ्रूपुट के लिए GPU या 1.7B/8B वैरिएंट चलाने के लिए, एक RTX 3060 12GB ($0.03–0.07/घंटा) ज़रूरत से ज़्यादा है।
विकल्प A — Python इंस्टॉल + त्वरित inference
संदर्भ ऑडियो + लक्ष्य टेक्स्ट से inference:
या CLI एंट्रीपॉइंट के माध्यम से:
वेब डेमो (Gradio):
विकल्प B — Docker (CPU और GPU)
केवल CPU (Nano, लगभग 1 GB इमेज):
GPU वैरिएंट (Realtime / TTSD / SoundEffect के लिए):
विकल्प C — ज़ीरो-शॉट वॉयस क्लोनिंग (3s संदर्भ)
MOSS-TTS-Nano एक छोटे संदर्भ क्लिप से वॉयस क्लोन करता है और स्वचालित चंकिंग के माध्यम से लंबी-फ़ॉर्म सिंथेसिस को संभालता है।
गुणवत्ता सुझाव (XTTS प्लेबुक से पोर्ट किए गए — वही सिद्धांत लागू होते हैं):
के 3–10s का उपयोग करें साफ़ संदर्भ (कोई बैकग्राउंड म्यूज़िक नहीं, कोई कमरे की प्रतिध्वनि नहीं)
जहाँ संभव हो, संदर्भ और लक्ष्य टेक्स्ट की भाषा मिलाएँ
पास करने से पहले साइलेंस को सामान्य करें और ट्रिम करें (
librosa.effects.trim)सुसंगत लंबे-फ़ॉर्म वर्णन के लिए, कॉल्स के बीच वही संदर्भ पुनः उपयोग करें
विकल्प D — llama.cpp-audio / torch-रहित ONNX पर GGUF
एज बॉक्स, मोबाइल बैकएंड, या जहाँ आप PyTorch नहीं चाहते:
यह पथ llama.cpp-संगत टूलिंग पर चलता है — Raspberry Pi, Android, या serverless functions के लिए बेहतरीन, जहाँ 200 MB बाइनरी मायने रखती है।
Clore.ai GPU अनुशंसाएँ
Nano के लिए आपको GPU की आवश्यकता नहीं है। यही पूरा उद्देश्य है। लेकिन यदि आप बैच में जेनरेट करना चाहते हैं या बड़े सिब्लिंग्स चलाना चाहते हैं:
केवल CPU इंस्टेंस
—
Nano, Nano-ONNX, GGUF
से $0.01/घंटा
RTX 3060 12GB
12 GB
Nano + Local-Transformer + Realtime
$0.03–0.07/घंटा से
RTX 3090 24GB
24 GB
पूर्ण TTSD-v1.0 (8B), बैच सर्विंग
$0.07–0.21/घंटा से
RTX 4090 24GB
24 GB
TTSD + SoundEffect साथ-साथ
$0.14–0.42/घंटा से
90% प्रोडक्शन TTS वर्कलोड — वॉयस एजेंट, IVR, नैरेशन — के लिए एक CPU-केवल Clore.ai बॉक्स सचमुच सबसे सस्ता व्यावहारिक तैनाती विकल्प है। इसे किराए पर लें, MOSS-TTS-Nano चलाएँ, GPU बिलों को भूल जाएँ।
उपयोग के मामले
ऑडियोबुक्स — सुसंगत क्लोन की गई आवाज़ के साथ लंबे-फ़ॉर्म नैरेशन, स्वचालित चंकिंग
वॉयस एजेंट — संवादात्मक AI के लिए Realtime वैरिएंट पर सब-सेकंड TTFB
IVR / फोन सिस्टम — CPU-केवल तैनाती, 48 kHz स्टीरियो, 20 भाषाएँ
गेम NPCs — गेम क्लाइंट के भीतर शिप करने के लिए पर्याप्त हल्का, प्रत्येक चरित्र के लिए वॉयस डिज़ाइन
डबिंग — स्थानीयकरण पाइपलाइनों के लिए बहुभाषी क्लोनिंग
पॉडकास्ट जेनरेशन — MOSS-TTSD-v1.0 मूल रूप से बहु-प्रवक्ता संवाद संभालता है
साउंड इफ़ेक्ट — MOSS-SoundEffect पाइपलाइन में अवधि-नियंत्रित FX जोड़ता है
बेंचमार्क / गुणवत्ता
MOSS-TTSD-v1.0 व्यक्तिपरक बहु-प्रवक्ता संवाद मूल्यांकनों में Doubao और Gemini 2.5-pro से बेहतर प्रदर्शन किया
Nano वास्तविक-समय कारक प्रदान करता है 4 CPU कोर पर < 1.0 (अर्थात प्लेबैक से तेज़)
Realtime वैरिएंट रिपोर्ट करता है ~180 ms time-to-first-byte संवादात्मक उपयोग के लिए
स्टीरियो 48 kHz आउटपुट इस पैरामीटर बजट पर 24 kHz मोनो प्रतिस्पर्धियों की तुलना में स्पष्ट उन्नति है
समस्या निवारण
pynini pip के माध्यम से इंस्टॉल विफल होता है
conda install -c conda-forge pynini=2.1.6.post1 -y तो WeTextProcessing को फिर से इंस्टॉल करें
CPU पर ऑडियो में रुकावट
4+ भौतिक कोर सुनिश्चित करें; SMT/HT ओवरसब्सक्रिप्शन अक्षम करें; ONNX बिल्ड का उपयोग करें
क्लोन की गई आवाज़ सही नहीं लगती
संदर्भ 3–10s, साफ़, एकल-प्रवक्ता, भाषा-मिलान वाला होना चाहिए
TTSD-v1.0 पर OOM
FP16 का उपयोग करें (model.half()) या 1.7B Local-Transformer पर आ जाएँ
मॉडल डाउनलोड अटक जाता है
सेट करें HF_HUB_ENABLE_HF_TRANSFER=1 और पुनः प्रयास करें
धीमी पहली रन
पहला inference kernels को compile करता है / लगभग 400 MB weights डाउनलोड करता है — बाद के रन तेज़ होते हैं
Torch अन्य मॉडलों के साथ संघर्ष करता है
का उपयोग करें [llama-cpp-onnx] torch-रहित वातावरण के लिए extras
अगले चरण
Kokoro TTS — 82M अंग्रेज़ी-प्रथम विकल्प यदि आपको बहुभाषी की आवश्यकता नहीं है
Voxtral TTS — 4B Mistral मॉडल, 9 भाषाएँ, GPU आवश्यक लेकिन उच्च क्षमता
XTTS (Coqui) — 17-भाषा वॉयस क्लोनिंग, केवल GPU, बड़ा
Whisper प्रतिलेखन — पूर्ण वॉयस पाइपलाइनों के लिए MOSS-TTS को Whisper के साथ जोड़ें
अंतिम अद्यतन: 20 अप्रैल, 2026
अंतिम अपडेट
क्या यह उपयोगी था?