For the complete documentation index, see llms.txt. This page is also available as Markdown.

MOSS-TTS (केवल CPU, 100M)

Clore.ai पर OpenMOSS (MOSI.AI + Fudan NLP) द्वारा MOSS-TTS — अल्ट्रा-लाइटवेट 100M-पैरामीटर CPU-प्रथम बहुभाषी टेक्स्ट-टू-स्पीच — चलाएँ।

MOSS-TTS OpenMOSS का एक ओपन-सोर्स स्पीच जेनरेशन परिवार है OpenMOSS (शंघाई इनोवेशन इंस्टीट्यूशन, के सहयोग से Fudan NLP और MOSI.AI, प्रो. शिपेंग क्यूई के नेतृत्व में)। प्रमुख MOSS-TTS-Nano केवल 100M पैरामीटरहै, और वास्तविक समय में चलता है एक 4-कोर CPU पर, बिना GPU के, आउटपुट देता है 48 kHz स्टीरियो, और समर्थन करता है 20 भाषाएँ ज़ीरो-शॉट वॉयस क्लोनिंग के साथ। पूरी श्रृंखला बहु-प्रवक्ता संवाद, वॉयस डिज़ाइन, और साउंड-इफ़ेक्ट जेनरेशन के लिए 8B तक स्केल होती है।

जारी किया गया: 10 अप्रैल, 2026 (Nano) · ONNX CPU बिल्ड 17 अप्रैल, 2026 · लाइसेंस: Apache 2.0

यदि Kokoro 82M-पैरामीटर वाले पश्चिमी-अंग्रेज़ी निच का मालिक है, तो MOSS-TTS-Nano का मालिक है CPU-प्रथम बहुभाषी निच: वही छोटे-मॉडल की सोच, लेकिन स्टीरियो 48 kHz, 20 भाषाएँ, वॉयस क्लोनिंग, और torch-रहित ONNX/GGUF पथ के साथ। जो कोई GPU के लिए भुगतान किए बिना TTS तैनात करना चाहता है — उसके लिए यही मॉडल है।

MOSS-TTS परिवार

मॉडल
आकार
VRAM
किसके लिए सर्वोत्तम

MOSS-TTS-Nano-100M

100M

0 जीबी (CPU, 4 कोर)

रियल-टाइम, एज, IVR, डिवाइस पर

MOSS-TTS-Nano-100M-ONNX

100M

0 जीबी (CPU)

Torch-रहित प्रोडक्शन सर्विंग

MOSS-TTS-GGUF

100M (Q4_K_M)

0 जीबी (CPU)

llama.cpp-शैली की तैनातियाँ

MOSS-TTS-Local-Transformer

1.7B

4 GB

हल्का GPU, मजबूत वस्तुनिष्ठ गुणवत्ता

MOSS-TTS-Realtime

1.7B

4 GB

मल्टी-टर्न वॉयस एजेंट, 180 ms TTFB

MOSS-VoiceGenerator

1.7B

4 GB

टेक्स्ट प्रॉम्प्ट से वॉयस डिज़ाइन

MOSS-TTSD-v1.0

8B

8 GB

बहु-प्रवक्ता संवाद, लंबे पॉडकास्ट

MOSS-SoundEffect

8B

8 GB

अवधि नियंत्रण के साथ साउंड इफ़ेक्ट जेनरेशन

मुख्य विनिर्देश

विशेष विवरण
मान

डेवलपर

OpenMOSS टीम · MOSI.AI · Fudan NLP लैब

आर्किटेक्चर

ऑटोरेग्रेसीव (ऑडियो टोकनाइज़र + LLM)

सैंपल रेट

48 kHz, स्टीरियो

भाषाएँ

20 (zh, en, de, es, fr, ja, it, hu, ko, ru, fa, ar, pl, pt, cs, da, sv, el, tr, +1)

वॉइस क्लोनिंग

लगभग 3s के संदर्भ से ज़ीरो-शॉट

स्ट्रीमिंग

हाँ — CPU पर चंक-आधारित डिकोड

लाइसेंस

Apache 2.0

HuggingFace

MOSS-TTS क्यों?

  • बिना GPU तैनाती — Nano 4 CPU कोर पर चलता है, CUDA नहीं, Triton नहीं

  • 48 kHz स्टीरियो आउटपुट — प्रसारण-स्तरीय, जो 100M से कम पैरामीटर वाले मॉडलों में दुर्लभ है

  • 20 भाषाएँ — Kokoro (~5) की तुलना में समान आकार पर अधिक कवरेज

  • ज़ीरो-शॉट वॉइस क्लोनिंग लगभग 3s के संदर्भ ऑडियो से

  • Torch-रहित ONNX/GGUF पथ — 200 MB बाइनरी के साथ शिप करें

  • परिवार स्केल करता है — Nano से 8B TTSD तक वही tokenizer/API

  • Apache 2.0 — व्यावसायिक उपयोग, बिना किसी बंधन के

  • गंभीर शोध से — Fudan NLP + MOSI.AI, कोई शौकिया प्रोजेक्ट नहीं

आवश्यकताएँ

घटक
न्यूनतम (Nano, CPU)
अनुशंसित (Nano, CPU)
पूरा परिवार (GPU)

CPU

4 कोर (x86_64 / ARM64)

8 कोर

8 कोर

RAM

4 GB

8 GB

16 GB

GPU

— (आवश्यक नहीं)

— (वैकल्पिक)

RTX 3060 12 GB+

VRAM

0 जीबी

0 जीबी

4–8 जीबी

डिस्क

1 जीबी

2 जीबी

10 जीबी (8B + deps)

Python

3.12

3.12

3.12

विकल्प A — Python इंस्टॉल + त्वरित inference

संदर्भ ऑडियो + लक्ष्य टेक्स्ट से inference:

या CLI एंट्रीपॉइंट के माध्यम से:

वेब डेमो (Gradio):

विकल्प B — Docker (CPU और GPU)

केवल CPU (Nano, लगभग 1 GB इमेज):

GPU वैरिएंट (Realtime / TTSD / SoundEffect के लिए):

विकल्प C — ज़ीरो-शॉट वॉयस क्लोनिंग (3s संदर्भ)

MOSS-TTS-Nano एक छोटे संदर्भ क्लिप से वॉयस क्लोन करता है और स्वचालित चंकिंग के माध्यम से लंबी-फ़ॉर्म सिंथेसिस को संभालता है।

गुणवत्ता सुझाव (XTTS प्लेबुक से पोर्ट किए गए — वही सिद्धांत लागू होते हैं):

  • के 3–10s का उपयोग करें साफ़ संदर्भ (कोई बैकग्राउंड म्यूज़िक नहीं, कोई कमरे की प्रतिध्वनि नहीं)

  • जहाँ संभव हो, संदर्भ और लक्ष्य टेक्स्ट की भाषा मिलाएँ

  • पास करने से पहले साइलेंस को सामान्य करें और ट्रिम करें (librosa.effects.trim)

  • सुसंगत लंबे-फ़ॉर्म वर्णन के लिए, कॉल्स के बीच वही संदर्भ पुनः उपयोग करें

विकल्प D — llama.cpp-audio / torch-रहित ONNX पर GGUF

एज बॉक्स, मोबाइल बैकएंड, या जहाँ आप PyTorch नहीं चाहते:

यह पथ llama.cpp-संगत टूलिंग पर चलता है — Raspberry Pi, Android, या serverless functions के लिए बेहतरीन, जहाँ 200 MB बाइनरी मायने रखती है।

Clore.ai GPU अनुशंसाएँ

Nano के लिए आपको GPU की आवश्यकता नहीं है। यही पूरा उद्देश्य है। लेकिन यदि आप बैच में जेनरेट करना चाहते हैं या बड़े सिब्लिंग्स चलाना चाहते हैं:

GPU
VRAM
फिट बैठता है
Clore कीमत (लगभग)

केवल CPU इंस्टेंस

Nano, Nano-ONNX, GGUF

से $0.01/घंटा

RTX 3060 12GB

12 GB

Nano + Local-Transformer + Realtime

$0.03–0.07/घंटा से

RTX 3090 24GB

24 GB

पूर्ण TTSD-v1.0 (8B), बैच सर्विंग

$0.07–0.21/घंटा से

RTX 4090 24GB

24 GB

TTSD + SoundEffect साथ-साथ

$0.14–0.42/घंटा से

उपयोग के मामले

  • ऑडियोबुक्स — सुसंगत क्लोन की गई आवाज़ के साथ लंबे-फ़ॉर्म नैरेशन, स्वचालित चंकिंग

  • वॉयस एजेंट — संवादात्मक AI के लिए Realtime वैरिएंट पर सब-सेकंड TTFB

  • IVR / फोन सिस्टम — CPU-केवल तैनाती, 48 kHz स्टीरियो, 20 भाषाएँ

  • गेम NPCs — गेम क्लाइंट के भीतर शिप करने के लिए पर्याप्त हल्का, प्रत्येक चरित्र के लिए वॉयस डिज़ाइन

  • डबिंग — स्थानीयकरण पाइपलाइनों के लिए बहुभाषी क्लोनिंग

  • पॉडकास्ट जेनरेशन — MOSS-TTSD-v1.0 मूल रूप से बहु-प्रवक्ता संवाद संभालता है

  • साउंड इफ़ेक्ट — MOSS-SoundEffect पाइपलाइन में अवधि-नियंत्रित FX जोड़ता है

बेंचमार्क / गुणवत्ता

  • MOSS-TTSD-v1.0 व्यक्तिपरक बहु-प्रवक्ता संवाद मूल्यांकनों में Doubao और Gemini 2.5-pro से बेहतर प्रदर्शन किया

  • Nano वास्तविक-समय कारक प्रदान करता है 4 CPU कोर पर < 1.0 (अर्थात प्लेबैक से तेज़)

  • Realtime वैरिएंट रिपोर्ट करता है ~180 ms time-to-first-byte संवादात्मक उपयोग के लिए

  • स्टीरियो 48 kHz आउटपुट इस पैरामीटर बजट पर 24 kHz मोनो प्रतिस्पर्धियों की तुलना में स्पष्ट उन्नति है

समस्या निवारण

समस्या
समाधान

pynini pip के माध्यम से इंस्टॉल विफल होता है

conda install -c conda-forge pynini=2.1.6.post1 -y तो WeTextProcessing को फिर से इंस्टॉल करें

CPU पर ऑडियो में रुकावट

4+ भौतिक कोर सुनिश्चित करें; SMT/HT ओवरसब्सक्रिप्शन अक्षम करें; ONNX बिल्ड का उपयोग करें

क्लोन की गई आवाज़ सही नहीं लगती

संदर्भ 3–10s, साफ़, एकल-प्रवक्ता, भाषा-मिलान वाला होना चाहिए

TTSD-v1.0 पर OOM

FP16 का उपयोग करें (model.half()) या 1.7B Local-Transformer पर आ जाएँ

मॉडल डाउनलोड अटक जाता है

सेट करें HF_HUB_ENABLE_HF_TRANSFER=1 और पुनः प्रयास करें

धीमी पहली रन

पहला inference kernels को compile करता है / लगभग 400 MB weights डाउनलोड करता है — बाद के रन तेज़ होते हैं

Torch अन्य मॉडलों के साथ संघर्ष करता है

का उपयोग करें [llama-cpp-onnx] torch-रहित वातावरण के लिए extras

अगले चरण


अंतिम अद्यतन: 20 अप्रैल, 2026

अंतिम अपडेट

क्या यह उपयोगी था?