For the complete documentation index, see llms.txt. This page is also available as Markdown.

Kokoro TTS

Clore.ai GPUs पर Kokoro TTS चलाएँ — एक अल्ट्रा-लाइटवेट 82M-पैरामीटर टेक्स्ट-टू-स्पीच मॉडल।

Kokoro एक 82M-पैरामीटर वाला text-to-speech मॉडल है जो अपनी श्रेणी से कहीं आगे निकलता है। अपने बेहद छोटे आकार (2 GB VRAM से कम) के बावजूद, यह आश्चर्यजनक रूप से स्वाभाविक अंग्रेज़ी भाषण उत्पन्न करता है और बजट हार्डवेयर पर भी रियल-टाइम या उससे तेज़ गति से चलता है। Apache 2.0 लाइसेंसिंग, कई अंतर्निहित आवाज़ शैलियों, और CPU inference समर्थन के साथ, Kokoro रियल-टाइम अनुप्रयोगों, चैटबॉट्स, और एज परिनियोजन के लिए आदर्श है।

HuggingFace: hexgrad/Kokoro-82M PyPI: kokoro लाइसेंस: Apache 2.0

मुख्य विशेषताएँ

  • 82M पैरामीटर — उपलब्ध सबसे छोटे उच्च-गुणवत्ता वाले TTS मॉडलों में से एक

  • < 2 GB VRAM — लगभग किसी भी GPU पर, और यहाँ तक कि CPU पर भी चलता है

  • कई आवाज़ शैलियाँ — अमेरिकी अंग्रेज़ी, ब्रिटिश अंग्रेज़ी; पुरुष और महिला आवाज़ें

  • रीयल-टाइम या उससे तेज़ — स्ट्रीमिंग के लिए उपयुक्त कम-विलंबता inference

  • स्ट्रीमिंग जनरेशन — जैसे-जैसे ऑडियो खंड बनते हैं, उन्हें आउटपुट करता है

  • बहु-भाषा समर्थन — अंग्रेज़ी (प्राथमिक), जापानी (misaki[ja]), चीनी (misaki[zh])

  • Apache 2.0 — व्यक्तिगत और व्यावसायिक उपयोग के लिए निःशुल्क

आवश्यकताएँ

घटक
न्यूनतम
अनुशंसित

GPU

2 GB VRAM वाला कोई भी

RTX 3060

VRAM

2 जीबी

4 GB

RAM

4 GB

8 GB

डिस्क

500 MB

1 जीबी

Python

3.9+

3.11

सिस्टम

espeak-ng स्थापित

Clore.ai की सिफारिश: एक RTX 3060 ($0.03–0.07/घंटा) पूरी तरह पर्याप्त है। Kokoro CPU-only इंस्टेंस पर भी चल सकता है, जिससे यह बेहद किफ़ायती TTS बनता है।

इंस्टॉलेशन

त्वरित शुरुआत

उपयोग के उदाहरण

कई आवाज़ों की तुलना

तुलना के लिए एक ही पाठ को अलग-अलग आवाज़ों के साथ जनरेट करें:

गति नियंत्रण के साथ ब्रिटिश अंग्रेज़ी

बैच फ़ाइल प्रोसेसिंग

कई पाठों को प्रोसेस करें और उन्हें एकल ऑडियोबुक-शैली की फ़ाइल में संयोजित करें:

Clore.ai उपयोगकर्ताओं के लिए सुझाव

  • CPU inference — Kokoro इतना छोटा है कि CPU पर चल सकता है; लागत-संवेदनशील कार्यभारों या जब GPU उपलब्ध न हों, तब उपयोगी

  • स्ट्रीमिंग — जनरेटर जैसे-जैसे ऑडियो खंड बनाता है, उन्हें आउटपुट करता है, जिससे वेब ऐप्स में वास्तविक-समय प्लेबैक संभव होता है

  • WhisperX के साथ संयोजित करें — वॉइस पाइपलाइनों में ट्रांसक्रिप्शन के लिए WhisperX और पुनः-संश्लेषण के लिए Kokoro का उपयोग करें

  • Docker — उपयोग करें pytorch/pytorch:2.11.0-cuda12.8-cudnn9-runtime और जोड़ें apt-get install -y espeak-ng अपने स्टार्टअप के लिए

  • आवाज़ की स्थिरता — एक सुसंगत नैरेटर अनुभव के लिए प्रति प्रोजेक्ट एक ही voice ID पर टिके रहें

  • लागत दक्षता — RTX 3060 पर $0.03–0.07/घंटा की दर से, Kokoro self-host करने के लिए सबसे सस्ते TTS समाधानों में से एक है

समस्या निवारण

समस्या
समाधान

espeak-ng नहीं मिला

चलाएँ apt-get install -y espeak-ng (आवश्यक सिस्टम निर्भरता)

ModuleNotFoundError: kokoro

इसके साथ इंस्टॉल करें pip install kokoro>=0.9.4 soundfile

ऑडियो रोबोटिक सुनाई देता है

कोई अलग voice आज़माएँ (जैसे, af_heart सबसे स्वाभाविक सुनाई देती है)

जापानी/चीनी काम नहीं कर रहे

भाषा extras इंस्टॉल करें: pip install misaki[ja] या misaki[zh]

CPU पर मेमोरी समाप्त

प्रति कॉल पाठ की लंबाई कम करें; Kokoro खंडों को स्ट्रीम करता है, इसलिए मेमोरी सीमित रहती है

धीमी पहली रन

मॉडल weights पहली बार उपयोग पर डाउनलोड होते हैं (~200 MB); बाद के रन तुरंत होते हैं

अंतिम अपडेट

क्या यह उपयोगी था?