Fish Speech
Clore.ai GPUs पर Fish Speech बहुभाषी TTS और ज़ीरो-शॉट वॉइस क्लोनिंग चलाएँ
Fish Speech एक अत्याधुनिक बहुभाषी टेक्स्ट-टू-स्पीच (TTS) सिस्टम है जिसमें ज़ीरो-शॉट वॉइस क्लोनिंग क्षमताएँ हैं। 15,000 से अधिक GitHub स्टार्स के साथ, यह अंग्रेज़ी, चीनी, जापानी, कोरियाई, फ़्रेंच, जर्मन, अरबी, स्पेनिश और अन्य भाषाओं का समर्थन करता है — वह भी एक ही मॉडल से। केवल 10–15 सेकंड के संदर्भ ऑडियो का उपयोग करके, Fish Speech किसी भी आवाज़ को उल्लेखनीय सटीकता के साथ क्लोन कर सकता है, जिससे यह ऑडियोबुक प्रोडक्शन, डबिंग, वर्चुअल असिस्टेंट्स और बड़े पैमाने पर कंटेंट निर्माण के लिए आदर्श बन जाता है।
Fish Speech एक transformer-आधारित आर्किटेक्चर और VQGAN vocoder का उपयोग करता है, और मानक TTS बेंचमार्क पर लगभग मानव-स्तर की प्राकृतिकता स्कोर प्राप्त करता है। WebUI (Gradio) इसे बिना एक भी कोड लाइन लिखे सुलभ बनाता है, जबकि REST API उत्पादन पाइपलाइनों में सहज एकीकरण सक्षम करता है।
सभी उदाहरण GPU सर्वरों पर चलाए जा सकते हैं, जिन्हें किराए पर लिया गया है CLORE.AI मार्केटप्लेस.
सर्वर आवश्यकताएँ
GPU
NVIDIA RTX 3080 (10 GB)
NVIDIA RTX 4090 (24 GB)
VRAM
8 GB
16–24 GB
RAM
16 GB
32 GB
CPU
4 कोर
8+ कोर
डिस्क
20 GB
40 GB
ओएस
Ubuntu 20.04+
Ubuntu 22.04
CUDA
11.8+
12.1+
पोर्ट्स
22, 7860
22, 7860
CLORE.AI पर त्वरित परिनियोजन
Fish Speech को चलाने का सबसे तेज़ तरीका Docker Hub से सीधे आधिकारिक Docker इमेज के माध्यम से है।
1. एक उपयुक्त सर्वर खोजें
पर जाएँ CLORE.AI मार्केटप्लेस और इनके अनुसार फ़िल्टर करें:
VRAM: ≥ 8 GB
GPU: RTX 3080, 3090, 4080, 4090, A100, H100
डिस्क: ≥ 20 GB
2. अपना परिनियोजन कॉन्फ़िगर करें
CLORE.AI ऑर्डर फ़ॉर्म में निम्न सेट करें:
Docker इमेज:
पोर्ट मैपिंग:
Environment Variables:
स्टार्टअप कमांड (वैकल्पिक — WebUI स्वतः शुरू हो जाएगा):
3. इंटरफ़ेस तक पहुँचें
डिप्लॉय होने के बाद, अपना ब्राउज़र खोलें और यहाँ जाएँ:
Gradio WebUI पूर्ण Fish Speech इंटरफ़ेस के साथ लोड होगी, जो उपयोग के लिए तैयार होगी।
चरण-दर-चरण सेटअप
चरण 1: अपने सर्वर में SSH करें
चरण 2: Docker कंटेनर को पुल करें और चलाएँ
चरण 3: GPU एक्सेस सत्यापित करें
आपको अपनी GPU उपलब्ध VRAM के साथ सूचीबद्ध दिखनी चाहिए।
चरण 4: मॉडल डाउनलोड की जाँच करें
Fish Speech पहली बार चलने पर मॉडल वेट्स स्वतः डाउनलोड करता है (~3–5 GB). प्रगति मॉनिटर करें:
तब तक प्रतीक्षा करें जब तक आपको यह न दिखे:
चरण 5: WebUI तक पहुँचें
पर जाएँ http://<server-ip>:7860 अपने ब्राउज़र में.
चरण 6: (वैकल्पिक) API सर्वर सक्षम करें
उपयोग के उदाहरण
उदाहरण 1: WebUI के माध्यम से मूल टेक्स्ट-टू-स्पीच
WebUI खोलें
http://<server-ip>:7860में टेक्स्ट दर्ज करें "टेक्स्ट" फ़ील्ड में:
भाषा चुनें: अंग्रेज़ी
क्लिक करें "जनरेट करें"
परिणामस्वरूप प्राप्त
.wavफ़ाइल
उदाहरण 2: ज़ीरो-शॉट वॉयस क्लोनिंग
केवल 10–15 सेकंड के संदर्भ ऑडियो का उपयोग करके किसी भी आवाज़ को क्लोन करें:
WebUI में, जाएँ "वॉइस क्लोन" टैब
अपनी संदर्भ ऑडियो फ़ाइल अपलोड करें (
.wavया.mp3, 10–30 सेकंड)संदर्भ ऑडियो का ट्रांसक्रिप्ट दर्ज करें (वैकल्पिक, लेकिन गुणवत्ता बेहतर करता है)
सिंथेसाइज़ करने के लिए लक्ष्य टेक्स्ट दर्ज करें
क्लिक करें "क्लोन करें और जनरेट करें"
मॉडल आवाज़ की विशेषताओं का विश्लेषण करेगा और उसी आवाज़ में भाषण सिंथेसाइज़ करेगा।
उदाहरण 3: API-आधारित TTS (Python)
उदाहरण 4: बहुभाषी TTS
उदाहरण 5: ऑडियो फ़ाइलों का बैच प्रोसेसिंग
कॉन्फ़िगरेशन
Docker Compose (उत्पादन सेटअप)
मुख्य कॉन्फ़िगरेशन विकल्प
--listen
0.0.0.0
सर्वर को बाँधने के लिए इंटरफ़ेस
--port
7860
Gradio WebUI के लिए पोर्ट
--compile
false
तेज़ इन्फ़रेंस के लिए torch.compile सक्षम करें
--device
cuda
उपयोग करने के लिए डिवाइस (cuda, cpu, mps)
--half
true
FP16 हाफ-प्रिसीजन का उपयोग करें (VRAM बचाता है)
--num_samples
1
जनरेट करने के लिए ऑडियो सैंपलों की संख्या
--max_new_tokens
1024
जनरेशन के लिए अधिकतम नए टोकन
मॉडल वेरिएंट
fish-speech-1.4
~3 GB
8 भाषाएँ
नवीनतम स्थिर रिलीज़
fish-speech-1.2-sft
~2.5 GB
8 भाषाएँ
फ़ाइन-ट्यून किया गया संस्करण
fish-speech-1.2
~2.5 GB
8 भाषाएँ
आधार मॉडल
प्रदर्शन सुझाव
1. तेज़ इन्फ़रेंस के लिए torch.compile सक्षम करें
पहला रन धीमा होगा (कंपाइलेशन में 2–5 मिनट लगते हैं), लेकिन उसके बाद का इन्फ़रेंस 20–40% तेज़ होगा।
2. हाफ-प्रिसीजन (FP16) का उपयोग करें
FP16 न्यूनतम गुणवत्ता हानि के साथ VRAM उपयोग को ~50% तक कम करता है:
3. संदर्भ आवाज़ों को पहले से लोड करें
बार-बार उपयोग की जाने वाली संदर्भ आवाज़ों को कंटेनर की reference डायरेक्टरी में संग्रहीत करें ताकि पुनः-प्रोसेसिंग से बचा जा सके:
4. GPU मेमोरी अनुकूलन
5. बैच आकार ट्यूनिंग
बैच API अनुरोधों के लिए, सर्वोत्तम बैच आकार:
RTX 3080 (10 GB): batch_size = 1–2
RTX 3090/4090 (24 GB): batch_size = 4–8
A100 (40/80 GB): batch_size = 16–32
समस्या निवारण
समस्या: कंटेनर शुरू नहीं होगा — CUDA नहीं मिला
समस्या: Out of Memory (OOM) त्रुटि
समस्या: पोर्ट 7860 उपलब्ध नहीं है
समस्या: मॉडल डाउनलोड विफल होता है / डाउनलोड धीमा है
समस्या: ऑडियो गुणवत्ता खराब है
सुनिश्चित करें कि संदर्भ ऑडियो साफ़ हो (कोई बैकग्राउंड नॉइज़ नहीं, 16kHz+ सैंपल रेट)
संदर्भ ऑडियो को 10–30 सेकंड के बीच रखें
बेहतर संरेखण के लिए संदर्भ ऑडियो का ट्रांसक्रिप्ट दें
बढ़ाने का प्रयास करें
--num_samplesताकि कई विकल्प जनरेट हों और सर्वश्रेष्ठ चुना जा सके
समस्या: WebUI लोड होती है लेकिन जनरेशन अटक जाती है
लिंक्स
आधिकारिक दस्तावेज़: https://speech.fish.audio
Hugging Face मॉडल्स: https://huggingface.co/fishaudio/fish-speech-1.4
CLORE.AI मार्केटप्लेस: https://clore.ai/marketplace
Discord समुदाय: https://discord.gg/Es5qTB9BcN
Clore.ai GPU अनुशंसाएँ
विकास/परीक्षण
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
उत्पादन TTS
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
💡 इस गाइड के सभी उदाहरण Clore.ai GPU servers पर तैनात किए जा सकते हैं। उपलब्ध GPUs ब्राउज़ करें और घंटे के हिसाब से किराए पर लें — कोई प्रतिबद्धता नहीं, पूर्ण root access.
अंतिम अपडेट
क्या यह उपयोगी था?