For the complete documentation index, see llms.txt. This page is also available as Markdown.

Fish Speech

Clore.ai GPUs पर Fish Speech बहुभाषी TTS और ज़ीरो-शॉट वॉइस क्लोनिंग चलाएँ

Fish Speech एक अत्याधुनिक बहुभाषी टेक्स्ट-टू-स्पीच (TTS) सिस्टम है जिसमें ज़ीरो-शॉट वॉइस क्लोनिंग क्षमताएँ हैं। 15,000 से अधिक GitHub स्टार्स के साथ, यह अंग्रेज़ी, चीनी, जापानी, कोरियाई, फ़्रेंच, जर्मन, अरबी, स्पेनिश और अन्य भाषाओं का समर्थन करता है — वह भी एक ही मॉडल से। केवल 10–15 सेकंड के संदर्भ ऑडियो का उपयोग करके, Fish Speech किसी भी आवाज़ को उल्लेखनीय सटीकता के साथ क्लोन कर सकता है, जिससे यह ऑडियोबुक प्रोडक्शन, डबिंग, वर्चुअल असिस्टेंट्स और बड़े पैमाने पर कंटेंट निर्माण के लिए आदर्श बन जाता है।

Fish Speech एक transformer-आधारित आर्किटेक्चर और VQGAN vocoder का उपयोग करता है, और मानक TTS बेंचमार्क पर लगभग मानव-स्तर की प्राकृतिकता स्कोर प्राप्त करता है। WebUI (Gradio) इसे बिना एक भी कोड लाइन लिखे सुलभ बनाता है, जबकि REST API उत्पादन पाइपलाइनों में सहज एकीकरण सक्षम करता है।


सर्वर आवश्यकताएँ

पैरामीटर
न्यूनतम
अनुशंसित

GPU

NVIDIA RTX 3080 (10 GB)

NVIDIA RTX 4090 (24 GB)

VRAM

8 GB

16–24 GB

RAM

16 GB

32 GB

CPU

4 कोर

8+ कोर

डिस्क

20 GB

40 GB

ओएस

Ubuntu 20.04+

Ubuntu 22.04

CUDA

11.8+

12.1+

पोर्ट्स

22, 7860

22, 7860

Fish Speech मध्य-श्रेणी के GPUs (RTX 3080/3090) पर कुशलतापूर्वक चलता है। बैच इन्फ़रेंस या कई समकालिक उपयोगकर्ताओं को सर्व करने के लिए, RTX 4090 या A100 की सिफारिश की जाती है।


CLORE.AI पर त्वरित परिनियोजन

Fish Speech को चलाने का सबसे तेज़ तरीका Docker Hub से सीधे आधिकारिक Docker इमेज के माध्यम से है।

1. एक उपयुक्त सर्वर खोजें

पर जाएँ CLORE.AI मार्केटप्लेस और इनके अनुसार फ़िल्टर करें:

  • VRAM: ≥ 8 GB

  • GPU: RTX 3080, 3090, 4080, 4090, A100, H100

  • डिस्क: ≥ 20 GB

2. अपना परिनियोजन कॉन्फ़िगर करें

CLORE.AI ऑर्डर फ़ॉर्म में निम्न सेट करें:

Docker इमेज:

पोर्ट मैपिंग:

Environment Variables:

स्टार्टअप कमांड (वैकल्पिक — WebUI स्वतः शुरू हो जाएगा):

3. इंटरफ़ेस तक पहुँचें

डिप्लॉय होने के बाद, अपना ब्राउज़र खोलें और यहाँ जाएँ:

Gradio WebUI पूर्ण Fish Speech इंटरफ़ेस के साथ लोड होगी, जो उपयोग के लिए तैयार होगी।


चरण-दर-चरण सेटअप

चरण 1: अपने सर्वर में SSH करें

चरण 2: Docker कंटेनर को पुल करें और चलाएँ

चरण 3: GPU एक्सेस सत्यापित करें

आपको अपनी GPU उपलब्ध VRAM के साथ सूचीबद्ध दिखनी चाहिए।

चरण 4: मॉडल डाउनलोड की जाँच करें

Fish Speech पहली बार चलने पर मॉडल वेट्स स्वतः डाउनलोड करता है (~3–5 GB). प्रगति मॉनिटर करें:

तब तक प्रतीक्षा करें जब तक आपको यह न दिखे:

चरण 5: WebUI तक पहुँचें

पर जाएँ http://<server-ip>:7860 अपने ब्राउज़र में.

चरण 6: (वैकल्पिक) API सर्वर सक्षम करें


उपयोग के उदाहरण

उदाहरण 1: WebUI के माध्यम से मूल टेक्स्ट-टू-स्पीच

  1. WebUI खोलें http://<server-ip>:7860

  2. में टेक्स्ट दर्ज करें "टेक्स्ट" फ़ील्ड में:

  3. भाषा चुनें: अंग्रेज़ी

  4. क्लिक करें "जनरेट करें"

  5. परिणामस्वरूप प्राप्त .wav फ़ाइल


उदाहरण 2: ज़ीरो-शॉट वॉयस क्लोनिंग

केवल 10–15 सेकंड के संदर्भ ऑडियो का उपयोग करके किसी भी आवाज़ को क्लोन करें:

  1. WebUI में, जाएँ "वॉइस क्लोन" टैब

  2. अपनी संदर्भ ऑडियो फ़ाइल अपलोड करें (.wav या .mp3, 10–30 सेकंड)

  3. संदर्भ ऑडियो का ट्रांसक्रिप्ट दर्ज करें (वैकल्पिक, लेकिन गुणवत्ता बेहतर करता है)

  4. सिंथेसाइज़ करने के लिए लक्ष्य टेक्स्ट दर्ज करें

  5. क्लिक करें "क्लोन करें और जनरेट करें"

मॉडल आवाज़ की विशेषताओं का विश्लेषण करेगा और उसी आवाज़ में भाषण सिंथेसाइज़ करेगा।


उदाहरण 3: API-आधारित TTS (Python)


उदाहरण 4: बहुभाषी TTS


उदाहरण 5: ऑडियो फ़ाइलों का बैच प्रोसेसिंग


कॉन्फ़िगरेशन

Docker Compose (उत्पादन सेटअप)

मुख्य कॉन्फ़िगरेशन विकल्प

विकल्प
डिफ़ॉल्ट
विवरण

--listen

0.0.0.0

सर्वर को बाँधने के लिए इंटरफ़ेस

--port

7860

Gradio WebUI के लिए पोर्ट

--compile

false

तेज़ इन्फ़रेंस के लिए torch.compile सक्षम करें

--device

cuda

उपयोग करने के लिए डिवाइस (cuda, cpu, mps)

--half

true

FP16 हाफ-प्रिसीजन का उपयोग करें (VRAM बचाता है)

--num_samples

1

जनरेट करने के लिए ऑडियो सैंपलों की संख्या

--max_new_tokens

1024

जनरेशन के लिए अधिकतम नए टोकन

मॉडल वेरिएंट

मॉडल
आकार
भाषाएँ
नोट्स

fish-speech-1.4

~3 GB

8 भाषाएँ

नवीनतम स्थिर रिलीज़

fish-speech-1.2-sft

~2.5 GB

8 भाषाएँ

फ़ाइन-ट्यून किया गया संस्करण

fish-speech-1.2

~2.5 GB

8 भाषाएँ

आधार मॉडल


प्रदर्शन सुझाव

1. तेज़ इन्फ़रेंस के लिए torch.compile सक्षम करें

पहला रन धीमा होगा (कंपाइलेशन में 2–5 मिनट लगते हैं), लेकिन उसके बाद का इन्फ़रेंस 20–40% तेज़ होगा।

2. हाफ-प्रिसीजन (FP16) का उपयोग करें

FP16 न्यूनतम गुणवत्ता हानि के साथ VRAM उपयोग को ~50% तक कम करता है:

3. संदर्भ आवाज़ों को पहले से लोड करें

बार-बार उपयोग की जाने वाली संदर्भ आवाज़ों को कंटेनर की reference डायरेक्टरी में संग्रहीत करें ताकि पुनः-प्रोसेसिंग से बचा जा सके:

4. GPU मेमोरी अनुकूलन

5. बैच आकार ट्यूनिंग

बैच API अनुरोधों के लिए, सर्वोत्तम बैच आकार:

  • RTX 3080 (10 GB): batch_size = 1–2

  • RTX 3090/4090 (24 GB): batch_size = 4–8

  • A100 (40/80 GB): batch_size = 16–32


समस्या निवारण

समस्या: कंटेनर शुरू नहीं होगा — CUDA नहीं मिला

समस्या: Out of Memory (OOM) त्रुटि

समस्या: पोर्ट 7860 उपलब्ध नहीं है

समस्या: मॉडल डाउनलोड विफल होता है / डाउनलोड धीमा है

समस्या: ऑडियो गुणवत्ता खराब है

  • सुनिश्चित करें कि संदर्भ ऑडियो साफ़ हो (कोई बैकग्राउंड नॉइज़ नहीं, 16kHz+ सैंपल रेट)

  • संदर्भ ऑडियो को 10–30 सेकंड के बीच रखें

  • बेहतर संरेखण के लिए संदर्भ ऑडियो का ट्रांसक्रिप्ट दें

  • बढ़ाने का प्रयास करें --num_samples ताकि कई विकल्प जनरेट हों और सर्वश्रेष्ठ चुना जा सके

समस्या: WebUI लोड होती है लेकिन जनरेशन अटक जाती है


लिंक्स


Clore.ai GPU अनुशंसाएँ

उपयोग-प्रकरण
अनुशंसित GPU
Clore.ai पर अनुमानित लागत

विकास/परीक्षण

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

उत्पादन TTS

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

उच्च-थ्रूपुट इन्फ़रेंस

A100 80GB

💡 इस गाइड के सभी उदाहरण Clore.ai GPU servers पर तैनात किए जा सकते हैं। उपलब्ध GPUs ब्राउज़ करें और घंटे के हिसाब से किराए पर लें — कोई प्रतिबद्धता नहीं, पूर्ण root access.

अंतिम अपडेट

क्या यह उपयोगी था?