ChatTTS संवादात्मक भाषण
Clore.ai GPUs पर fine-grained prosody control के साथ ChatTTS conversational text-to-speech चलाएँ।
अंतिम अपडेट
क्या यह उपयोगी था?
क्या यह उपयोगी था?
# PyPI से इंस्टॉल करें
pip install ChatTTS torch torchaudio
# या नवीनतम फीचर्स के लिए स्रोत से इंस्टॉल करें
git clone https://github.com/2noise/ChatTTS.git
cd ChatTTS
pip install -r requirements.txt
# GPU सत्यापित करें
python -c "import torch; print(torch.cuda.get_device_name(0))"import ChatTTS
import torch
import torchaudio
# मॉडल प्रारम्भ करें और लोड करें (पहली बार रन पर वेट्स डाउनलोड होते हैं)
chat = ChatTTS.Chat()
chat.load(compile=False) # वार्मअप के बाद तेज़ इनफ़रेंस के लिए compile=True सेट करें
texts = [
"अरे वहाँ! आपका दिन अब तक कैसा चल रहा है?",
"मैं इस प्रोजेक्ट पर पूरी सुबह काम कर रहा/रही हूँ। यह अच्छी तरह से बन रहा है।",
]
wavs = chat.infer(texts)
for i, wav in enumerate(wavs):
audio_tensor = torch.from_numpy(wav)
if audio_tensor.dim() == 1:
audio_tensor = audio_tensor.unsqueeze(0)
torchaudio.save(f"output_{i}.wav", audio_tensor, 24000)
print(f"Saved output_{i}.wav")import ChatTTS
import torch
import torchaudio
chat = ChatTTS.Chat()
chat.load(compile=False)
# एक वक्ता सैंपल करें — बाद में पुन: उपयोग करने के लिए इस स्ट्रिंग को सेव करें
rand_spk = chat.sample_random_speaker()
params_infer_code = ChatTTS.Chat.InferCodeParams(
spk_emb=rand_spk,
temperature=0.3,
top_P=0.7,
top_K=20,
)
params_refine_text = ChatTTS.Chat.RefineTextParams(
prompt='[oral_2][laugh_0][break_4]',
)
texts = ["Welcome to today's episode. Let me tell you about something exciting."]
wavs = chat.infer(
texts,
params_refine_text=params_refine_text,
params_infer_code=params_infer_code,
)
audio = torch.from_numpy(wavs[0])
if audio.dim() == 1:
audio = audio.unsqueeze(0)
torchaudio.save("consistent_speaker.wav", audio, 24000)import ChatTTS
import torch
import torchaudio
chat = ChatTTS.Chat()
chat.load(compile=False)
# टैग: [uv_break] = छोटी रुकी, [laugh] = हँसी, [lbreak] = लंबी रुकी
text = 'What is [uv_break]your favorite food?[laugh][lbreak]'
rand_spk = chat.sample_random_speaker()
params = ChatTTS.Chat.InferCodeParams(spk_emb=rand_spk, temperature=0.3)
# skip_refine_text=True आपके मैन्युअल नियंत्रण टैग्स को संरक्षित करता है
wavs = chat.infer(text, skip_refine_text=True, params_infer_code=params)
audio = torch.from_numpy(wavs[0])
if audio.dim() == 1:
audio = audio.unsqueeze(0)
torchaudio.save("controlled_output.wav", audio, 24000)cd ChatTTS
python examples/web/webui.py --server_name 0.0.0.0 --server_port 7860