LTX-2 (ऑडियो + वीडियो)
Clore.ai GPUs पर LTX-2 का उपयोग करके देशी ऑडियो — foley, ambience, और lip-sync — के साथ वीडियो जनरेट करें।
LTX-2 (जनवरी 2026) Lightricks का दूसरी पीढ़ी का वीडियो फाउंडेशन मॉडल है और उत्पादन करने वाला पहला ओपन-वेट मॉडल है वीडियो के साथ समकालिक ऑडियो एक ही फॉरवर्ड पास में। 19B पैरामीटर पर यह अलग ऑडियो मॉडल की आवश्यकता के बिना फोली ध्वनि प्रभाव, परिवेशीय ऑडियो, और लिप-सिंक्ड भाषण वाले क्लिप बनाता है। आर्किटेक्चर मूल LTX-Video की गति-लाभ पर आधारित है, जबकि क्षमता को नाटकीय रूप से बढ़ाता है।
पर GPU किराए पर लेना Clore.ai 19B-पैरामीटर मॉडल चलाने का सबसे व्यावहारिक तरीका है — $2,000 का GPU खरीदने की आवश्यकता नहीं, बस एक मशीन चालू करें और जनरेट करना शुरू करें।
मुख्य विशेषताएँ
मूल ऑडियो जनरेशन — फोली प्रभाव, पर्यावरणीय एंबियंस, और लिप-सिंक्ड संवाद वीडियो फ़्रेमों के साथ संयुक्त रूप से उत्पन्न।
19B पैरामीटर — LTX-Video v1 की तुलना में काफी बड़ा ट्रांसफॉर्मर बैकबोन, जो अधिक तीक्ष्ण विवरण और अधिक सुसंगत गति देता है।
टेक्स्ट-टू-वीडियो + इमेज-टू-वीडियो — दोनों मोडैलिटीज़ ऑडियो आउटपुट के साथ समर्थित हैं।
720p तक का रेज़ोल्यूशन — v1 मॉडल की तुलना में अधिक उच्च-निष्ठा आउटपुट।
संयुक्त ऑडियो-विज़ुअल लैटेंट स्पेस — एक एकीकृत VAE वीडियो और ऑडियो दोनों को एन्कोड करता है, उन्हें समयानुसार संरेखित रखता है।
ओपन वेट्स — व्यावसायिक उपयोग के लिए उदार लाइसेंस के अंतर्गत जारी किया गया है।
Diffusers एकीकरण — Hugging Face
diffusersइकोसिस्टम के साथ संगत।
आवश्यकताएँ
GPU VRAM
16 GB (ऑफलोडिंग के साथ)
24+ GB
System RAM
32 GB
64 GB
डिस्क
50 GB
80 GB
Python
3.10+
3.11
CUDA
12.8+
12.8+
diffusers
0.33+
नवीनतम
Clore.ai GPU अनुशंसा: एक RTX 4090 (24 GB, $0.14–0.42/घंटा) ऑडियो के साथ आराम से 720p जनरेशन के लिए न्यूनतम है। बैच वर्कलोड या तेज़ iteration के लिए, फ़िल्टर करें dual-4090 या A6000 (48 GB) लिस्टिंग्स को Clore.ai मार्केटप्लेस पर।
त्वरित शुरुआत
उपयोग के उदाहरण
ऑडियो के साथ टेक्स्ट-टू-वीडियो
लिप-सिंक ऑडियो के साथ इमेज-टू-वीडियो
फोली के साथ परिवेशी दृश्य
Clore.ai उपयोगकर्ताओं के लिए सुझाव
ध्वनियों का स्पष्ट रूप से वर्णन करें — LTX-2 की ऑडियो शाखा प्रॉम्प्ट में दिए गए ऑडियो संकेतों पर प्रतिक्रिया करती है। "दरकती आग", "कंकड़ों पर पदचाप", "भीड़ की धीमी गुनगुनाहट" अधिक अस्पष्ट विवरणों की तुलना में बेहतर फोली देते हैं।
CPU ऑफलोडिंग आवश्यक है — 19B पैरामीटर पर, मॉडल को
enable_model_cpu_offload()24 GB कार्डों पर आवश्यकता होती है। बजट में 64 GB सिस्टम RAM रखें।स्थायी स्टोरेज — मॉडल चेकपॉइंट लगभग 40 GB का है। Clore.ai पर एक स्थायी वॉल्यूम माउंट करें और सेट करें
HF_HOMEताकि हर कंटेनर रीस्टार्ट पर फिर से डाउनलोड न करना पड़े।ऑडियो + वीडियो मक्स करें — यदि पाइपलाइन ऑडियो अलग से आउटपुट करती है, तो इसे इसके साथ मिलाएँ:
ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac final.mp4.केवल bf16 — 19B मॉडल को bf16 में प्रशिक्षित किया गया था; fp16 संख्यात्मक अस्थिरता पैदा करेगा।
tmux में बैच करें — हमेशा अंदर चलाएँ
tmuxSSH डिस्कनेक्ट से बचने के लिए Clore.ai किराए पर।मॉडल ID जांचें — क्योंकि LTX-2 अभी-अभी जारी हुआ है (जनवरी 2026), पर सटीक HuggingFace मॉडल ID सत्यापित करें Lightricks HF पेज चालू करने से पहले।
समस्या निवारण
OutOfMemoryError
सक्रिय करें pipe.enable_model_cpu_offload(); सुनिश्चित करें कि ≥64 GB सिस्टम RAM हो
आउटपुट में ऑडियो नहीं
ऑडियो जनरेशन के लिए स्पष्ट फ़्लैग या अपडेटेड diffusers की आवश्यकता हो सकती है; नवीनतम API के लिए मॉडल कार्ड देखें
ऑडियो/वीडियो असमयित
ffmpeg के साथ फिर से मक्स करें: ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest out.mp4
बहुत धीमी जनरेशन
19B मॉडल गणनात्मक रूप से भारी है; RTX 4090 पर 5-सेकंड क्लिप के लिए लगभग 2–4 मिनट अपेक्षित हैं
NaN आउटपुट
उपयोग करें torch.bfloat16 — इस मॉडल स्केल के लिए fp16 समर्थित नहीं है
डिस्क स्थान त्रुटि
मॉडल लगभग 40 GB का है; डाउनलोड करने से पहले ≥80 GB खाली डिस्क सुनिश्चित करें
ModuleNotFoundError: soundfile
pip install soundfile — WAV ऑडियो निर्यात के लिए आवश्यक
अंतिम अपडेट
क्या यह उपयोगी था?