For the complete documentation index, see llms.txt. This page is also available as Markdown.

LTX-2 (ऑडियो + वीडियो)

Clore.ai GPUs पर LTX-2 का उपयोग करके देशी ऑडियो — foley, ambience, और lip-sync — के साथ वीडियो जनरेट करें।

LTX-2 (जनवरी 2026) Lightricks का दूसरी पीढ़ी का वीडियो फाउंडेशन मॉडल है और उत्पादन करने वाला पहला ओपन-वेट मॉडल है वीडियो के साथ समकालिक ऑडियो एक ही फॉरवर्ड पास में। 19B पैरामीटर पर यह अलग ऑडियो मॉडल की आवश्यकता के बिना फोली ध्वनि प्रभाव, परिवेशीय ऑडियो, और लिप-सिंक्ड भाषण वाले क्लिप बनाता है। आर्किटेक्चर मूल LTX-Video की गति-लाभ पर आधारित है, जबकि क्षमता को नाटकीय रूप से बढ़ाता है।

पर GPU किराए पर लेना Clore.ai 19B-पैरामीटर मॉडल चलाने का सबसे व्यावहारिक तरीका है — $2,000 का GPU खरीदने की आवश्यकता नहीं, बस एक मशीन चालू करें और जनरेट करना शुरू करें।

मुख्य विशेषताएँ

  • मूल ऑडियो जनरेशन — फोली प्रभाव, पर्यावरणीय एंबियंस, और लिप-सिंक्ड संवाद वीडियो फ़्रेमों के साथ संयुक्त रूप से उत्पन्न।

  • 19B पैरामीटर — LTX-Video v1 की तुलना में काफी बड़ा ट्रांसफॉर्मर बैकबोन, जो अधिक तीक्ष्ण विवरण और अधिक सुसंगत गति देता है।

  • टेक्स्ट-टू-वीडियो + इमेज-टू-वीडियो — दोनों मोडैलिटीज़ ऑडियो आउटपुट के साथ समर्थित हैं।

  • 720p तक का रेज़ोल्यूशन — v1 मॉडल की तुलना में अधिक उच्च-निष्ठा आउटपुट।

  • संयुक्त ऑडियो-विज़ुअल लैटेंट स्पेस — एक एकीकृत VAE वीडियो और ऑडियो दोनों को एन्कोड करता है, उन्हें समयानुसार संरेखित रखता है।

  • ओपन वेट्स — व्यावसायिक उपयोग के लिए उदार लाइसेंस के अंतर्गत जारी किया गया है।

  • Diffusers एकीकरण — Hugging Face diffusers इकोसिस्टम के साथ संगत।

आवश्यकताएँ

घटक
न्यूनतम
अनुशंसित

GPU VRAM

16 GB (ऑफलोडिंग के साथ)

24+ GB

System RAM

32 GB

64 GB

डिस्क

50 GB

80 GB

Python

3.10+

3.11

CUDA

12.8+

12.8+

diffusers

0.33+

नवीनतम

Clore.ai GPU अनुशंसा: एक RTX 4090 (24 GB, $0.14–0.42/घंटा) ऑडियो के साथ आराम से 720p जनरेशन के लिए न्यूनतम है। बैच वर्कलोड या तेज़ iteration के लिए, फ़िल्टर करें dual-4090 या A6000 (48 GB) लिस्टिंग्स को Clore.ai मार्केटप्लेस पर।

त्वरित शुरुआत

उपयोग के उदाहरण

ऑडियो के साथ टेक्स्ट-टू-वीडियो

लिप-सिंक ऑडियो के साथ इमेज-टू-वीडियो

फोली के साथ परिवेशी दृश्य

Clore.ai उपयोगकर्ताओं के लिए सुझाव

  1. ध्वनियों का स्पष्ट रूप से वर्णन करें — LTX-2 की ऑडियो शाखा प्रॉम्प्ट में दिए गए ऑडियो संकेतों पर प्रतिक्रिया करती है। "दरकती आग", "कंकड़ों पर पदचाप", "भीड़ की धीमी गुनगुनाहट" अधिक अस्पष्ट विवरणों की तुलना में बेहतर फोली देते हैं।

  2. CPU ऑफलोडिंग आवश्यक है — 19B पैरामीटर पर, मॉडल को enable_model_cpu_offload() 24 GB कार्डों पर आवश्यकता होती है। बजट में 64 GB सिस्टम RAM रखें।

  3. स्थायी स्टोरेज — मॉडल चेकपॉइंट लगभग 40 GB का है। Clore.ai पर एक स्थायी वॉल्यूम माउंट करें और सेट करें HF_HOME ताकि हर कंटेनर रीस्टार्ट पर फिर से डाउनलोड न करना पड़े।

  4. ऑडियो + वीडियो मक्स करें — यदि पाइपलाइन ऑडियो अलग से आउटपुट करती है, तो इसे इसके साथ मिलाएँ: ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac final.mp4.

  5. केवल bf16 — 19B मॉडल को bf16 में प्रशिक्षित किया गया था; fp16 संख्यात्मक अस्थिरता पैदा करेगा।

  6. tmux में बैच करें — हमेशा अंदर चलाएँ tmux SSH डिस्कनेक्ट से बचने के लिए Clore.ai किराए पर।

  7. मॉडल ID जांचें — क्योंकि LTX-2 अभी-अभी जारी हुआ है (जनवरी 2026), पर सटीक HuggingFace मॉडल ID सत्यापित करें Lightricks HF पेज चालू करने से पहले।

समस्या निवारण

समस्या
ठीक करें

OutOfMemoryError

सक्रिय करें pipe.enable_model_cpu_offload(); सुनिश्चित करें कि ≥64 GB सिस्टम RAM हो

आउटपुट में ऑडियो नहीं

ऑडियो जनरेशन के लिए स्पष्ट फ़्लैग या अपडेटेड diffusers की आवश्यकता हो सकती है; नवीनतम API के लिए मॉडल कार्ड देखें

ऑडियो/वीडियो असमयित

ffmpeg के साथ फिर से मक्स करें: ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest out.mp4

बहुत धीमी जनरेशन

19B मॉडल गणनात्मक रूप से भारी है; RTX 4090 पर 5-सेकंड क्लिप के लिए लगभग 2–4 मिनट अपेक्षित हैं

NaN आउटपुट

उपयोग करें torch.bfloat16 — इस मॉडल स्केल के लिए fp16 समर्थित नहीं है

डिस्क स्थान त्रुटि

मॉडल लगभग 40 GB का है; डाउनलोड करने से पहले ≥80 GB खाली डिस्क सुनिश्चित करें

ModuleNotFoundError: soundfile

pip install soundfile — WAV ऑडियो निर्यात के लिए आवश्यक

अंतिम अपडेट

क्या यह उपयोगी था?