Mochi-1 वीडियो
Mochi-1 Genmo का ओपन-सोर्स 10 अरब पैरामीटर वाला वीडियो जनरेशन मॉडल है, जो भौतिक रूप से यथार्थवादी गति के साथ 848×480 @ 30fps आउटपुट तैयार करता है। यह asymmetric diffusion transformer (AsymmDiT) आर्किटेक्चर का उपयोग करता है और गति की विश्वसनीयता के लिए शीर्ष-गुणवत्ता वाले ओपन-सोर्स वीडियो मॉडलों में गिना जाता है। इसे Clore.ai के GPU क्लाउड पर तैनात करके आप व्यावसायिक API लागत के एक छोटे हिस्से में प्रोफेशनल-ग्रेड वीडियो बना सकते हैं।
Mochi-1 क्या है?
Mochi-1 एक 10 अरब पैरामीटर वाला वीडियो डिफ्यूजन मॉडल है, जिसे निम्न बनाने के लिए प्रशिक्षित किया गया है:
स्मूद, भौतिक रूप से संभाव्य गति
उच्च समयिक स्थिरता
प्रॉम्प्ट का मजबूत अनुपालन
848×480 रिज़ॉल्यूशन पर 30 fps
यह एक asymmetric diffusion transformer (AsymmDiT) आर्किटेक्चर का उपयोग करता है — वीडियो और टेक्स्ट के लिए अलग encoder depths — जिससे बड़े पैमाने पर कुशल inference संभव होता है। वज़न Genmo Open Source License के तहत जारी किए गए हैं, जो शोध और व्यावसायिक उपयोग के लिए निःशुल्क हैं।
मॉडल की मुख्य विशेषताएँ:
10 अरब पैरामीटर
नेटिव 848×480 @ 30 fps आउटपुट
उच्च मोशन निष्ठा (समुदाय बेंचमार्क में शीर्ष स्थान)
diffusers इंटीग्रेशन के साथ Hugging Face पर उपलब्ध
आसान इंटरैक्शन के लिए Gradio डेमो UI
पूर्वापेक्षाएँ
GPU VRAM
24 GB
40–80 GB
GPU
RTX 4090
A100 / H100
RAM
32 GB
64 GB
स्टोरेज
60 GB
100 GB
CUDA
12.8+
12.8+
Mochi-1 एक बड़ा मॉडल है (fp8 में लगभग 40 GB / bf16 में लगभग 80 GB)। एक अकेला RTX 4090 (24 GB) इसे quantization के साथ चला सकता है। पूर्ण गुणवत्ता के लिए A100 40 GB या उससे बड़ा उपयोग करें। Multi-GPU सेटअप समर्थित हैं।
चरण 1 — Clore.ai पर GPU किराए पर लें
पर जाएँ clore.ai और साइन इन करें।
क्लिक करें मार्केटप्लेस और फ़िल्टर करें:
VRAM: ≥ 24 GB (RTX 4090 न्यूनतम, A100 अनुशंसित)
Multi-GPU के लिए: GPU count ≥ 2 से फ़िल्टर करें
अपना सर्वर चुनें और क्लिक करें कॉन्फ़िगर करें.
Docker image सेट करें
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel(base image — हम इसके अंदर Mochi इंस्टॉल करेंगे)।ओपन पोर्ट सेट करें:
22(SSH) और7860(Gradio UI)।क्लिक करें किराए पर लें.
चरण 2 — कस्टम Dockerfile
अपना स्वयं का image build करें या इसका उपयोग करें Dockerfile एक तैयार-से-उपयोग Mochi-1 environment बनाने के लिए:
Docker Hub पर Build और Push करें
इमेज को स्थानीय रूप से build करें और इसे अपने Docker Hub खाते पर push करें (बदलें YOUR_DOCKERHUB_USERNAME अपने वास्तविक उपयोगकर्ता नाम से):
फिर इसका उपयोग करें YOUR_DOCKERHUB_USERNAME/mochi-1:latest Clore.ai में अपनी Docker image के रूप में।
चरण 3 — SSH के माध्यम से कनेक्ट करें
एक बार आपका instance चलने लगे:
चरण 4 — Mochi-1 वज़न डाउनलोड करें
मॉडल वज़न Hugging Face पर होस्ट किए गए हैं। इन्हें huggingface_hub CLI के माध्यम से डाउनलोड करें:
विकल्प: केवल fp8 quantized वज़न डाउनलोड करें
चरण 5 — Gradio डेमो लॉन्च करें
Mochi-1 आसान text-to-video जनरेशन के लिए Gradio web UI के साथ आता है:
कम-VRAM मोड के लिए (RTX 4090, 24 GB):
चरण 6 — Web UI तक पहुँचें
अपना browser खोलें और यहाँ जाएँ:
आपको Mochi-1 Gradio interface में यह दिखाई देगा:
एक text prompt input
Generation settings (steps, guidance scale, seed)
Video output player
चरण 7 — अपना पहला वीडियो बनाइए
उदाहरण प्रॉम्प्ट
प्रकृति दृश्य:
एक्शन दृश्य:
अमूर्त/कलात्मक:
अनुशंसित सेटिंग्स
स्टेप्स
64
Guidance Scale
4.5
अवधि
5.1 सेकंड (डिफ़ॉल्ट)
रिज़ॉल्यूशन
848×480 (नेटिव)
Python API उपयोग
कार्यक्रमात्मक जनरेशन के लिए, diffusers pipeline का उपयोग करें:
बैच जनरेशन स्क्रिप्ट
बहु-GPU inference
अनेक GPUs के साथ तेज़ जनरेशन के लिए:
समस्या निवारण
CUDA मेमोरी समाप्त
समाधान:
जोड़ें
--cpu_offloadको gradio कमांड मेंVAE slicing सक्षम करें:
pipe.enable_vae_slicing()कम करें
num_frames(84 के बजाय 24 आज़माएँ)bf16 के बजाय fp8 quantized वज़न का उपयोग करें
मॉडल लोड होना धीमा
समाधान: सुनिश्चित करें कि वज़न HDD पर नहीं, बल्कि तेज़ NVMe drive पर हों। स्टोरेज गति जाँचें:
वीडियो artifacts / temporal flickering
समाधान:
inference steps बढ़ाएँ (80–100 आज़माएँ)
guidance scale समायोजित करें (आमतौर पर 3.5–5.0 दायरा सबसे अच्छा होता है)
पुनरुत्पादन और iteration के लिए एक विशिष्ट seed का उपयोग करें
Port 7860 पहुँच योग्य नहीं है
जाँचें कि port Clore.ai में सही ढंग से खोला गया है और Gradio server इससे bind हो रहा है 0.0.0.0:
लागत अनुमान
RTX 4090
24 GB
$0.14–0.42/hr
~10–15 मिनट
Clore.ai GPU अनुशंसाएँ
Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं। आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता bare metal के रूप में अनुरोध पर बेची जाती है। देखें GPU मूल्य और उपलब्धता किसी deployment का आकार तय करने से पहले।
Mochi-1 VRAM बहुत खाता है — 10B parameter मॉडल के लिए सावधानीपूर्वक GPU चयन की आवश्यकता होती है।
RTX 4090
24 GB
$0.14–0.42/hr
केवल fp8 quantized
~10–15 मिनट
A100 80GB
80 GB
पूर्ण bf16, तेज़
~2–3 मिनट
RTX 3090 (24GB) अनुशंसित नहीं है — Mochi-1 का fp8 मोड में कम-से-कम 24GB की आवश्यकता होती है और लगभग कोई अतिरिक्त स्थान नहीं छोड़ता। RTX 4090 (24GB) fp8 में काम करता है लेकिन लंबे sequences पर बार-बार OOM हो जाता है। विश्वसनीय परिणामों के लिए A100 40GB से शुरू करें।
गुणवत्ता के लिए सर्वोत्तम मूल्य: A100 40GB पर bare metal 3–5 मिनट में 5-सेकंड क्लिप बनाता है। यह लगभग $0.08–0.10 प्रति वीडियो क्लिप है — Runway ML ($0.25–0.50/clip) या Pika Labs subscriptions की तुलना में काफ़ी सस्ता।
उपयोगी संसाधन
अंतिम अपडेट
क्या यह उपयोगी था?