Mochi-1 视频
Mochi-1 是 Genmo 的开源 100 亿参数视频生成模型,可输出 848×480 @ 30fps,具有符合物理规律的真实运动。它采用非对称扩散 Transformer(AsymmDiT)架构,在运动保真度方面位列开源视频模型中的前列。将其部署在 Clore.ai 的 GPU 云上,即可用仅为商业 API 一小部分的成本生成专业级视频。
什么是 Mochi-1?
Mochi-1 是一个 100 亿参数 视频扩散模型,经过训练可生成具有以下特性的影片:
平滑、符合物理规律的运动
高时间一致性
对提示词的强遵循性
848×480 分辨率,30 fps
它采用 非对称扩散 Transformer (AsymmDiT)架构——视频和文本使用不同的编码器深度——从而实现可扩展的高效推理。模型权重以 Genmo 开源许可证发布,可免费用于研究和商业用途。
模型亮点:
100 亿参数
原生输出 848×480 @ 30 fps
高运动保真度(在社区基准测试中排名靠前)
可在 Hugging Face 上使用,并集成 diffusers
用于便捷交互的 Gradio 演示界面
前提条件
GPU 显存
24 GB
40–80 GB
GPU
RTX 4090
A100 / H100
内存
32 GB
64 GB
存储
60 GB
100 GB
CUDA
12.8+
12.8+
Mochi-1 是一个大型模型(fp8 约 40 GB / bf16 约 80 GB)。单张 RTX 4090(24 GB)可在量化后运行。要获得完整质量,建议使用 A100 40 GB 或更高配置。支持多 GPU 配置。
步骤 1——在 Clore.ai 上租用 GPU
前往 clore.ai 并登录。
点击 市场 并筛选:
显存: ≥ 24 GB (最低 RTX 4090,推荐 A100)
多 GPU:筛选 GPU 数量 ≥ 2
选择你的服务器并点击 配置.
将 Docker 镜像设置为
pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel(基础镜像——我们会在其中安装 Mochi。)设置开放端口:
22(SSH)和7860(Gradio UI)。点击 租用.
步骤 2 — 自定义 Dockerfile
构建你自己的镜像,或使用此 Dockerfile 来创建一个可直接使用的 Mochi-1 环境:
构建并推送到 Docker Hub
在本地构建镜像并将其推送到你自己的 Docker Hub 账户(替换 YOUR_DOCKERHUB_USERNAME 为你的实际用户名):
然后在 Clore.ai 中使用 YOUR_DOCKERHUB_USERNAME/mochi-1:latest 作为你的 Docker 镜像。
步骤 3 — 通过 SSH 连接
实例运行后:
步骤 4 — 下载 Mochi-1 权重
模型权重托管在 Hugging Face 上。可通过以下方式下载: huggingface_hub CLI:
替代方案:仅下载 fp8 量化权重
步骤 5 — 启动 Gradio 演示
Mochi-1 附带一个 Gradio 网页 UI,便于进行文本生成视频:
低显存模式(RTX 4090,24 GB):
步骤 6 — 访问网页 UI
打开浏览器并访问:
你将看到带有以下内容的 Mochi-1 Gradio 界面:
文本提示输入框
生成设置(步数、引导比例、种子)
视频输出播放器
步骤 7 — 生成你的第一个视频
示例提示词
自然场景:
动作场景:
抽象/艺术风格:
推荐设置
步数
64
引导比例
4.5
时长
5.1 秒(默认)
分辨率
848×480(原生)
Python API 用法
如需程序化生成,请使用 diffusers 管线:
批量生成脚本
多 GPU 推理
如需使用多张 GPU 加快生成速度:
故障排查
CUDA 显存不足
解决方案:
在
--cpu_offload添加到 gradio 命令中启用 VAE slicing:
pipe.enable_vae_slicing()减少
num_frames(试试 24 而不是 84)使用 fp8 量化权重代替 bf16
模型加载缓慢
解决方案: 确保权重位于高速 NVMe 磁盘上,而不是 HDD。检查存储速度:
视频伪影 / 时间闪烁
解决方案:
增加推理步数(试试 80–100)
调整引导比例(通常 3.5–5.0 范围最佳)
使用特定种子以便复现和迭代
7860 端口无法访问
检查该端口是否已在 Clore.ai 中正确开放,以及 Gradio 服务器是否正在绑定到 0.0.0.0:
成本估算
Clore.ai GPU 推荐
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
Mochi-1 非常占用显存——这款 100 亿参数模型需要谨慎选择 GPU。
不推荐 RTX 3090(24GB) —— Mochi-1 在 fp8 模式下至少需要 24GB 显存,且几乎没有余量。RTX 4090(24GB)可以在 fp8 下运行,但在较长序列上经常 OOM。为了获得可靠结果,建议从 A100 40GB 开始。
性价比最佳: A100 40GB,价格 裸机 可在 3–5 分钟内生成一段 5 秒视频。每个视频片段约 $0.08–0.10——明显比 Runway ML($0.25–0.50/片)或 Pika Labs 订阅更便宜。
有用资源
最后更新于
这有帮助吗?