For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mochi-1 视频

Mochi-1 是 Genmo 的开源 100 亿参数视频生成模型,可输出 848×480 @ 30fps,具有符合物理规律的真实运动。它采用非对称扩散 Transformer(AsymmDiT)架构,在运动保真度方面位列开源视频模型中的前列。将其部署在 Clore.ai 的 GPU 云上,即可用仅为商业 API 一小部分的成本生成专业级视频。


什么是 Mochi-1?

Mochi-1 是一个 100 亿参数 视频扩散模型,经过训练可生成具有以下特性的影片:

  • 平滑、符合物理规律的运动

  • 高时间一致性

  • 对提示词的强遵循性

  • 848×480 分辨率,30 fps

它采用 非对称扩散 Transformer (AsymmDiT)架构——视频和文本使用不同的编码器深度——从而实现可扩展的高效推理。模型权重以 Genmo 开源许可证发布,可免费用于研究和商业用途。

模型亮点:

  • 100 亿参数

  • 原生输出 848×480 @ 30 fps

  • 高运动保真度(在社区基准测试中排名靠前)

  • 可在 Hugging Face 上使用,并集成 diffusers

  • 用于便捷交互的 Gradio 演示界面


前提条件

要求
最低
推荐

GPU 显存

24 GB

40–80 GB

GPU

RTX 4090

A100 / H100

内存

32 GB

64 GB

存储

60 GB

100 GB

CUDA

12.8+

12.8+


步骤 1——在 Clore.ai 上租用 GPU

  1. 前往 clore.ai 并登录。

  2. 点击 市场 并筛选:

    • 显存: ≥ 24 GB (最低 RTX 4090,推荐 A100)

    • 多 GPU:筛选 GPU 数量 ≥ 2

  3. 选择你的服务器并点击 配置.

  4. 将 Docker 镜像设置为 pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel (基础镜像——我们会在其中安装 Mochi。)

  5. 设置开放端口: 22 (SSH)和 7860 (Gradio UI)。

  6. 点击 租用.

Clore.ai 列出了从以下价格起的 A100 40 GB 实例: 裸机。对于以完整质量运行 Mochi-1,这是最具成本效益的选择。


步骤 2 — 自定义 Dockerfile

构建你自己的镜像,或使用此 Dockerfile 来创建一个可直接使用的 Mochi-1 环境:

构建并推送到 Docker Hub

在本地构建镜像并将其推送到你自己的 Docker Hub 账户(替换 YOUR_DOCKERHUB_USERNAME 为你的实际用户名):

然后在 Clore.ai 中使用 YOUR_DOCKERHUB_USERNAME/mochi-1:latest 作为你的 Docker 镜像。

Docker Hub 上没有 Mochi-1 的官方预构建 Docker 镜像。你需要使用上面的 Dockerfile 自行构建。或者,直接使用 pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel 作为基础镜像,并通过 SSH 手动运行安装命令。


步骤 3 — 通过 SSH 连接

实例运行后:


步骤 4 — 下载 Mochi-1 权重

模型权重托管在 Hugging Face 上。可通过以下方式下载: huggingface_hub CLI:

完整的 bf16 模型约为 80 GB。 fp8 量化版本约 40 GB,可在启用 CPU 卸载的情况下运行于 RTX 4090(24 GB)。请指定 --include "*fp8*" 以仅下载量化权重。

替代方案:仅下载 fp8 量化权重


步骤 5 — 启动 Gradio 演示

Mochi-1 附带一个 Gradio 网页 UI,便于进行文本生成视频:

低显存模式(RTX 4090,24 GB):

--cpu_offload 标志会在不使用时将模型层转移到 CPU RAM,从而将峰值显存降至约 18–20 GB,但生成速度会变慢约 2 倍。


步骤 6 — 访问网页 UI

打开浏览器并访问:

你将看到带有以下内容的 Mochi-1 Gradio 界面:

  • 文本提示输入框

  • 生成设置(步数、引导比例、种子)

  • 视频输出播放器


步骤 7 — 生成你的第一个视频

示例提示词

自然场景:

动作场景:

抽象/艺术风格:

推荐设置

参数
数值

步数

64

引导比例

4.5

时长

5.1 秒(默认)

分辨率

848×480(原生)

生成时间因 GPU 而异,差别很大。在 A100 80 GB 上,生成一段 5 秒视频大约需要 2–4 分钟。在 RTX 4090 搭配 CPU 卸载时,预计需要 8–15 分钟.


Python API 用法

如需程序化生成,请使用 diffusers 管线:

批量生成脚本


多 GPU 推理

如需使用多张 GPU 加快生成速度:

Clore.ai 提供多 GPU 服务器(2×、4× RTX 4090 或 A100)。使用 2× A100 80 GB 时,生成一段 5 秒视频的时间可降至 60 秒以内。


故障排查

CUDA 显存不足

解决方案:

  1. --cpu_offload 添加到 gradio 命令中

  2. 启用 VAE slicing: pipe.enable_vae_slicing()

  3. 减少 num_frames (试试 24 而不是 84)

  4. 使用 fp8 量化权重代替 bf16

模型加载缓慢

解决方案: 确保权重位于高速 NVMe 磁盘上,而不是 HDD。检查存储速度:

视频伪影 / 时间闪烁

解决方案:

  • 增加推理步数(试试 80–100)

  • 调整引导比例(通常 3.5–5.0 范围最佳)

  • 使用特定种子以便复现和迭代

7860 端口无法访问

检查该端口是否已在 Clore.ai 中正确开放,以及 Gradio 服务器是否正在绑定到 0.0.0.0:


成本估算

GPU
显存
预估价格
5 秒视频时长

RTX 4090

24 GB

$0.14–0.42/小时

~10–15 分钟

A100 40GB

40 GB

~3–5 分钟

A100 80GB

80 GB

~2–3 分钟

2× A100 80GB

160 GB

~60–90 秒


Clore.ai GPU 推荐

Mochi-1 非常占用显存——这款 100 亿参数模型需要谨慎选择 GPU。

GPU
显存
Clore.ai 价格
模式
5 秒视频生成时间

RTX 4090

24 GB

$0.14–0.42/小时

仅 fp8 量化

~10–15 分钟

A100 40GB

40 GB

推荐 bf16

~3–5 分钟

A100 80GB

80 GB

完整 bf16,速度快

~2–3 分钟

2× A100 80GB

160 GB

张量并行,最快

~60–90 秒

性价比最佳: A100 40GB,价格 裸机 可在 3–5 分钟内生成一段 5 秒视频。每个视频片段约 $0.08–0.10——明显比 Runway ML($0.25–0.50/片)或 Pika Labs 订阅更便宜。


有用资源

最后更新于

这有帮助吗?