> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/sravneniya/video-gen-comparison.md).

# Сравнение генерации видео

Сравните ведущие модели генерации видео с открытым исходным кодом для развертывания на GPU-серверах Clore.ai.

{% hint style="info" %}
**Генерация видео с ИИ** взлетела в 2024–2025 годах. Это руководство сравнивает лучшие модели с открытым исходным кодом — Hunyuan Video, Wan2.1, CogVideoX, Mochi 1 и LTX-Video — по качеству, скорости, требованиям к VRAM и сценариям использования.
{% endhint %}

***

## Быстрая матрица выбора

|                        | Hunyuan Video | Wan2.1     | CogVideoX  | Mochi 1    | LTX-Video  |
| ---------------------- | ------------- | ---------- | ---------- | ---------- | ---------- |
| **Разработчик**        | Tencent       | Alibaba    | Zhipu AI   | Genmo      | LightRicks |
| **Качество**           | ⭐⭐⭐⭐⭐         | ⭐⭐⭐⭐⭐      | ⭐⭐⭐⭐       | ⭐⭐⭐⭐       | ⭐⭐⭐        |
| **Скорость**           | Медленно      | Средне     | Средне     | Средне     | **Быстро** |
| **Мин. VRAM**          | 24 ГБ         | 16GB       | 16GB       | 24 ГБ      | **8 ГБ**   |
| **Макс. разрешение**   | 1280×720      | 1280×720   | 1440×960   | 848×480    | 1216×704   |
| **Макс. длительность** | 5s            | 5s         | 6 с        | 5,4 с      | 2 мин      |
| **Лицензия**           | CLA           | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| **Звёзды на GitHub**   | 10K+          | 7K+        | 6K+        | 4K+        | 5K+        |

***

## Обзор

### Hunyuan Video

Hunyuan Video от Tencent по состоянию на начало 2025 года широко считается лучшей моделью генерации видео с открытым исходным кодом. Она использует архитектуру на основе трансформера с исключительным качеством движения.

**Ключевые характеристики**: 13 млрд параметров, 5 с при 720p, требуется 24+ ГБ VRAM

### Wan2.1

Wan (Wenying) 2.1 от Alibaba — сильный конкурент Hunyuan, предлагающий сопоставимое качество при меньших минимальных требованиях к VRAM. Доступен в вариантах с 1.3B и 14B параметров.

**Ключевые характеристики**: 1.3B (lite) или 14B, 5 с при 720p, 16+ ГБ VRAM для 1.3B

### CogVideoX

CogVideoX от Zhipu AI делает упор на точное следование тексту и согласованное длинное видео. Особенно силён для кинематографического контента и генерации с сюжетом.

**Ключевые характеристики**: 5B/10B параметров, 6 с при 1440×960, 16+ ГБ VRAM

### Mochi 1

Mochi 1 от Genmo известен плавным, текучим движением и реалистичной физикой. Он использует новую архитектуру AsymmDiT. Доступен полностью с открытым исходным кодом (веса + код обучения).

**Ключевые характеристики**: 10B параметров, 5,4 с при 848×480, 24 ГБ VRAM

### LTX-Video

LTX-Video от LightRicks ставит во главу угла скорость инференса. Он может генерировать видео в реальном времени или почти в реальном времени на современных GPU — идеально для интерактивных приложений.

**Ключевые характеристики**: 2B параметров, до 2 минут видео, 8 ГБ VRAM

***

## Сравнение качества

### Бенчмарк EvalCrafter (2025)

{% hint style="info" %}
Качество субъективно. Эти оценки отражают консенсус сообщества по бенчмаркам VBench и EvalCrafter.
{% endhint %}

| Модель        | Оценка VBench | Качество движения | Соответствие тексту | Эстетика  |
| ------------- | ------------- | ----------------- | ------------------- | --------- |
| Hunyuan Video | **83.2**      | **Отлично**       | Отлично             | Отлично   |
| Wan2.1 (14B)  | **82.8**      | Отлично           | Отлично             | Отлично   |
| CogVideoX-5B  | 79.6          | Хорошо            | **Очень хорошо**    | Хорошо    |
| Mochi 1       | 77.4          | Очень хорошо      | Хорошо              | Хорошо    |
| LTX-Video     | 71.2          | Хорошо            | Хорошо              | Приемлемо |

### Качественные сильные стороны

| Модель        | Лучше всего подходит для                   | Недостатки                                    |
| ------------- | ------------------------------------------ | --------------------------------------------- |
| Hunyuan Video | Общее качество, кинематография             | Очень медленный, прожорливый к VRAM           |
| Wan2.1        | Баланс качества/эффективности, I2V         | Иногда пересыщенные цвета                     |
| CogVideoX     | Длинная нарративная форма, точность текста | Менее динамичное движение                     |
| Mochi 1       | Плавное движение, физика                   | Более низкий предел разрешения                |
| LTX-Video     | Скорость, длинные видео                    | Отставание по качеству по сравнению с другими |

***

## Бенчмарки скорости

### Время генерации (A100 80 ГБ, один GPU)

| Модель        | 480p 5 с | 720p 5 с  | 1080p 5 с |
| ------------- | -------- | --------- | --------- |
| Hunyuan Video | 45 мин   | \~3 часа  | ❌ OOM     |
| Wan2.1 (14B)  | 15 мин   | 45 мин    | ❌ OOM     |
| Wan2.1 (1.3B) | 3 мин    | 8 мин     | ❌ OOM     |
| CogVideoX-5B  | 10 мин   | 25 мин    | ❌ OOM     |
| Mochi 1       | 8 мин    | ❌ OOM     | ❌ OOM     |
| LTX-Video     | **45 с** | **3 мин** | 8 мин     |

{% hint style="warning" %}
**Время приблизительное** и зависит от шагов сэмплера (20–50), масштаба guidance и оборудования. Для предварительных просмотров используйте меньше шагов.
{% endhint %}

### С оптимизацией (TeaCache / FORA / Step Distillation)

Оптимизированный инференс может значительно сократить время генерации:

| Модель        | С кэшем         | Ускорение |
| ------------- | --------------- | --------- |
| Hunyuan Video | \~15 мин (720p) | 4×        |
| Wan2.1        | \~12 мин (720p) | \~4×      |
| CogVideoX     | \~8 мин (720p)  | \~3×      |
| LTX-Video     | \~45 с (720p)   | 4×        |

***

## Требования к VRAM

### Минимальный объём VRAM по модели и разрешению

| Модель        | 480p     | 720p   | 1080p |
| ------------- | -------- | ------ | ----- |
| Hunyuan Video | 24 ГБ    | 40 ГБ+ | ❌     |
| Wan2.1 (14B)  | 24 ГБ    | 40 ГБ+ | ❌     |
| Wan2.1 (1.3B) | **8 ГБ** | 16GB   | 24 ГБ |
| CogVideoX-5B  | 16GB     | 24 ГБ  | ❌     |
| CogVideoX-2B  | **8 ГБ** | 16GB   | ❌     |
| Mochi 1       | 24 ГБ    | ❌      | ❌     |
| LTX-Video     | **8 ГБ** | 12GB   | 24 ГБ |

### Техники оптимизации памяти

#### Квантование

```python
# CogVideoX с 8-битной квантизацией (вдвое снижает VRAM)
from diffusers import CogVideoXPipeline
import torch

pipe = CogVideoXPipeline.from_pretrained(
    "THUDM/CogVideoX-5b",
    torch_dtype=torch.float16
)
pipe.enable_model_cpu_offload()  # Дополнительно снижает VRAM
pipe.vae.enable_slicing()
pipe.vae.enable_tiling()
```

#### Выгрузка на CPU

```python
# Wan2.1 с выгрузкой на CPU для снижения VRAM
from diffusers import WanPipeline

pipe = WanPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
```

***

## Hunyuan Video: Подробный разбор

### Архитектура

* **13B DiT** (параметры Diffusion Transformer)
* Полное внимание ко всем пространственным и временным токенам
* Обучена на более чем 1 млрд видеоклипов

### Развертывание на Clore.ai

```bash
# Клонируйте и установите
git clone https://github.com/Tencent/HunyuanVideo
cd HunyuanVideo
pip install -r requirements.txt

# Скачайте веса (~87 ГБ)
huggingface-cli download tencent/HunyuanVideo --local-dir ./weights

# Генерировать
python sample_video.py \\
  --video-size 720 1280 \\
  --video-length 129 \\
  --infer-steps 50 \\
  --prompt "Величественный орёл, парящий над заснеженными горами" \\
  --flow-shift 7.0 \\
  --embedded-cfg-scale 6.0 \\
  --save-path ./outputs
```

### Через ComfyUI

```bash
# Установите узлы HunyuanVideo для ComfyUI
cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-HunyuanVideoWrapper
pip install -r ComfyUI-HunyuanVideoWrapper/requirements.txt
```

**Лучше всего для**: Генерация кинематографического видео высочайшего качества, без ограничений по VRAM

***

## Wan2.1: Подробный разбор

### Архитектура

* **Два варианта**: Wan2.1-T2V-1.3B и Wan2.1-T2V-14B
* **Изображение в видео** Модель (I2V) также доступна
* Сильная поддержка многоязычных запросов (китайский + английский)

### Развертывание на Clore.ai

```python
from diffusers import WanPipeline
from diffusers.utils import export_to_video
import torch

# Модель 1.3B — помещается в 8–16 ГБ VRAM
pipe = WanPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

output = pipe(
    prompt="Спокойный японский сад с падающими лепестками сакуры",
    negative_prompt="низкое качество, размыто",
    height=480,
    width=832,
    num_frames=81,
    num_inference_steps=50,
    guidance_scale=5.0,
).frames[0]

export_to_video(output, "wan_video.mp4", fps=16)
```

### Изображение-в-видео с Wan2.1

```python
from diffusers import WanImageToVideoPipeline
from PIL import Image

pipe = WanImageToVideoPipeline.from_pretrained(
    "Wan-AI/Wan2.1-I2V-14B-480P-Diffusers",
    torch_dtype=torch.bfloat16,
)
pipe.enable_model_cpu_offload()

image = Image.open("input.jpg")
output = pipe(
    image=image,
    prompt="Человек уверенно идёт вперёд",
    num_frames=81,
).frames[0]
```

**Лучше всего для**: Баланс качества и эффективности, I2V, многоязычность

***

## CogVideoX: Подробный разбор

### Архитектура

* **Экспертный трансформер** с 3D полным вниманием
* **5B и 10B** варианты параметров
* энкодер изображений CogView3 для качества визуализации

### Развертывание на Clore.ai

```python
from diffusers import CogVideoXPipeline
from diffusers.utils import export_to_video
import torch

pipe = CogVideoXPipeline.from_pretrained(
    "THUDM/CogVideoX-5b",
    torch_dtype=torch.bfloat16
)
pipe.to("cuda")
pipe.vae.enable_slicing()
pipe.vae.enable_tiling()

video = pipe(
    prompt="Покадровая съёмка города ночью со световыми следами от автомобилей",
    num_videos_per_prompt=1,
    num_inference_steps=50,
    num_frames=49,
    guidance_scale=6,
    generator=torch.Generator(device="cuda").manual_seed(42),
).frames[0]

export_to_video(video, "cogvideo.mp4", fps=8)
```

**Лучше всего для**: Точное преобразование текста в видео, нарративный контент, длинная генерация

***

## Mochi 1: Подробный разбор

### Архитектура

* **AsymmDiT** — асимметричный диффузионный трансформер
* Фокус на временной согласованности и плавном движении
* Полностью open-source, включая код обучения

### Развертывание на Clore.ai

```bash
pip install mochi-preview

python -c "
from mochi_preview.pipelines import DecoderModelFactory, DitModelFactory, MochiSingleGPUPipeline, T5ModelFactory
import tempfile
from pathlib import Path

pipeline = MochiSingleGPUPipeline(
    text_encoder_factory=T5ModelFactory(),
    dit_factory=DitModelFactory(model_path='./weights/mochi-dit.safetensors'),
    decoder_factory=DecoderModelFactory(model_path='./weights/mochi-vae.safetensors'),
    cpu_offload=True,
    decode_type='tiled_full',
)

video = pipeline(
    height=480, width=848,
    num_frames=163,
    num_inference_steps=64,
    sigma_schedule_type='linear_quadratic',
    cfg_schedule_type='linear',
    conditioning_args={'prompt': 'Дельфин, выпрыгивающий из океанских волн на закате'},
)
"
```

**Лучше всего для**: Плавное движение, реалистичная физика, исследовательские сценарии

***

## LTX-Video: Подробный разбор

### Архитектура

* **2B-параметр** DiT — меньше, быстрее
* Нативная **длинное видео** поддержка (до 2 минут)
* Разработан для генерации в реальном времени или почти в реальном времени

### Развертывание на Clore.ai

```python
from diffusers import LTXPipeline
from diffusers.utils import export_to_video
import torch

pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video",
    torch_dtype=torch.bfloat16
)
pipe.to("cuda")

video = pipe(
    prompt="Бабочка, садящаяся на цветок в летнем саду",
    negative_prompt="худшее качество, несогласованное движение, размыто",
    width=704,
    height=480,
    num_frames=161,
    decode_timestep=0.03,
    decode_noise_scale=0.025,
    num_inference_steps=50,
).frames[0]

export_to_video(video, "ltx_video.mp4", fps=24)
```

**Лучше всего для**: Быстрая генерация, интерактивные приложения, длинные видео, ограниченная VRAM (8 ГБ)

***

## Сравнение функций

### Обзор возможностей

| Функция               | Hunyuan  | Wan2.1 | CogVideoX | Mochi | LTX |
| --------------------- | -------- | ------ | --------- | ----- | --- |
| Текст в видео         | ✅        | ✅      | ✅         | ✅     | ✅   |
| Изображение в видео   | ✅        | ✅      | ✅         | ❌     | ✅   |
| Видео-в-видео         | ❌        | ❌      | ✅         | ❌     | ✅   |
| ControlNet            | Частично | ❌      | ✅         | ❌     | ❌   |
| Поддержка LoRA        | ✅        | ✅      | ✅         | ❌     | ✅   |
| Узлы ComfyUI          | ✅        | ✅      | ✅         | ✅     | ✅   |
| Длинное видео (>10 с) | ❌        | ❌      | Частично  | ❌     | ✅   |
| Запросы на китайском  | ✅        | ✅      | ✅         | ❌     | ❌   |

***

## Рекомендации по GPU для Clore.ai

### Для каждой модели

| Модель        | Минимальная GPU  | Рекомендуется | Идеально     |
| ------------- | ---------------- | ------------- | ------------ |
| Hunyuan Video | RTX 3090 (24 ГБ) | A6000 (48 ГБ) | A100 (80 ГБ) |
| Wan2.1 14B    | RTX 3090 (24 ГБ) | A6000 (48 ГБ) | A100 (80 ГБ) |
| Wan2.1 1.3B   | RTX 3080 (10GB)  | RTX 3090      | RTX 4090     |
| CogVideoX-5B  | RTX 3090 (24 ГБ) | A6000 (48 ГБ) | A100         |
| CogVideoX-2B  | RTX 3080 (10GB)  | RTX 3090      | RTX 4090     |
| Mochi 1       | RTX 3090 (24 ГБ) | A6000 (48 ГБ) | A100         |
| LTX-Video     | RTX 3080 (10GB)  | RTX 4080      | RTX 4090     |

### Оценка стоимости за видео

```
Hunyuan Video (720p, 5s) на A100 80 ГБ ([голое железо](https://clore.ai/bare-metal)):
  Время: ~45 мин → Стоимость: ~$1.12 за видео

Wan2.1-1.3B (480p, 5s) на RTX 3090 ($0.07–0.21/ч):
  Время: ~3 мин → Стоимость: ~$0.025 за видео

LTX-Video (720p, 5s) на RTX 4090 ($0.14–0.42/ч):
  Время: ~3 мин → Стоимость: ~$0.030 за видео
```

***

## Когда что использовать

### Руководство по выбору

```
Максимальное качество (без ограничений по стоимости)?
  → Hunyuan Video на A100

Лучший баланс качества и стоимости?
  → Wan2.1 14B на A6000

Ограниченная VRAM (8–12 ГБ)?
  → LTX-Video или Wan2.1 1.3B

Нужна быстрая генерация?
  → LTX-Video

Нужен Image-to-Video?
  → Wan2.1 I2V или CogVideoX

Нужны длинные видео (>10 с)?
  → LTX-Video

Исследования/дообучение?
  → Mochi 1 (открытый код обучения) или CogVideoX

Рабочий процесс в ComfyUI?
  → Поддерживаются все, лучшие узлы у Hunyuan/Wan
```

***

## Полезные ссылки

* [Hunyuan Video GitHub](https://github.com/Tencent/HunyuanVideo)
* [Wan2.1 на HuggingFace](https://huggingface.co/Wan-AI)
* [CogVideoX GitHub](https://github.com/THUDM/CogVideo)
* [Mochi 1 GitHub](https://github.com/genmoai/mochi)
* [LTX-Video GitHub](https://github.com/Lightricks/LTX-Video)
* [Таблица лидеров генерации видео](https://huggingface.co/spaces/ArtificialAnalysis/video-generation-arena-leaderboard)

***

## Итог

| Модель            | Использовать, когда                                    |
| ----------------- | ------------------------------------------------------ |
| **Hunyuan Video** | Качество важнее всего, доступен A100+                  |
| **Wan2.1**        | Лучший баланс качества и эффективности                 |
| **CogVideoX**     | Точное преобразование текста в видео, длинный нарратив |
| **Mochi 1**       | Плавное движение, физика, открытые исследования        |
| **LTX-Video**     | Скорость, низкая VRAM, длинные видео                   |

Экосистема генерации видео с открытым исходным кодом быстро развивается. Для большинства развёртываний на Clore.ai, **Wan2.1** (1.3B — для бюджета, 14B — для качества) предлагает лучшее сочетание качества, скорости и эффективности использования ресурсов.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/sravneniya/video-gen-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
