> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/comparaciones/video-gen-comparison.md).

# Comparación de generación de video

Compara los principales modelos de generación de video de código abierto para su despliegue en servidores GPU de Clore.ai.

{% hint style="info" %}
**Generación de video con IA** se ha disparado en 2024-2025. Esta guía compara los principales modelos de código abierto — Hunyuan Video, Wan2.1, CogVideoX, Mochi 1 y LTX-Video — cubriendo calidad, velocidad, requisitos de VRAM y casos de uso.
{% endhint %}

***

## Matriz rápida de decisión

|                         | Hunyuan Video | Wan2.1     | CogVideoX  | Mochi 1    | LTX-Video  |
| ----------------------- | ------------- | ---------- | ---------- | ---------- | ---------- |
| **Desarrollador**       | Tencent       | Alibaba    | Zhipu AI   | Genmo      | LightRicks |
| **Calidad**             | ⭐⭐⭐⭐⭐         | ⭐⭐⭐⭐⭐      | ⭐⭐⭐⭐       | ⭐⭐⭐⭐       | ⭐⭐⭐        |
| **Velocidad**           | Lento         | Medio      | Medio      | Medio      | **Rápido** |
| **VRAM mínima**         | 24GB          | 16GB       | 16GB       | 24GB       | **8GB**    |
| **Resolución máxima**   | 1280×720      | 1280×720   | 1440×960   | 848×480    | 1216×704   |
| **Longitud máxima**     | 5s            | 5s         | 6 s        | 5,4 s      | 2 min      |
| **Licencia**            | CLA           | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| **Estrellas en GitHub** | 10K+          | 7K+        | 6K+        | 4K+        | 5K+        |

***

## Descripción general

### Hunyuan Video

Hunyuan Video de Tencent es ampliamente considerado el mejor modelo de generación de video de código abierto a principios de 2025. Utiliza una arquitectura basada en transformadores con una calidad de movimiento excepcional.

**Especificaciones clave**: 13B parámetros, 5 s a 720p, requiere 24GB+ de VRAM

### Wan2.1

Wan (Wenying) 2.1 de Alibaba es un competidor sólido de Hunyuan, ofreciendo una calidad similar con menores requisitos mínimos de VRAM. Disponible en variantes de 1,3B y 14B parámetros.

**Especificaciones clave**: 1,3B (lite) o 14B, 5 s a 720p, 16GB+ de VRAM para 1,3B

### CogVideoX

CogVideoX de Zhipu AI se centra en seguir con precisión el texto y en video coherente de formato largo. Es especialmente fuerte para contenido cinematográfico y generación basada en historias.

**Especificaciones clave**: 5B/10B parámetros, 6 s a 1440×960, 16GB+ de VRAM

### Mochi 1

Mochi 1 de Genmo es conocido por un movimiento suave y fluido y una física realista. Utiliza una nueva arquitectura AsymmDiT. Disponible completamente como código abierto (pesos + código de entrenamiento).

**Especificaciones clave**: 10B parámetros, 5,4 s a 848×480, 24GB de VRAM

### LTX-Video

LTX-Video de LightRicks prioriza por encima de todo la velocidad de inferencia. Puede generar video en tiempo real o casi en tiempo real en GPU modernas — ideal para aplicaciones interactivas.

**Especificaciones clave**: 2B parámetros, hasta 2 minutos de video, 8GB de VRAM

***

## Comparación de calidad

### Benchmark EvalCrafter (2025)

{% hint style="info" %}
La calidad es subjetiva. Estas puntuaciones reflejan el consenso de la comunidad a partir de los benchmarks VBench y EvalCrafter.
{% endhint %}

| Modelo        | Puntuación VBench | Calidad del movimiento | Alineación con el texto | Estética  |
| ------------- | ----------------- | ---------------------- | ----------------------- | --------- |
| Hunyuan Video | **83.2**          | **Excelente**          | Excelente               | Excelente |
| Wan2.1 (14B)  | **82.8**          | Excelente              | Excelente               | Excelente |
| CogVideoX-5B  | 79.6              | Bueno                  | **Muy bueno**           | Bueno     |
| Mochi 1       | 77.4              | Muy bueno              | Bueno                   | Bueno     |
| LTX-Video     | 71.2              | Bueno                  | Bueno                   | Aceptable |

### Fortalezas cualitativas

| Modelo        | Lo mejor para                                   | Debilidades                      |
| ------------- | ----------------------------------------------- | -------------------------------- |
| Hunyuan Video | Calidad general, cinematografía                 | Muy lento, consume mucha VRAM    |
| Wan2.1        | Equilibrio entre calidad y eficiencia, I2V      | Ocasionalmente sobresaturado     |
| CogVideoX     | Narrativa de formato largo, precisión del texto | Movimiento menos dinámico        |
| Mochi 1       | Movimiento fluido, física                       | Límite de resolución más bajo    |
| LTX-Video     | Velocidad, videos largos                        | Brecha de calidad frente a otros |

***

## Benchmarks de velocidad

### Tiempo de generación (A100 80GB, GPU única)

| Modelo        | 480p 5 s | 720p 5 s      | 1080p 5 s     |
| ------------- | -------- | ------------- | ------------- |
| Hunyuan Video | 45 min   | \~3 horas     | ❌ Sin memoria |
| Wan2.1 (14B)  | 15 min   | 45 min        | ❌ Sin memoria |
| Wan2.1 (1.3B) | 3 min    | 8 min         | ❌ Sin memoria |
| CogVideoX-5B  | 10 min   | 25 min        | ❌ Sin memoria |
| Mochi 1       | 8 min    | ❌ Sin memoria | ❌ Sin memoria |
| LTX-Video     | **45 s** | **3 min**     | 8 min         |

{% hint style="warning" %}
**Los tiempos son aproximados** y varían con los pasos del muestreador (20-50), la escala de guía y el hardware. Usa menos pasos para las vistas previas.
{% endhint %}

### Con optimización (TeaCache / FORA / distilación de pasos)

La inferencia optimizada puede reducir significativamente el tiempo de generación:

| Modelo        | Con caché       | Aceleración |
| ------------- | --------------- | ----------- |
| Hunyuan Video | \~15 min (720p) | 4×          |
| Wan2.1        | \~12 min (720p) | \~4×        |
| CogVideoX     | \~8 min (720p)  | \~3×        |
| LTX-Video     | \~45 s (720p)   | 4×          |

***

## Requisitos de VRAM

### VRAM mínima por modelo y resolución

| Modelo        | 480p    | 720p   | 1080p |
| ------------- | ------- | ------ | ----- |
| Hunyuan Video | 24GB    | 40 GB+ | ❌     |
| Wan2.1 (14B)  | 24GB    | 40 GB+ | ❌     |
| Wan2.1 (1.3B) | **8GB** | 16GB   | 24GB  |
| CogVideoX-5B  | 16GB    | 24GB   | ❌     |
| CogVideoX-2B  | **8GB** | 16GB   | ❌     |
| Mochi 1       | 24GB    | ❌      | ❌     |
| LTX-Video     | **8GB** | 12GB   | 24GB  |

### Técnicas de optimización de memoria

#### Cuantización

```python
# CogVideoX con cuantización de 8 bits (reduce a la mitad la VRAM)
from diffusers import CogVideoXPipeline
import torch

pipe = CogVideoXPipeline.from_pretrained(
    "THUDM/CogVideoX-5b",
    torch_dtype=torch.float16
)
pipe.enable_model_cpu_offload()  # Reduce aún más la VRAM
pipe.vae.enable_slicing()
pipe.vae.enable_tiling()
```

#### Descarga a CPU

```python
# Wan2.1 con descarga a CPU para menor VRAM
from diffusers import WanPipeline

pipe = WanPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
```

***

## Hunyuan Video: Análisis en profundidad

### Arquitectura

* **13B DiT** (parámetros del Transformer de difusión)
* Atención completa sobre todos los tokens espaciales y temporales
* Entrenado con más de 1B clips de video

### Despliegue en Clore.ai

```bash
# Clonar e instalar
git clone https://github.com/Tencent/HunyuanVideo
cd HunyuanVideo
pip install -r requirements.txt

# Descargar pesos (~87GB)
huggingface-cli download tencent/HunyuanVideo --local-dir ./weights

# Generar
python sample_video.py \
  --video-size 720 1280 \
  --video-length 129 \
  --infer-steps 50 \
  --prompt "Un águila majestuosa surcando sobre montañas nevadas" \
  --flow-shift 7.0 \
  --embedded-cfg-scale 6.0 \
  --save-path ./outputs
```

### Vía ComfyUI

```bash
# Instalar los nodos de HunyuanVideo para ComfyUI
cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-HunyuanVideoWrapper
pip install -r ComfyUI-HunyuanVideoWrapper/requirements.txt
```

**Ideal para**: Generación de video cinematográfico de la más alta calidad, sin restricciones de VRAM

***

## Wan2.1: Análisis en profundidad

### Arquitectura

* **Dos variantes**: Wan2.1-T2V-1.3B y Wan2.1-T2V-14B
* **Imagen a video** (Modelo I2V también disponible)
* Prompts sólidos multilingües (chino + inglés)

### Despliegue en Clore.ai

```python
from diffusers import WanPipeline
from diffusers.utils import export_to_video
import torch

# Modelo de 1,3B — cabe en 8-16GB de VRAM
pipe = WanPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

output = pipe(
    prompt="Un sereno jardín japonés con flores de cerezo cayendo",
    negative_prompt="de baja calidad, borroso",
    height=480,
    width=832,
    num_frames=81,
    num_inference_steps=50,
    guidance_scale=5.0,
).frames[0]

export_to_video(output, "wan_video.mp4", fps=16)
```

### Conversión de imagen a video con Wan2.1

```python
from diffusers import WanImageToVideoPipeline
from PIL import Image

pipe = WanImageToVideoPipeline.from_pretrained(
    "Wan-AI/Wan2.1-I2V-14B-480P-Diffusers",
    torch_dtype=torch.bfloat16,
)
pipe.enable_model_cpu_offload()

image = Image.open("input.jpg")
output = pipe(
    image=image,
    prompt="La persona camina hacia adelante con confianza",
    num_frames=81,
).frames[0]
```

**Ideal para**: Equilibrio entre calidad y eficiencia, I2V, multilingüe

***

## CogVideoX: Análisis en profundidad

### Arquitectura

* **Transformador experto** con atención completa 3D
* **5B y 10B** variantes de parámetros
* Codificador de imágenes CogView3 para calidad visual

### Despliegue en Clore.ai

```python
from diffusers import CogVideoXPipeline
from diffusers.utils import export_to_video
import torch

pipe = CogVideoXPipeline.from_pretrained(
    "THUDM/CogVideoX-5b",
    torch_dtype=torch.bfloat16
)
pipe.to("cuda")
pipe.vae.enable_slicing()
pipe.vae.enable_tiling()

video = pipe(
    prompt="Un time-lapse de una ciudad de noche con estelas de luz de los coches",
    num_videos_per_prompt=1,
    num_inference_steps=50,
    num_frames=49,
    guidance_scale=6,
    generator=torch.Generator(device="cuda").manual_seed(42),
).frames[0]

export_to_video(video, "cogvideo.mp4", fps=8)
```

**Ideal para**: Texto a video preciso, contenido narrativo, generación de formato largo

***

## Mochi 1: Análisis en profundidad

### Arquitectura

* **AsymmDiT** — transformador de difusión asimétrico
* Enfoque en la consistencia temporal y el movimiento fluido
* Completamente de código abierto, incluido el código de entrenamiento

### Despliegue en Clore.ai

```bash
pip install mochi-preview

python -c "
from mochi_preview.pipelines import DecoderModelFactory, DitModelFactory, MochiSingleGPUPipeline, T5ModelFactory
import tempfile
from pathlib import Path

pipeline = MochiSingleGPUPipeline(
    text_encoder_factory=T5ModelFactory(),
    dit_factory=DitModelFactory(model_path='./weights/mochi-dit.safetensors'),
    decoder_factory=DecoderModelFactory(model_path='./weights/mochi-vae.safetensors'),
    cpu_offload=True,
    decode_type='tiled_full',
)

video = pipeline(
    height=480, width=848,
    num_frames=163,
    num_inference_steps=64,
    sigma_schedule_type='linear_quadratic',
    cfg_schedule_type='linear',
    conditioning_args={'prompt': 'Un delfín saltando entre las olas del océano al atardecer'},
)
"
```

**Ideal para**: Movimiento fluido, física realista, casos de uso de investigación

***

## LTX-Video: Análisis en profundidad

### Arquitectura

* **parámetro 2B** DiT — más pequeño, más rápido
* Nativo **video largo** soporte (hasta 2 minutos)
* Diseñado para generación en tiempo real o casi en tiempo real

### Despliegue en Clore.ai

```python
from diffusers import LTXPipeline
from diffusers.utils import export_to_video
import torch

pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video",
    torch_dtype=torch.bfloat16
)
pipe.to("cuda")

video = pipe(
    prompt="Una mariposa posándose sobre una flor en un jardín de verano",
    negative_prompt="peor calidad, movimiento inconsistente, borroso",
    width=704,
    height=480,
    num_frames=161,
    decode_timestep=0.03,
    decode_noise_scale=0.025,
    num_inference_steps=50,
).frames[0]

export_to_video(video, "ltx_video.mp4", fps=24)
```

**Ideal para**: Generación rápida, aplicaciones interactivas, videos largos, VRAM limitada (8GB)

***

## Comparación de características

### Resumen de capacidades

| Función                 | Hunyuan | Wan2.1 | CogVideoX | Mochi | LTX |
| ----------------------- | ------- | ------ | --------- | ----- | --- |
| Texto a video           | ✅       | ✅      | ✅         | ✅     | ✅   |
| Imagen a video          | ✅       | ✅      | ✅         | ❌     | ✅   |
| Video a video           | ❌       | ❌      | ✅         | ❌     | ✅   |
| ControlNet              | Parcial | ❌      | ✅         | ❌     | ❌   |
| Compatibilidad con LoRA | ✅       | ✅      | ✅         | ❌     | ✅   |
| Nodos de ComfyUI        | ✅       | ✅      | ✅         | ✅     | ✅   |
| Video largo (>10 s)     | ❌       | ❌      | Parcial   | ❌     | ✅   |
| Prompts en chino        | ✅       | ✅      | ✅         | ❌     | ❌   |

***

## Recomendaciones de GPU para Clore.ai

### Para cada modelo

| Modelo        | GPU mínima      | Recomendado  | Ideal       |
| ------------- | --------------- | ------------ | ----------- |
| Hunyuan Video | RTX 3090 (24GB) | A6000 (48GB) | A100 (80GB) |
| Wan2.1 14B    | RTX 3090 (24GB) | A6000 (48GB) | A100 (80GB) |
| Wan2.1 1.3B   | RTX 3080 (10GB) | RTX 3090     | RTX 4090    |
| CogVideoX-5B  | RTX 3090 (24GB) | A6000 (48GB) | A100        |
| CogVideoX-2B  | RTX 3080 (10GB) | RTX 3090     | RTX 4090    |
| Mochi 1       | RTX 3090 (24GB) | A6000 (48GB) | A100        |
| LTX-Video     | RTX 3080 (10GB) | RTX 4080     | RTX 4090    |

### Estimación de costo por video

```
Hunyuan Video (720p, 5 s) en A100 80GB ([metal desnudo](https://clore.ai/bare-metal)):
  Tiempo: ~45 min → Costo: ~$1.12 por video

Wan2.1-1.3B (480p, 5 s) en RTX 3090 ($0.07–0.21/h):
  Tiempo: ~3 min → Costo: ~$0.025 por video

LTX-Video (720p, 5 s) en RTX 4090 ($0.14–0.42/h):
  Tiempo: ~3 min → Costo: ~$0.030 por video
```

***

## Cuándo usar cada uno

### Guía de decisión

```
¿Máxima calidad (sin límite de costo)?
  → Hunyuan Video en A100

¿Mejor equilibrio calidad/costo?
  → Wan2.1 14B en A6000

¿VRAM limitada (8-12GB)?
  → LTX-Video o Wan2.1 1.3B

¿Necesitas generación rápida?
  → LTX-Video

¿Necesitas imagen a video?
  → Wan2.1 I2V o CogVideoX

¿Necesitas videos largos (>10 s)?
  → LTX-Video

¿Investigación/ajuste fino?
  → Mochi 1 (código de entrenamiento abierto) o CogVideoX

¿Flujo de trabajo en ComfyUI?
  → Todos son compatibles, los mejores nodos son Hunyuan/Wan
```

***

## Enlaces útiles

* [GitHub de Hunyuan Video](https://github.com/Tencent/HunyuanVideo)
* [Wan2.1 en HuggingFace](https://huggingface.co/Wan-AI)
* [GitHub de CogVideoX](https://github.com/THUDM/CogVideo)
* [GitHub de Mochi 1](https://github.com/genmoai/mochi)
* [GitHub de LTX-Video](https://github.com/Lightricks/LTX-Video)
* [Tabla de clasificación de generación de video](https://huggingface.co/spaces/ArtificialAnalysis/video-generation-arena-leaderboard)

***

## Resumen

| Modelo            | Cuándo usar                                                 |
| ----------------- | ----------------------------------------------------------- |
| **Hunyuan Video** | Cuando la mejor calidad importa más y hay A100+ disponibles |
| **Wan2.1**        | Mejor equilibrio entre calidad y eficiencia                 |
| **CogVideoX**     | Texto a video preciso, narrativa larga                      |
| **Mochi 1**       | Movimiento fluido, física, investigación abierta            |
| **LTX-Video**     | Velocidad, poca VRAM, videos largos                         |

El ecosistema de generación de video de código abierto avanza rápido. Para la mayoría de los despliegues en Clore.ai, **Wan2.1** (1.3B para presupuesto, 14B para calidad) ofrece la mejor combinación de calidad, velocidad y eficiencia de recursos.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/comparaciones/video-gen-comparison.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
