AnimateDiff
AnimateDiff es un módulo plug-and-play que anima tus modelos Stable Diffusion existentes sin ningún entrenamiento adicional. Con más de 10.000 estrellas en GitHub, es el marco de referencia para convertir checkpoints SD de imagen fija en generadores de video suaves y temporalmente coherentes. Ejecútalo en una instancia de GPU de Clore.ai usando ComfyUI como front-end para máxima flexibilidad.
¿Qué es AnimateDiff?
AnimateDiff inserta un módulo de movimiento en un U-Net de Stable Diffusion congelado. El módulo de movimiento se entrena una sola vez con datos de video y puede combinarse con cualquier checkpoint de SD 1.5 ajustado — modelos DreamBooth, LoRAs, adaptadores ControlNet — sin reentrenamiento. El resultado son clips animados cortos (normalmente 16–32 fotogramas a 8 fps) que conservan el estilo del modelo base.
Puntos destacados clave:
Funciona con cualquier checkpoint de SD 1.5 desde el primer momento
Compatible con ControlNet, IP-Adapter, LoRAs y otras extensiones
El ecosistema de nodos de ComfyUI proporciona control total del flujo de trabajo
Módulos de movimiento SDXL disponibles para salida de mayor resolución
Zoo de modelos mantenido por la comunidad con módulos de movimiento específicos por dominio
Requisitos previos
VRAM de GPU
8 GB
16–24 GB
GPU
RTX 3080
RTX 4090 / A100
RAM
16 GB
32 GB
Almacenamiento
20 GB
50+ GB
Paso 1 — Alquila una GPU en Clore.ai
Ve a clore.ai y entra.
Haz clic en Marketplace y filtra por VRAM (≥ 16 GB para mejores resultados).
Selecciona un servidor — RTX 4090 o A6000 ofrece la mejor relación precio/rendimiento.
En Imagen Docker, introduce tu imagen personalizada (ver el Paso 2 abajo).
Configurar abrir puertos:
22(SSH) y8188(interfaz web de ComfyUI).Haz clic en Alquilar y espera a que la instancia se inicie (~1–2 minutos).
Paso 2 — Imagen Docker
No existe una única imagen Docker oficial de AnimateDiff. El enfoque recomendado es usar una imagen basada en ComfyUI con los nodos de AnimateDiff preinstalados.
Imagen pública recomendada:
O construye la tuya propia:
Paso 3 — Conéctate por SSH
Una vez que la instancia esté en ejecución, conéctate por SSH para descargar modelos:
Reemplaza <clore-host> y <assigned-ssh-port> con los valores mostrados en tu panel de Clore.ai.
Paso 4 — Descargar modelos
AnimateDiff requiere como mínimo un checkpoint base de SD 1.5 y un módulo de movimiento.
Descargar módulo de movimiento
Descargar un checkpoint base de SD 1.5
(Opcional) Descargar módulo de movimiento SDXL
Paso 5 — Acceder a ComfyUI
Abre tu navegador y navega a:
Deberías ver la interfaz del editor de nodos de ComfyUI.
Paso 6 — Cargar un flujo de trabajo de AnimateDiff
Flujo de trabajo básico de AnimateDiff (JSON)
En ComfyUI, pulsa Cargar y pega o importa este JSON de flujo de trabajo, o constrúyelo manualmente con estos nodos:
Cadena de nodos principal:
Cargar punto de control→ tu checkpoint de SD 1.5CLIP Text Encode (Prompt)→ prompts positivo y negativoAnimateDiff Loader→ selecciona tu módulo de movimientoKSampler (Efficient)→ ajustes de muestreoDecodificación VAE→ decodificar latentesVideo Combine(VideoHelperSuite) → exportar como GIF/MP4
Ajustes de muestreo recomendados
Pasos
20–25
Escala CFG
7–8
Sampler
DPM++ 2M Karras
Anchura × Altura
512 × 512
Fotogramas
16
Longitud del contexto
16
Paso 7 — Ejecuta tu primera animación
En la
Codificación de texto CLIPnodo, introduce tu prompt:En el nodo de prompt negativo:
En
AnimateDiff Loader, seleccionav3_sd15_mm.ckptHaz clic en Encolar prompt
Técnicas avanzadas
Usar ControlNet con AnimateDiff
AnimateDiff funciona con ControlNet para generación de video guiada:
Añade un ControlNet Apply nodo entre Load ControlNet Model y KSampler. Usa una imagen de esqueleto OpenPose como entrada de condicionamiento.
Prompt Travel (animación por fotogramas clave)
El nodo AnimateDiff-Evolved admite prompt travel — distintos prompts de texto en distintos fotogramas:
Esto crea transiciones suaves entre escenas sin necesidad de keyframes manuales.
Usar LoRA con AnimateDiff
Añade un LoRA Loader nodo para aplicar efectos de movimiento de cámara: PanLeft, PanRight, ZoomIn, ZoomOut, RollingAnticlockwise.
Formatos de salida
AnimateDiff mediante VideoHelperSuite admite:
GIF
Video Combine
Mejor para compartir
MP4 (h264)
Video Combine
Tamaño de archivo más pequeño
WebP
Video Combine
Buena calidad/tamaño
Fotogramas PNG
Guardar imagen
Para posprocesado
Solución de problemas
Falta de memoria (CUDA OOM)
Soluciones:
Reduce el número de fotogramas (prueba 8 en lugar de 16)
Reduce la resolución (512×512 es el punto ideal para SD 1.5)
Habilita
--lowvrambandera en el comando de inicio de ComfyUIUsa
fp16precisión enCargar punto de controlnodo
No se encontró el módulo de movimiento
Solución: Verifica que el archivo .ckpt esté en:
Actualiza la página de ComfyUI para volver a cargar los modelos disponibles.
Parpadeo / fotogramas inconsistentes
Soluciones:
Aumenta
context_lengthpara que coincida con el recuento total de fotogramasUsa
v3_sd15_mm.ckpten lugar de v2 (mejor coherencia temporal)Reduce la escala CFG (prueba 7 en lugar de 9)
Usa un sampler de menor varianza:
DPM++ 2M KarrasoEuler a
Conexión SSH rechazada
Solución: Espera 1–2 minutos a que arranque el demonio SSH, o comprueba si el contenedor se ha inicializado completamente en los registros del panel de Clore.ai.
Recomendaciones de GPU para Clore.ai
AnimateDiff usa la base de SD 1.5 — los requisitos de VRAM son modestos en comparación con los modelos de video modernos, lo que lo hace económico.
RTX 3090
24 GB
$0.07–0.21/h
~50 s
Mejor relación calidad-precio — ejecuta varios lotes en cola
RTX 4090
24 GB
$0.14–0.42/h
~30 s
GPU de consumo más rápida
RTX 3080 10GB
10 GB
$0,05–0,19/h
~90 s
Mínimo económico — limitado a 512px, clips más cortos
Usuarios de SDXL AnimateDiff: Los módulos de movimiento de SDXL requieren 12 GB+ de VRAM para 768px. RTX 3090/4090 lo manejan bien. La RTX 3080 (10 GB) está demasiado limitada para flujos de trabajo de SDXL.
Recursos útiles
Última actualización
¿Te fue útil?