Comparación de GPU
Guía completa de comparación de GPUs para cargas de trabajo de IA en Clore.ai
Comparación completa de las GPUs disponibles en CLORE.AI para cargas de trabajo de IA.
Encuentra la GPU adecuada para tu tarea en Marketplace de CLORE.AI.
Recomendación rápida
Chat con IA (7B)
RTX 3060 12GB
RTX 3090 24GB
RTX 5090 32GB
Chat con IA (70B)
RTX 3090 24GB
RTX 5090 32GB
A100 80GB
Generación de imágenes (SD 1.5)
RTX 3060 12GB
RTX 3090 24GB
RTX 5090 32GB
Generación de imágenes (SDXL)
RTX 3090 24GB
RTX 4090 24GB
RTX 5090 32GB
Generación de imágenes (FLUX)
RTX 3090 24GB
RTX 5090 32GB
A100 80GB
Generación de video
RTX 4090 24GB
RTX 5090 32GB
A100 80GB
Entrenamiento de modelos
A100 40GB
A100 80GB
H100 80GB
GPUs de consumo
NVIDIA RTX 3060 12GB
Mejor para: IA económica, SD 1.5, LLMs pequeños
VRAM
12 GB GDDR6
Ancho de banda de memoria
360 GB/s
Rendimiento FP16
12.7 TFLOPS
Núcleos Tensor
112 (3.ª gen.)
TDP
170W
~Precio/hora
$0.02-0.04
Capacidades:
✅ Ollama con modelos de 7B (Q4)
✅ Stable Diffusion 1.5 (512x512)
✅ SDXL (768x768, lento)
⚠️ FLUX schnell (con descarga a CPU)
❌ Modelos grandes (>13B)
❌ Generación de vídeo
NVIDIA RTX 3070/3070 Ti 8GB
Mejor para: SD 1.5, tareas ligeras
VRAM
8 GB GDDR6X
Ancho de banda de memoria
448-608 GB/s
Rendimiento FP16
20.3 TFLOPS
Núcleos Tensor
184 (3.ª gen.)
TDP
220-290W
~Precio/hora
$0.02-0.04
Capacidades:
✅ Ollama con modelos de 7B (Q4)
✅ Stable Diffusion 1.5 (512x512)
⚠️ SDXL (solo baja resolución)
❌ FLUX (VRAM insuficiente)
❌ Modelos >7B
❌ Generación de vídeo
NVIDIA RTX 3080/3080 Ti 10-12GB
Mejor para: Tareas generales de IA, buen equilibrio
VRAM
10-12 GB GDDR6X
Ancho de banda de memoria
760-912 GB/s
Rendimiento FP16
29.8-34.1 TFLOPS
Núcleos Tensor
272-320 (3.ª gen.)
TDP
320-350W
~Precio/hora
$0.04-0.06
Capacidades:
✅ Ollama con modelos de 13B
✅ Stable Diffusion 1.5/2.1
✅ SDXL (1024x1024)
⚠️ FLUX schnell (con descarga)
❌ Modelos grandes (>13B)
❌ Generación de vídeo
NVIDIA RTX 3090/3090 Ti 24GB
Mejor para: SDXL, LLMs de 13B-30B, ControlNet
VRAM
24 GB GDDR6X
Ancho de banda de memoria
936 GB/s
Rendimiento FP16
35.6 TFLOPS
Núcleos Tensor
328 (3.ª gen.)
TDP
350-450W
~Precio/hora
$0.05-0.08
Capacidades:
✅ Ollama con modelos de 30B
✅ vLLM con modelos de 13B
✅ Todos los modelos de Stable Diffusion
✅ SDXL + ControlNet
✅ FLUX schnell (1024x1024)
⚠️ FLUX dev (con descarga)
⚠️ Vídeo (clips cortos)
NVIDIA RTX 4070 Ti 12GB
Mejor para: SD 1.5 rápido, inferencia eficiente
VRAM
12 GB GDDR6X
Ancho de banda de memoria
504 GB/s
Rendimiento FP16
40.1 TFLOPS
Núcleos Tensor
184 (4.ª gen.)
TDP
285W
~Precio/hora
$0.04-0.06
Capacidades:
✅ Ollama con modelos de 7B (rápido)
✅ Stable Diffusion 1.5 (muy rápido)
✅ SDXL (768x768)
⚠️ FLUX schnell (resolución limitada)
❌ Modelos grandes (>13B)
❌ Generación de vídeo
NVIDIA RTX 4080 16GB
Mejor para: SDXL en producción, LLMs de 13B
VRAM
16 GB GDDR6X
Ancho de banda de memoria
717 GB/s
Rendimiento FP16
48.7 TFLOPS
Núcleos Tensor
304 (4.ª gen.)
TDP
320W
~Precio/hora
$0.06-0.09
Capacidades:
✅ Ollama con modelos de 13B (rápido)
✅ vLLM con modelos de 7B
✅ Todos los modelos de Stable Diffusion
✅ SDXL + ControlNet
✅ FLUX schnell (1024x1024)
⚠️ FLUX dev (limitado)
⚠️ Clips cortos de vídeo
NVIDIA RTX 4090 24GB
Mejor para: Rendimiento de gama alta para consumo, FLUX, vídeo
VRAM
24 GB GDDR6X
Ancho de banda de memoria
1008 GB/s
Rendimiento FP16
82.6 TFLOPS
Núcleos Tensor
512 (4.ª gen.)
TDP
450W
~Precio/hora
$0.08-0.12
Capacidades:
✅ Ollama con modelos de 30B (rápido)
✅ vLLM con modelos de 13B
✅ Todos los modelos de generación de imágenes
✅ FLUX dev (1024x1024)
✅ Generación de vídeo (corto)
✅ AnimateDiff
⚠️ Modelos de 70B (solo Q4)
NVIDIA RTX 5080 16GB (Nuevo — feb 2025)
Mejor para: SDXL/FLUX rápidos, LLMs de 13B-30B, gama media de alto rendimiento
VRAM
16 GB GDDR7
Ancho de banda de memoria
960 GB/s
Rendimiento FP16
~80 TFLOPS
Núcleos Tensor
336 (5.ª gen.)
TDP
360W
~Precio/hora de Clore.ai
$1.50-2.00
Capacidades:
✅ Ollama con modelos de 13B (rápido)
✅ vLLM con modelos de 13B
✅ Todos los modelos de Stable Diffusion
✅ SDXL + ControlNet (muy rápido)
✅ FLUX schnell/dev (1024x1024)
✅ Clips cortos de vídeo
⚠️ Modelos de 30B (solo Q4)
❌ Modelos de 70B
NVIDIA RTX 5090 32GB (Buque insignia — feb 2025)
Mejor para: Máximo rendimiento para consumo, modelos de 70B, generación de vídeo en alta resolución
VRAM
32 GB GDDR7
Ancho de banda de memoria
1792 GB/s
Rendimiento FP16
~120 TFLOPS
Núcleos Tensor
680 (5.ª gen.)
TDP
575W
~Precio/hora de Clore.ai
$3.00-4.00
Capacidades:
✅ Ollama con modelos de 70B (Q4, rápido)
✅ vLLM con modelos de 30B
✅ Todos los modelos de generación de imágenes
✅ FLUX dev (1536x1536)
✅ Generación de vídeo (clips más largos)
✅ AnimateDiff + ControlNet
✅ Entrenamiento de modelos (LoRA, pequeños fine-tunes)
✅ DeepSeek-R1 32B distill (FP16)
GPUs profesionales/de centro de datos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
NVIDIA A100 40GB
Mejor para: LLMs en producción, entrenamiento, modelos grandes
VRAM
40 GB HBM2e
Ancho de banda de memoria
1555 GB/s
Rendimiento FP16
77.97 TFLOPS
Núcleos Tensor
432 (3.ª gen.)
TDP
400W
~Precio/hora
$0.15-0.20
Capacidades:
✅ Ollama con modelos de 70B (Q4)
✅ Servicio en producción con vLLM
✅ Todas las generaciones de imágenes
✅ FLUX dev (alta calidad)
✅ Generación de vídeo
✅ Ajuste fino de modelos
⚠️ 70B FP16 (ajustado)
NVIDIA A100 80GB
Mejor para: Modelos de 70B+, vídeo, cargas de trabajo de producción
VRAM
80 GB HBM2e
Ancho de banda de memoria
2039 GB/s
Rendimiento FP16
77.97 TFLOPS
Núcleos Tensor
432 (3.ª gen.)
TDP
400W
~Precio/hora
$0.20-0.30
Capacidades:
✅ Todos los LLMs hasta 70B (FP16)
✅ Servicio de alto rendimiento con vLLM
✅ Todas las generaciones de imágenes
✅ Generación de vídeo larga
✅ Entrenamiento de modelos
✅ DeepSeek-V3 (parcial)
⚠️ Modelos de 100B+
NVIDIA H100 80GB
Mejor para: Máximo rendimiento, los modelos más grandes
VRAM
80 GB HBM3
Ancho de banda de memoria
3350 GB/s
Rendimiento FP16
267 TFLOPS
Núcleos Tensor
528 (4.ª gen.)
TDP
700W
~Precio/hora
$0.40-0.60
Capacidades:
✅ Todos los modelos con la máxima velocidad
✅ Modelos con más de 100B parámetros
✅ Servicio multimodelo
✅ Entrenamiento a gran escala
✅ Generación de vídeo en tiempo real
✅ DeepSeek-V3 (671B)
Comparaciones de rendimiento
Inferencia de LLM (tokens por segundo)
RTX 3060 12GB
25
-
-
$0.02-0.04
RTX 3090 24GB
45
8*
20*
$0.15-0.25
RTX 4090 24GB
80
15*
35*
$0.35-0.55
RTX 5080 16GB
95
-
40*
$1.50-2.00
RTX 5090 32GB
150
30*
65*
$3.00-4.00
A100 40GB
100
25
45
$0.80-1.20
A100 80GB
110
40
55
$1.20-1.80
H100 80GB
180
70
90
$2.50-3.50
*Con cuantización (Q4/Q8)
Velocidad de generación de imágenes
RTX 3060 12GB
4 sec
15 sec
25 s*
$0.02-0.04
RTX 3090 24GB
2 sec
7 sec
12 s
$0.15-0.25
RTX 4090 24GB
1 sec
3 sec
5 sec
$0.35-0.55
RTX 5080 16GB
0,8 s
2,5 s
4 sec
$1.50-2.00
RTX 5090 32GB
0,6 s
1,8 s
3 sec
$3.00-4.00
A100 40GB
1,5 s
4 sec
6 s
$0.80-1.20
A100 80GB
1,5 s
4 sec
5 sec
$1.20-1.80
*Con descarga a CPU, menor resolución
Generación de vídeo (clip de 5 s)
RTX 3090 24GB
3 min
5 min*
-
RTX 4090 24GB
1.5 min
3 min
8 min*
RTX 5090 32GB
1 min
2 min
5 min
A100 40GB
1 min
2 min
5 min
A100 80GB
45 s
1.5 min
3 min
*Resolución limitada
Relación precio/rendimiento
Mejor valor por tarea
Chat/LLM (modelos de 7B-13B):
🥇 RTX 3090 24GB - Mejor relación precio/rendimiento
🥈 RTX 3060 12GB - Menor coste
🥉 RTX 4090 24GB - La más rápida
Generación de imágenes (SDXL/FLUX):
🥇 RTX 3090 24GB - Gran equilibrio
🥈 RTX 4090 24GB - 2x más rápida
🥉 A100 40GB - Estabilidad para producción
Modelos grandes (70B+):
🥇 A100 40GB - Mejor valor para 70B
🥈 A100 80GB - Precisión completa
🥉 RTX 4090 24GB - Opción económica (solo Q4)
Generación de vídeo:
🥇 A100 40GB - Buen equilibrio
🥈 RTX 4090 24GB - Opción de consumo
🥉 A100 80GB - Clips más largos
Entrenamiento de modelos:
🥇 A100 40GB - Opción estándar
🥈 A100 80GB - Modelos grandes
🥉 RTX 4090 24GB - Modelos pequeños/LoRA
Configuraciones multi-GPU
Algunas tareas se benefician de varias GPUs:
2x RTX 3090
Inferencia de 70B
48GB
2x RTX 4090
70B rápido, entrenamiento
48GB
2x RTX 5090
70B FP16, entrenamiento rápido
64GB
4x RTX 5090
Modelos de 100B+
128 GB
4x A100 40GB
Modelos de 100B+
160 GB
8x A100 80GB
DeepSeek-V3, Llama 405B
640 GB
Cómo elegir tu GPU
Diagrama de decisión
Consejos para ahorrar dinero
Usa órdenes spot - alrededor de un tercio más barato que el precio bajo demanda; descuento mediano de ~13%
Empieza en pequeño - Prueba primero en GPUs más baratas
Cuantifica los modelos - Q4/Q8 permite alojar modelos más grandes en menos VRAM
Procesamiento por lotes - Procesa varias solicitudes a la vez
Horas valle - Mejor disponibilidad y, a veces, precios más bajos
📚 Ver también: Las 10 GPUs más baratas para entrenamiento de IA en 2025 | La mejor GPU para entrenamiento de IA — Guía detallada
Siguientes pasos
Matriz de compatibilidad de modelos - Qué modelos funcionan en qué GPUs
Catálogo de imágenes Docker - Imágenes listas para usar
Guía de inicio rápido - Empieza en 5 minutos
Última actualización
¿Te fue útil?