For the complete documentation index, see llms.txt. This page is also available as Markdown.

Comparación de GPU

Guía completa de comparación de GPUs para cargas de trabajo de IA en Clore.ai

Comparación completa de las GPUs disponibles en CLORE.AI para cargas de trabajo de IA.

Recomendación rápida

Tu tarea
Opción económica
Mejor relación calidad-precio
Máximo rendimiento

Chat con IA (7B)

RTX 3060 12GB

RTX 3090 24GB

RTX 5090 32GB

Chat con IA (70B)

RTX 3090 24GB

RTX 5090 32GB

A100 80GB

Generación de imágenes (SD 1.5)

RTX 3060 12GB

RTX 3090 24GB

RTX 5090 32GB

Generación de imágenes (SDXL)

RTX 3090 24GB

RTX 4090 24GB

RTX 5090 32GB

Generación de imágenes (FLUX)

RTX 3090 24GB

RTX 5090 32GB

A100 80GB

Generación de video

RTX 4090 24GB

RTX 5090 32GB

A100 80GB

Entrenamiento de modelos

A100 40GB

A100 80GB

H100 80GB

GPUs de consumo

NVIDIA RTX 3060 12GB

Mejor para: IA económica, SD 1.5, LLMs pequeños

Especificaciones
Valor

VRAM

12 GB GDDR6

Ancho de banda de memoria

360 GB/s

Rendimiento FP16

12.7 TFLOPS

Núcleos Tensor

112 (3.ª gen.)

TDP

170W

~Precio/hora

$0.02-0.04

Capacidades:

  • ✅ Ollama con modelos de 7B (Q4)

  • ✅ Stable Diffusion 1.5 (512x512)

  • ✅ SDXL (768x768, lento)

  • ⚠️ FLUX schnell (con descarga a CPU)

  • ❌ Modelos grandes (>13B)

  • ❌ Generación de vídeo


NVIDIA RTX 3070/3070 Ti 8GB

Mejor para: SD 1.5, tareas ligeras

Especificaciones
Valor

VRAM

8 GB GDDR6X

Ancho de banda de memoria

448-608 GB/s

Rendimiento FP16

20.3 TFLOPS

Núcleos Tensor

184 (3.ª gen.)

TDP

220-290W

~Precio/hora

$0.02-0.04

Capacidades:

  • ✅ Ollama con modelos de 7B (Q4)

  • ✅ Stable Diffusion 1.5 (512x512)

  • ⚠️ SDXL (solo baja resolución)

  • ❌ FLUX (VRAM insuficiente)

  • ❌ Modelos >7B

  • ❌ Generación de vídeo


NVIDIA RTX 3080/3080 Ti 10-12GB

Mejor para: Tareas generales de IA, buen equilibrio

Especificaciones
Valor

VRAM

10-12 GB GDDR6X

Ancho de banda de memoria

760-912 GB/s

Rendimiento FP16

29.8-34.1 TFLOPS

Núcleos Tensor

272-320 (3.ª gen.)

TDP

320-350W

~Precio/hora

$0.04-0.06

Capacidades:

  • ✅ Ollama con modelos de 13B

  • ✅ Stable Diffusion 1.5/2.1

  • ✅ SDXL (1024x1024)

  • ⚠️ FLUX schnell (con descarga)

  • ❌ Modelos grandes (>13B)

  • ❌ Generación de vídeo


NVIDIA RTX 3090/3090 Ti 24GB

Mejor para: SDXL, LLMs de 13B-30B, ControlNet

Especificaciones
Valor

VRAM

24 GB GDDR6X

Ancho de banda de memoria

936 GB/s

Rendimiento FP16

35.6 TFLOPS

Núcleos Tensor

328 (3.ª gen.)

TDP

350-450W

~Precio/hora

$0.05-0.08

Capacidades:

  • ✅ Ollama con modelos de 30B

  • ✅ vLLM con modelos de 13B

  • ✅ Todos los modelos de Stable Diffusion

  • ✅ SDXL + ControlNet

  • ✅ FLUX schnell (1024x1024)

  • ⚠️ FLUX dev (con descarga)

  • ⚠️ Vídeo (clips cortos)


NVIDIA RTX 4070 Ti 12GB

Mejor para: SD 1.5 rápido, inferencia eficiente

Especificaciones
Valor

VRAM

12 GB GDDR6X

Ancho de banda de memoria

504 GB/s

Rendimiento FP16

40.1 TFLOPS

Núcleos Tensor

184 (4.ª gen.)

TDP

285W

~Precio/hora

$0.04-0.06

Capacidades:

  • ✅ Ollama con modelos de 7B (rápido)

  • ✅ Stable Diffusion 1.5 (muy rápido)

  • ✅ SDXL (768x768)

  • ⚠️ FLUX schnell (resolución limitada)

  • ❌ Modelos grandes (>13B)

  • ❌ Generación de vídeo


NVIDIA RTX 4080 16GB

Mejor para: SDXL en producción, LLMs de 13B

Especificaciones
Valor

VRAM

16 GB GDDR6X

Ancho de banda de memoria

717 GB/s

Rendimiento FP16

48.7 TFLOPS

Núcleos Tensor

304 (4.ª gen.)

TDP

320W

~Precio/hora

$0.06-0.09

Capacidades:

  • ✅ Ollama con modelos de 13B (rápido)

  • ✅ vLLM con modelos de 7B

  • ✅ Todos los modelos de Stable Diffusion

  • ✅ SDXL + ControlNet

  • ✅ FLUX schnell (1024x1024)

  • ⚠️ FLUX dev (limitado)

  • ⚠️ Clips cortos de vídeo


NVIDIA RTX 4090 24GB

Mejor para: Rendimiento de gama alta para consumo, FLUX, vídeo

Especificaciones
Valor

VRAM

24 GB GDDR6X

Ancho de banda de memoria

1008 GB/s

Rendimiento FP16

82.6 TFLOPS

Núcleos Tensor

512 (4.ª gen.)

TDP

450W

~Precio/hora

$0.08-0.12

Capacidades:

  • ✅ Ollama con modelos de 30B (rápido)

  • ✅ vLLM con modelos de 13B

  • ✅ Todos los modelos de generación de imágenes

  • ✅ FLUX dev (1024x1024)

  • ✅ Generación de vídeo (corto)

  • ✅ AnimateDiff

  • ⚠️ Modelos de 70B (solo Q4)


NVIDIA RTX 5080 16GB (Nuevo — feb 2025)

Mejor para: SDXL/FLUX rápidos, LLMs de 13B-30B, gama media de alto rendimiento

Especificaciones
Valor

VRAM

16 GB GDDR7

Ancho de banda de memoria

960 GB/s

Rendimiento FP16

~80 TFLOPS

Núcleos Tensor

336 (5.ª gen.)

TDP

360W

~Precio/hora de Clore.ai

$1.50-2.00

Capacidades:

  • ✅ Ollama con modelos de 13B (rápido)

  • ✅ vLLM con modelos de 13B

  • ✅ Todos los modelos de Stable Diffusion

  • ✅ SDXL + ControlNet (muy rápido)

  • ✅ FLUX schnell/dev (1024x1024)

  • ✅ Clips cortos de vídeo

  • ⚠️ Modelos de 30B (solo Q4)

  • ❌ Modelos de 70B


NVIDIA RTX 5090 32GB (Buque insignia — feb 2025)

Mejor para: Máximo rendimiento para consumo, modelos de 70B, generación de vídeo en alta resolución

Especificaciones
Valor

VRAM

32 GB GDDR7

Ancho de banda de memoria

1792 GB/s

Rendimiento FP16

~120 TFLOPS

Núcleos Tensor

680 (5.ª gen.)

TDP

575W

~Precio/hora de Clore.ai

$3.00-4.00

Capacidades:

  • ✅ Ollama con modelos de 70B (Q4, rápido)

  • ✅ vLLM con modelos de 30B

  • ✅ Todos los modelos de generación de imágenes

  • ✅ FLUX dev (1536x1536)

  • ✅ Generación de vídeo (clips más largos)

  • ✅ AnimateDiff + ControlNet

  • ✅ Entrenamiento de modelos (LoRA, pequeños fine-tunes)

  • ✅ DeepSeek-R1 32B distill (FP16)

GPUs profesionales/de centro de datos

NVIDIA A100 40GB

Mejor para: LLMs en producción, entrenamiento, modelos grandes

Especificaciones
Valor

VRAM

40 GB HBM2e

Ancho de banda de memoria

1555 GB/s

Rendimiento FP16

77.97 TFLOPS

Núcleos Tensor

432 (3.ª gen.)

TDP

400W

~Precio/hora

$0.15-0.20

Capacidades:

  • ✅ Ollama con modelos de 70B (Q4)

  • ✅ Servicio en producción con vLLM

  • ✅ Todas las generaciones de imágenes

  • ✅ FLUX dev (alta calidad)

  • ✅ Generación de vídeo

  • ✅ Ajuste fino de modelos

  • ⚠️ 70B FP16 (ajustado)


NVIDIA A100 80GB

Mejor para: Modelos de 70B+, vídeo, cargas de trabajo de producción

Especificaciones
Valor

VRAM

80 GB HBM2e

Ancho de banda de memoria

2039 GB/s

Rendimiento FP16

77.97 TFLOPS

Núcleos Tensor

432 (3.ª gen.)

TDP

400W

~Precio/hora

$0.20-0.30

Capacidades:

  • ✅ Todos los LLMs hasta 70B (FP16)

  • ✅ Servicio de alto rendimiento con vLLM

  • ✅ Todas las generaciones de imágenes

  • ✅ Generación de vídeo larga

  • ✅ Entrenamiento de modelos

  • ✅ DeepSeek-V3 (parcial)

  • ⚠️ Modelos de 100B+


NVIDIA H100 80GB

Mejor para: Máximo rendimiento, los modelos más grandes

Especificaciones
Valor

VRAM

80 GB HBM3

Ancho de banda de memoria

3350 GB/s

Rendimiento FP16

267 TFLOPS

Núcleos Tensor

528 (4.ª gen.)

TDP

700W

~Precio/hora

$0.40-0.60

Capacidades:

  • ✅ Todos los modelos con la máxima velocidad

  • ✅ Modelos con más de 100B parámetros

  • ✅ Servicio multimodelo

  • ✅ Entrenamiento a gran escala

  • ✅ Generación de vídeo en tiempo real

  • ✅ DeepSeek-V3 (671B)

Comparaciones de rendimiento

Inferencia de LLM (tokens por segundo)

GPU
Llama 3 8B
Llama 3 70B
Mixtral 8x7B
Clore.ai $/h

RTX 3060 12GB

25

-

-

$0.02-0.04

RTX 3090 24GB

45

8*

20*

$0.15-0.25

RTX 4090 24GB

80

15*

35*

$0.35-0.55

RTX 5080 16GB

95

-

40*

$1.50-2.00

RTX 5090 32GB

150

30*

65*

$3.00-4.00

A100 40GB

100

25

45

$0.80-1.20

A100 80GB

110

40

55

$1.20-1.80

H100 80GB

180

70

90

$2.50-3.50

*Con cuantización (Q4/Q8)

Velocidad de generación de imágenes

GPU
SD 1.5 (512)
SDXL (1024)
FLUX schnell
Clore.ai $/h

RTX 3060 12GB

4 sec

15 sec

25 s*

$0.02-0.04

RTX 3090 24GB

2 sec

7 sec

12 s

$0.15-0.25

RTX 4090 24GB

1 sec

3 sec

5 sec

$0.35-0.55

RTX 5080 16GB

0,8 s

2,5 s

4 sec

$1.50-2.00

RTX 5090 32GB

0,6 s

1,8 s

3 sec

$3.00-4.00

A100 40GB

1,5 s

4 sec

6 s

$0.80-1.20

A100 80GB

1,5 s

4 sec

5 sec

$1.20-1.80

*Con descarga a CPU, menor resolución

Generación de vídeo (clip de 5 s)

GPU
SVD
Wan2.1
Hunyuan

RTX 3090 24GB

3 min

5 min*

-

RTX 4090 24GB

1.5 min

3 min

8 min*

RTX 5090 32GB

1 min

2 min

5 min

A100 40GB

1 min

2 min

5 min

A100 80GB

45 s

1.5 min

3 min

*Resolución limitada

Relación precio/rendimiento

Mejor valor por tarea

Chat/LLM (modelos de 7B-13B):

  1. 🥇 RTX 3090 24GB - Mejor relación precio/rendimiento

  2. 🥈 RTX 3060 12GB - Menor coste

  3. 🥉 RTX 4090 24GB - La más rápida

Generación de imágenes (SDXL/FLUX):

  1. 🥇 RTX 3090 24GB - Gran equilibrio

  2. 🥈 RTX 4090 24GB - 2x más rápida

  3. 🥉 A100 40GB - Estabilidad para producción

Modelos grandes (70B+):

  1. 🥇 A100 40GB - Mejor valor para 70B

  2. 🥈 A100 80GB - Precisión completa

  3. 🥉 RTX 4090 24GB - Opción económica (solo Q4)

Generación de vídeo:

  1. 🥇 A100 40GB - Buen equilibrio

  2. 🥈 RTX 4090 24GB - Opción de consumo

  3. 🥉 A100 80GB - Clips más largos

Entrenamiento de modelos:

  1. 🥇 A100 40GB - Opción estándar

  2. 🥈 A100 80GB - Modelos grandes

  3. 🥉 RTX 4090 24GB - Modelos pequeños/LoRA

Configuraciones multi-GPU

Algunas tareas se benefician de varias GPUs:

Configuración
Caso de uso
VRAM total

2x RTX 3090

Inferencia de 70B

48GB

2x RTX 4090

70B rápido, entrenamiento

48GB

2x RTX 5090

70B FP16, entrenamiento rápido

64GB

4x RTX 5090

Modelos de 100B+

128 GB

4x A100 40GB

Modelos de 100B+

160 GB

8x A100 80GB

DeepSeek-V3, Llama 405B

640 GB

Cómo elegir tu GPU

Diagrama de decisión

Consejos para ahorrar dinero

  1. Usa órdenes spot - alrededor de un tercio más barato que el precio bajo demanda; descuento mediano de ~13%

  2. Empieza en pequeño - Prueba primero en GPUs más baratas

  3. Cuantifica los modelos - Q4/Q8 permite alojar modelos más grandes en menos VRAM

  4. Procesamiento por lotes - Procesa varias solicitudes a la vez

  5. Horas valle - Mejor disponibilidad y, a veces, precios más bajos

📚 Ver también: Las 10 GPUs más baratas para entrenamiento de IA en 2025 | La mejor GPU para entrenamiento de IA — Guía detallada

Siguientes pasos

Última actualización

¿Te fue útil?