> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/generacion-de-imagenes/stable-diffusion-3-5.md).

# Stable Diffusion 3.5

Genera imágenes de alta fidelidad con renderizado de texto preciso usando Stable Diffusion 3.5 en GPUs de Clore.ai.

Stable Diffusion 3.5 de Stability AI es un Transformador de Difusión Multimodal (MMDiT) que establece un nuevo estándar para la generación de imágenes con pesos abiertos. Viene en tres variantes: **Large** (8B de parámetros), **Medio** (2.5B de parámetros), y **Large Turbo** (8B, destilado para inferencia de 4 pasos). La característica destacada es su renderizado preciso de texto — SD 3.5 puede colocar de forma fiable texto legible dentro de imágenes generadas, una capacidad con la que la mayoría de los modelos anteriores tienen dificultades.

En [Clore.ai](https://clore.ai/) puedes alquilar la potencia de GPU que SD 3.5 necesita por tan solo $0.05/hora y generar cientos de imágenes por hora.

## Características clave

* **Tres variantes** — Large (8B, de mayor calidad), Medium (2.5B, rápido y ligero), Large Turbo (8B, destilado en 4 pasos).
* **Renderizado preciso de texto** — genera texto legible, letreros, etiquetas y tipografía dentro de las imágenes.
* **Arquitectura MMDiT** — atención conjunta imagen-texto para una mejor fidelidad al prompt.
* **Resolución nativa de 1024×1024** — salida limpia sin trucos de escalado.
* **Relaciones de aspecto flexibles** — maneja salidas no cuadradas (768×1344, 1344×768, etc.) sin pérdida de calidad.
* **Compatibilidad nativa con diffusers** — `StableDiffusion3Pipeline` en `diffusers >= 0.30`.
* **Pesos abiertos** — Licencia Comunitaria de Stability AI; gratuita para la mayoría de los usos comerciales.

## Requisitos

| Componente      | Mínimo         | Recomendado           |
| --------------- | -------------- | --------------------- |
| VRAM de GPU     | 12 GB (Medium) | 24 GB (Large / Turbo) |
| RAM del sistema | 16 GB          | 32 GB                 |
| Disco           | 20 GB          | 40 GB                 |
| Python          | 3.10+          | 3.11                  |
| CUDA            | 12.8+          | 12.8+                 |
| diffusers       | 0.30+          | más reciente          |

**Recomendación de GPU de Clore.ai:** Un **RTX 4090** (24 GB, $0.14–0.42/hora) ejecuta las tres variantes a máxima velocidad. Para el modelo Medium, una **RTX 3090** (24 GB, $0.07–0.21/hora) o incluso una tarjeta de 16 GB es suficiente y más barata.

## Inicio rápido

```bash
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece protobuf

python -c "import torch; print(torch.cuda.get_device_name(0))"
```

## Ejemplos de uso

### SD 3.5 Large — Calidad máxima

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

image = pipe(
    prompt=(
        "Un letrero de madera desgastado que dice 'OPEN 24 HOURS' colgando de "
        "una cadena oxidada fuera de un restaurante iluminado con neón, noche lluviosa, reflejos "
        "sobre asfalto mojado, fotografía cinematográfica"
    ),
    negative_prompt="borroso, texto deformado, baja calidad",
    guidance_scale=3.5,
    num_inference_steps=28,
    width=1024,
    height=1024,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("diner_sign.png")
print("Guardado diner_sign.png")
```

### SD 3.5 Large Turbo — Generación rápida de 4 pasos

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large-turbo",
    torch_dtype=torch.bfloat16,
).to("cuda")

# Variante Turbo: solo se necesitan 4 pasos, guidance_scale=0 (destilado)
image = pipe(
    prompt="Foto macro de un movimiento de reloj mecánico, engranajes intrincados, luz dorada",
    guidance_scale=0.0,
    num_inference_steps=4,
    width=1024,
    height=1024,
).images[0]

image.save("watch_turbo.png")
```

### SD 3.5 Medium — Opción ligera

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-medium",
    torch_dtype=torch.float16,
).to("cuda")

image = pipe(
    prompt="Vista isométrica del interior de una cafetería acogedora, estilo pixel art, iluminación cálida",
    guidance_scale=4.0,
    num_inference_steps=28,
    width=1024,
    height=1024,
).images[0]

image.save("coffee_shop_medium.png")
```

### Generación por lotes con diferentes relaciones de aspecto

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
).to("cuda")

jobs = [
    {"prompt": "Portrait of an astronaut in a field of sunflowers", "w": 768, "h": 1344},
    {"prompt": "Panoramic landscape of Icelandic highlands, moody skies", "w": 1344, "h": 768},
    {"prompt": "Product photo of a perfume bottle on marble surface", "w": 1024, "h": 1024},
]

for i, job in enumerate(jobs):
    img = pipe(
        prompt=job["prompt"],
        guidance_scale=3.5,
        num_inference_steps=28,
        width=job["w"],
        height=job["h"],
    ).images[0]
    img.save(f"batch_{i:03d}.png")
    print(f"[{i+1}/{len(jobs)}] {job['w']}x{job['h']} hecho")
```

## Consejos para usuarios de Clore.ai

1. **Turbo para iterar, Large para finales** — usa la variante Turbo de 4 pasos para explorar ideas de prompts rápidamente, luego cambia a Large (28 pasos) para el render final.
2. **guidance\_scale=3.5** — SD 3.5 Large funciona mejor con un CFG más bajo que los modelos Stable Diffusion anteriores. Superar 5.0 a menudo causa sobresaturación.
3. **Turbo necesita guidance\_scale=0** — el modelo destilado ya incorpora la guía; añadir más la degrada.
4. **Texto en imágenes** — el renderizado de texto de SD 3.5 es sólido pero no perfecto. Usa comillas alrededor del texto exacto que quieres: `'OPEN 24 HOURS'`. Mantenlo corto (máximo 3–5 palabras).
5. **Caché de pesos** — establece `HF_HOME=/workspace/hf_cache` en almacenamiento persistente. Large ocupa \~16 GB en disco.
6. **bf16 para Large, fp16 para Medium** — los modelos de 8B se entrenaron en bf16; el Medium de 2.5B funciona bien en fp16.
7. **Agrupa de forma eficiente** — SD 3.5 Large genera una imagen de 1024×1024 en \~3 segundos en una RTX 4090. Agrupa durante la noche para generación masiva.
8. **Acepta la licencia de HF** — debes aceptar la licencia del modelo en la página del modelo de HuggingFace antes de descargarlo. Inicia sesión con `huggingface-cli login`.

## Solución de problemas

| Problema                         | Solución                                                                                                                |
| -------------------------------- | ----------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` con Large     | Usa `pipe.enable_model_cpu_offload()`; o cambia a la variante Medium                                                    |
| Texto ilegible en la imagen      | Mantén el texto corto (3–5 palabras); ponlo entre comillas en el prompt; aumenta `num_inference_steps` a 35             |
| Colores sobresaturados           | Reduce `guidance_scale` — prueba 2.5–3.5 para Large; usa 0.0 para Turbo                                                 |
| Error 403 al descargar el modelo | Acepta la licencia en `https://huggingface.co/stabilityai/stable-diffusion-3.5-large` y ejecuta `huggingface-cli login` |
| Primera ejecución lenta          | La descarga inicial es de \~16 GB para Large; las ejecuciones posteriores usan la caché                                 |
| `KeyError: 'text_encoder_3'`     | Actualiza diffusers: `pip install -U diffusers transformers`                                                            |
| Salida de imagen negra           | Asegúrate de `torch_dtype=torch.bfloat16` para Large/Turbo; fp32 puede causar fallos silenciosos en algunas tarjetas    |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/generacion-de-imagenes/stable-diffusion-3-5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
