> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/bildgenerierung/stable-diffusion-3-5.md).

# Stable Diffusion 3.5

Generiere hochauflösende Bilder mit präziser Textdarstellung mithilfe von Stable Diffusion 3.5 auf Clore.ai-GPUs.

Stable Diffusion 3.5 von Stability AI ist ein Multimodal Diffusion Transformer (MMDiT), der einen neuen Standard für Open-Weight-Bildgenerierung setzt. Er kommt in drei Varianten: **Large** (8B Parameter), **Mittel** (2,5B Parameter) und **Large Turbo** (8B, für 4-Schritt-Inferenz destilliert). Das herausragende Merkmal ist die präzise Textrendering-Funktion — SD 3.5 kann zuverlässig lesbaren Text in generierten Bildern platzieren, eine Fähigkeit, mit der die meisten früheren Modelle Schwierigkeiten haben.

Auf [Clore.ai](https://clore.ai/) Sie können die GPU-Leistung, die SD 3.5 benötigt, schon für nur 0,05 $/Std. mieten und Hunderte von Bildern pro Stunde generieren.

## Hauptfunktionen

* **Drei Varianten** — Large (8B, höchste Qualität), Medium (2,5B, schnell und leicht), Large Turbo (8B, 4-Schritt-destilliert).
* **Präzises Textrendering** — erzeugt lesbaren Text, Schilder, Beschriftungen und Typografie innerhalb von Bildern.
* **MMDiT-Architektur** — gemeinsame Bild-Text-Aufmerksamkeit für überlegene Prompt-Treue.
* **Nativ 1024×1024 Auflösung** — saubere Ausgabe ohne Upscaling-Tricks.
* **Flexible Seitenverhältnisse** — verarbeitet nicht quadratische Ausgaben (768×1344, 1344×768 usw.) ohne Qualitätsverlust.
* **Native Diffusers-Unterstützung** — `StableDiffusion3Pipeline` in `diffusers >= 0.30`.
* **Offene Gewichte** — Stability AI Community License; für die meisten kommerziellen Anwendungen kostenlos.

## Anforderungen

| Komponente | Minimum        | Empfohlen             |
| ---------- | -------------- | --------------------- |
| GPU-VRAM   | 12 GB (Medium) | 24 GB (Large / Turbo) |
| System-RAM | 16 GB          | 32 GB                 |
| Festplatte | 20 GB          | 40 GB                 |
| Python     | 3.10+          | 3.11                  |
| CUDA       | 12.8+          | 12.8+                 |
| diffusers  | 0.30+          | aktuellste            |

**Clore.ai-GPU-Empfehlung:** Ein **RTX 4090** (24 GB, 0,14–0,42 $/Std.) läuft alle drei Varianten mit voller Geschwindigkeit. Für das Medium-Modell reicht eine **RTX 3090** (24 GB, 0,07–0,21 $/Std.) oder sogar eine 16-GB-Karte aus und ist günstiger.

## Schnellstart

```bash
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece protobuf

python -c "import torch; print(torch.cuda.get_device_name(0))"
```

## Anwendungsbeispiele

### SD 3.5 Large — Maximale Qualität

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

image = pipe(
    prompt=(
        "Ein verwittertes hölzernes Schild mit der Aufschrift 'OPEN 24 HOURS', das von "
        "einer rostigen Kette vor einem neonbeleuchteten Diner hängt, regnerische Nacht, Spiegelungen "
        "auf nassem Asphalt, cineastische Fotografie"
    ),
    negative_prompt="unscharfer, verformter Text, niedrige Qualität",
    guidance_scale=3.5,
    num_inference_steps=28,
    width=1024,
    height=1024,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("diner_sign.png")
print("diner_sign.png gespeichert")
```

### SD 3.5 Large Turbo — Schnelle Generierung in 4 Schritten

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large-turbo",
    torch_dtype=torch.bfloat16,
).to("cuda")

# Turbo-Variante: Es werden nur 4 Schritte benötigt, guidance_scale=0 (destilliert)
image = pipe(
    prompt="Makroaufnahme eines mechanischen Uhrwerks, filigrane Zahnräder, goldenes Licht",
    guidance_scale=0.0,
    num_inference_steps=4,
    width=1024,
    height=1024,
).images[0]

image.save("watch_turbo.png")
```

### SD 3.5 Medium — Leichte Option

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-medium",
    torch_dtype=torch.float16,
).to("cuda")

image = pipe(
    prompt="Isometrische Ansicht eines gemütlichen Coffeeshop-Interieurs, Pixel-Art-Stil, warmes Licht",
    guidance_scale=4.0,
    num_inference_steps=28,
    width=1024,
    height=1024,
).images[0]

image.save("coffee_shop_medium.png")
```

### Batch-Generierung mit unterschiedlichen Seitenverhältnissen

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
).to("cuda")

jobs = [
    {"prompt": "Porträt eines Astronauten in einem Feld aus Sonnenblumen", "w": 768, "h": 1344},
    {"prompt": "Panoramalandschaft der isländischen Hochländer, düstere Himmel", "w": 1344, "h": 768},
    {"prompt": "Produktfoto eines Parfümflakons auf einer Marmoroberfläche", "w": 1024, "h": 1024},
]

for i, job in enumerate(jobs):
    img = pipe(
        prompt=job["prompt"],
        guidance_scale=3.5,
        num_inference_steps=28,
        width=job["w"],
        height=job["h"],
    ).images[0]
    img.save(f"batch_{i:03d}.png")
    print(f"[{i+1}/{len(jobs)}] {job['w']}x{job['h']} erledigt")
```

## Tipps für Clore.ai-Nutzer

1. **Turbo für Iterationen, Large für finale Ergebnisse** — verwenden Sie die 4-Schritt-Turbo-Variante, um Prompt-Ideen schnell zu erkunden, und wechseln Sie dann für das finale Rendering zu Large (28 Schritte).
2. **guidance\_scale=3.5** — SD 3.5 Large funktioniert am besten mit einem niedrigeren CFG-Wert als ältere Stable-Diffusion-Modelle. Werte über 5,0 führen oft zu Übersättigung.
3. **Turbo benötigt guidance\_scale=0** — das destillierte Modell hat die Anleitung bereits eingebaut; mehr hinzuzufügen verschlechtert die Ausgabe.
4. **Text in Bildern** — das Textrendering von SD 3.5 ist stark, aber nicht perfekt. Setzen Sie den genauen Text, den Sie möchten, in Anführungszeichen: `'OPEN 24 HOURS'`. Halten Sie ihn kurz (maximal 3–5 Wörter).
5. **Gewichte cachen** — setzen Sie `HF_HOME=/workspace/hf_cache` auf persistentem Speicher. Large benötigt auf der Festplatte etwa 16 GB.
6. **bf16 für Large, fp16 für Medium** — die 8B-Modelle wurden in bf16 trainiert; das 2,5B-Medium läuft problemlos in fp16.
7. **Effizient stapelweise verarbeiten** — SD 3.5 Large erzeugt auf einer RTX 4090 ein 1024×1024-Bild in etwa 3 Sekunden. Für Massenproduktion über Nacht in Stapeln ausführen.
8. **HF-Lizenz akzeptieren** — Sie müssen die Modelllizenz auf der HuggingFace-Modellseite akzeptieren, bevor Sie herunterladen. Anmelden mit `huggingface-cli login`.

## Fehlerbehebung

| Problem                                   | Fix                                                                                                                                         |
| ----------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` mit Large              | Verwende `pipe.enable_model_cpu_offload()`; oder zur Medium-Variante wechseln                                                               |
| Verstümmelter Text im Bild                | Halten Sie den Text kurz (3–5 Wörter); setzen Sie ihn im Prompt in Anführungszeichen; erhöhen Sie `num_inference_steps` auf 35              |
| Übersättigte Farben                       | Niedriger `guidance_scale` — versuchen Sie 2,5–3,5 für Large; verwenden Sie 0,0 für Turbo                                                   |
| 403-Fehler beim Herunterladen des Modells | Akzeptieren Sie die Lizenz unter `https://huggingface.co/stabilityai/stable-diffusion-3.5-large` und führen Sie aus `huggingface-cli login` |
| Langsamer erster Lauf                     | Der erste Download umfasst bei Large etwa 16 GB; spätere Läufe verwenden den Cache                                                          |
| `KeyError: 'text_encoder_3'`              | Aktualisieren Sie diffusers: `pip install -U diffusers transformers`                                                                        |
| Schwarze Bildausgabe                      | Stelle sicher `torch_dtype=torch.bfloat16` für Large/Turbo; fp32 kann auf einigen Karten zu stillen Fehlern führen                          |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/bildgenerierung/stable-diffusion-3-5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
