> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/generation-dimages/stable-diffusion-3-5.md).

# Stable Diffusion 3.5

Générez des images haute fidélité avec un rendu textuel précis grâce à Stable Diffusion 3.5 sur les GPU Clore.ai.

Stable Diffusion 3.5 de Stability AI est un transformeur de diffusion multimodal (MMDiT) qui établit une nouvelle norme pour la génération d’images à poids ouverts. Il existe en trois variantes : **Large** (8B paramètres), **Moyen** (2,5B paramètres), et **Large Turbo** (8B, distillé pour une inférence en 4 étapes). La caractéristique remarquable est son rendu de texte précis — SD 3.5 peut placer de manière fiable du texte lisible à l’intérieur des images générées, une capacité avec laquelle la plupart des modèles précédents peinent.

Sur [Clore.ai](https://clore.ai/) vous pouvez louer la puissance GPU nécessaire à SD 3.5 pour aussi peu que 0,05 $/h et générer des centaines d’images par heure.

## Caractéristiques clés

* **Trois variantes** — Large (8B, qualité la plus élevée), Medium (2,5B, rapide et léger), Large Turbo (8B, distillé en 4 étapes).
* **Rendu de texte précis** — génère du texte lisible, des panneaux, des étiquettes et de la typographie dans les images.
* **Architecture MMDiT** — attention conjointe image-texte pour un meilleur respect des prompts.
* **Résolution native de 1024×1024** — sortie propre sans astuces de suréchantillonnage.
* **Rapports d’aspect flexibles** — gère les sorties non carrées (768×1344, 1344×768, etc.) sans perte de qualité.
* **Prise en charge native de diffusers** — `StableDiffusion3Pipeline` dans `diffusers >= 0.30`.
* **Poids ouverts** — licence communautaire de Stability AI ; gratuite pour la plupart des usages commerciaux.

## Exigences

| Composant   | Minimum        | Recommandé            |
| ----------- | -------------- | --------------------- |
| VRAM GPU    | 12 Go (Medium) | 24 Go (Large / Turbo) |
| RAM système | 16 Go          | 32 Go                 |
| Disque      | 20 Go          | 40 Go                 |
| Python      | 3.10+          | 3.11                  |
| CUDA        | 12.8+          | 12.8+                 |
| diffusers   | 0.30+          | dernière version      |

**Recommandation de GPU Clore.ai :** Un **RTX 4090** (24 Go, 0,14–0,42 $/h) exécute les trois variantes à pleine vitesse. Pour le modèle Medium, une **RTX 3090** (24 Go, 0,07–0,21 $/h) ou même une carte de 16 Go suffit et coûte moins cher.

## Démarrage rapide

```bash
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece protobuf

python -c "import torch; print(torch.cuda.get_device_name(0))"
```

## Exemples d'utilisation

### SD 3.5 Large — Qualité maximale

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

image = pipe(
    prompt=(
        "Un panneau en bois usé portant l’inscription 'OPEN 24 HOURS' suspendu à "
        "une chaîne rouillée à l’extérieur d’un restaurant éclairé au néon, nuit pluvieuse, reflets "
        "sur l’asphalte mouillé, photographie cinématographique"
    ),
    negative_prompt="flou, texte déformé, basse qualité",
    guidance_scale=3.5,
    num_inference_steps=28,
    width=1024,
    height=1024,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("diner_sign.png")
print("Enregistré diner_sign.png")
```

### SD 3.5 Large Turbo — Génération rapide en 4 étapes

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large-turbo",
    torch_dtype=torch.bfloat16,
).to("cuda")

# Variante Turbo : seulement 4 étapes nécessaires, guidance_scale=0 (distillé)
image = pipe(
    prompt="Macro photo of a mechanical watch movement, intricate gears, golden light",
    guidance_scale=0.0,
    num_inference_steps=4,
    width=1024,
    height=1024,
).images[0]

image.save("watch_turbo.png")
```

### SD 3.5 Medium — Option légère

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-medium",
    torch_dtype=torch.float16,
).to("cuda")

image = pipe(
    prompt="Vue isométrique d’un intérieur de coffee shop chaleureux, style pixel art, éclairage chaud",
    guidance_scale=4.0,
    num_inference_steps=28,
    width=1024,
    height=1024,
).images[0]

image.save("coffee_shop_medium.png")
```

### Génération par lots avec différents rapports d’aspect

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
).to("cuda")

jobs = [
    {"prompt": "Portrait d’un astronaute dans un champ de tournesols", "w": 768, "h": 1344},
    {"prompt": "Paysage panoramique des hautes terres islandaises, ciel maussade", "w": 1344, "h": 768},
    {"prompt": "Photo produit d’un flacon de parfum sur une surface en marbre", "w": 1024, "h": 1024},
]

for i, job in enumerate(jobs):
    img = pipe(
        prompt=job["prompt"],
        guidance_scale=3.5,
        num_inference_steps=28,
        width=job["w"],
        height=job["h"],
    ).images[0]
    img.save(f"batch_{i:03d}.png")
    print(f"[{i+1}/{len(jobs)}] {job['w']}x{job['h']} terminé")
```

## Conseils pour les utilisateurs de Clore.ai

1. **Turbo pour l’itération, Large pour les finales** — utilisez la variante Turbo en 4 étapes pour explorer rapidement des idées de prompts, puis passez à Large (28 étapes) pour le rendu final.
2. **guidance\_scale=3.5** — SD 3.5 Large fonctionne mieux avec un CFG plus faible que les anciens modèles Stable Diffusion. Au-delà de 5.0, cela provoque souvent une sursaturation.
3. **Turbo nécessite guidance\_scale=0** — le modèle distillé intègre déjà le guidage ; en ajouter davantage dégrade le résultat.
4. **Texte dans les images** — le rendu de texte de SD 3.5 est solide mais pas parfait. Mettez le texte exact voulu entre guillemets : `'OPEN 24 HOURS'`. Gardez-le court (3 à 5 mots max).
5. **Mettre en cache les poids** — définissez `HF_HOME=/workspace/hf_cache` sur un stockage persistant. Large fait \~16 Go sur disque.
6. **bf16 pour Large, fp16 pour Medium** — les modèles 8B ont été entraînés en bf16 ; le modèle Medium 2,5B fonctionne bien en fp16.
7. **Génération par lots efficace** — SD 3.5 Large génère une image 1024×1024 en \~3 secondes sur une RTX 4090. Lancez des lots la nuit pour une génération massive.
8. **Accepter la licence HF** — vous devez accepter la licence du modèle sur la page du modèle HuggingFace avant de le télécharger. Connectez-vous avec `huggingface-cli login`.

## Dépannage

| Problème                                    | Correctif                                                                                                                       |
| ------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` avec Large               | Utilisez `pipe.enable_model_cpu_offload()`; ou passez à la variante Medium                                                      |
| Texte brouillé dans l’image                 | Gardez le texte court (3 à 5 mots) ; mettez-le entre guillemets dans le prompt ; augmentez `num_inference_steps` à 35           |
| Couleurs trop saturées                      | Réduisez `guidance_scale` — essayez 2,5–3,5 pour Large ; utilisez 0,0 pour Turbo                                                |
| Erreur 403 lors du téléchargement du modèle | Acceptez la licence sur `https://huggingface.co/stabilityai/stable-diffusion-3.5-large` et exécutez `huggingface-cli login`     |
| Premier lancement lent                      | Le téléchargement initial fait \~16 Go pour Large ; les exécutions suivantes utilisent le cache                                 |
| `KeyError: 'text_encoder_3'`                | Mettez à jour diffusers: `pip install -U diffusers transformers`                                                                |
| Sortie d’image noire                        | Assurez-vous que `torch_dtype=torch.bfloat16` pour Large/Turbo ; fp32 peut provoquer des échecs silencieux sur certaines cartes |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/generation-dimages/stable-diffusion-3-5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
