> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/generaciya-izobrazhenii/stable-diffusion-3-5.md).

# Stable Diffusion 3.5

Stable Diffusion 3.5 от Stability AI — это мультимодальный диффузионный трансформер (MMDiT), который задаёт новый стандарт для генерации изображений с открытыми весами. Он доступен в трёх вариантах: **Large** (8B параметров), **Средне** (2.5B параметров), и **Large Turbo** (8B, дистиллирован для 4-шагового инференса). Выдающаяся особенность — точный рендеринг текста: SD 3.5 может надёжно размещать читаемый текст внутри сгенерированных изображений, с чем большинство более ранних моделей справляется с трудом.

На [Clore.ai](https://clore.ai/) вы можете арендовать вычислительную мощность GPU, необходимую SD 3.5, всего за $0.05/час и генерировать сотни изображений в час.

## Ключевые особенности

* **Три варианта** — Large (8B, наивысшее качество), Medium (2.5B, быстрый и лёгкий), Large Turbo (8B, дистиллированный за 4 шага).
* **Точный рендеринг текста** — генерирует читаемый текст, вывески, надписи и типографику внутри изображений.
* **Архитектура MMDiT** — совместное внимание к изображению и тексту для лучшего соответствия промпту.
* **Нативное разрешение 1024×1024** — чистый результат без ухищрений с апскейлом.
* **Гибкие соотношения сторон** — работает с неквадратными выходами (768×1344, 1344×768 и т. д.) без потери качества.
* **Нативная поддержка diffusers** — `StableDiffusion3Pipeline` в `diffusers >= 0.30`.
* **Открытые веса** — лицензия Stability AI Community License; бесплатно для большинства коммерческих применений.

## Требования

| Компонент     | Минимум        | Рекомендуется         |
| ------------- | -------------- | --------------------- |
| VRAM GPU      | 12 ГБ (Medium) | 24 ГБ (Large / Turbo) |
| Системная RAM | 16 ГБ          | 32 ГБ                 |
| Диск          | 20 ГБ          | 40 ГБ                 |
| Python        | 3.10+          | 3.11                  |
| CUDA          | 12.8+          | 12.8+                 |
| diffusers     | 0.30+          | последняя версия      |

**Рекомендация по GPU от Clore.ai:** Один **RTX 4090** (24 ГБ, $0.14–0.42/час) запускает все три варианта на полной скорости. Для модели Medium достаточно **RTX 3090** (24 ГБ, $0.07–0.21/час) или даже карты на 16 ГБ, и это дешевле.

## Быстрый старт

```bash
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece protobuf

python -c "import torch; print(torch.cuda.get_device_name(0))"
```

## Примеры использования

### SD 3.5 Large — максимальное качество

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

image = pipe(
    prompt=(
        "A weathered wooden sign reading 'OPEN 24 HOURS' hanging from "
        "a rusty chain outside a neon-lit diner, rainy night, reflections "
        "on wet asphalt, cinematic photography"
    ),
    negative_prompt="blurry, deformed text, low quality",
    guidance_scale=3.5,
    num_inference_steps=28,
    width=1024,
    height=1024,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("diner_sign.png")
print("Saved diner_sign.png")
```

### SD 3.5 Large Turbo — быстрое генерация за 4 шага

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large-turbo",
    torch_dtype=torch.bfloat16,
).to("cuda")

# Вариант Turbo: нужны только 4 шага, guidance_scale=0 (дистиллированный)
image = pipe(
    prompt="Macro photo of a mechanical watch movement, intricate gears, golden light",
    guidance_scale=0.0,
    num_inference_steps=4,
    width=1024,
    height=1024,
).images[0]

image.save("watch_turbo.png")
```

### SD 3.5 Medium — лёгкий вариант

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-medium",
    torch_dtype=torch.float16,
).to("cuda")

image = pipe(
    prompt="Isometric view of a cozy coffee shop interior, pixel art style, warm lighting",
    guidance_scale=4.0,
    num_inference_steps=28,
    width=1024,
    height=1024,
).images[0]

image.save("coffee_shop_medium.png")
```

### Пакетная генерация с разными соотношениями сторон

```python
import torch
from diffusers import StableDiffusion3Pipeline

pipe = StableDiffusion3Pipeline.from_pretrained(
    "stabilityai/stable-diffusion-3.5-large",
    torch_dtype=torch.bfloat16,
).to("cuda")

jobs = [
    {"prompt": "Portrait of an astronaut in a field of sunflowers", "w": 768, "h": 1344},
    {"prompt": "Panoramic landscape of Icelandic highlands, moody skies", "w": 1344, "h": 768},
    {"prompt": "Product photo of a perfume bottle on marble surface", "w": 1024, "h": 1024},
]

for i, job in enumerate(jobs):
    img = pipe(
        prompt=job["prompt"],
        guidance_scale=3.5,
        num_inference_steps=28,
        width=job["w"],
        height=job["h"],
    ).images[0]
    img.save(f"batch_{i:03d}.png")
    print(f"[{i+1}/{len(jobs)}] {job['w']}x{job['h']} done")
```

## Советы для пользователей Clore.ai

1. **Turbo для итераций, Large для финальных результатов** — используйте 4-шаговый вариант Turbo, чтобы быстро исследовать идеи промпта, а затем переключитесь на Large (28 шагов) для финального рендера.
2. **guidance\_scale=3.5** — SD 3.5 Large лучше всего работает при более низком CFG, чем более старые модели Stable Diffusion. Значения выше 5.0 часто вызывают перенасыщение.
3. **Turbo требует guidance\_scale=0** — в дистиллированной модели guidance уже встроен; добавление чего-либо ещё ухудшает результат.
4. **Текст на изображениях** — рендеринг текста в SD 3.5 силён, но не идеален. Возьмите точный текст в кавычки: `'OPEN 24 HOURS'`. Держите его коротким (максимум 3–5 слов).
5. **Кешируйте веса** — задайте `HF_HOME=/workspace/hf_cache` в постоянном хранилище. Large занимает примерно 16 ГБ на диске.
6. **bf16 для Large, fp16 для Medium** — модели 8B были обучены в bf16; 2.5B Medium нормально работает в fp16.
7. **Эффективно выполняйте батчи** — SD 3.5 Large генерирует одно изображение 1024×1024 примерно за 3 секунды на RTX 4090. Запускайте батчи ночью для массовой генерации.
8. **Примите лицензию HF** — перед скачиванием нужно принять лицензию модели на странице модели HuggingFace. Войдите с `huggingface-cli login`.

## Устранение неполадок

| Проблема                         | Исправьте                                                                                                               |
| -------------------------------- | ----------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` с Large       | Используйте `pipe.enable_model_cpu_offload()`; или переключитесь на вариант Medium                                      |
| Искажённый текст на изображении  | Делайте текст коротким (3–5 слов); заключайте его в кавычки в промпте; увеличьте `num_inference_steps` до 35            |
| Перенасыщенные цвета             | Уменьшите `guidance_scale` — попробуйте 2.5–3.5 для Large; используйте 0.0 для Turbo                                    |
| Ошибка 403 при скачивании модели | Примите лицензию на `https://huggingface.co/stabilityai/stable-diffusion-3.5-large` и запустите `huggingface-cli login` |
| Медленный первый запуск          | Первоначальная загрузка для Large — около 16 ГБ; последующие запуски используют кеш                                     |
| `KeyError: 'text_encoder_3'`     | Обновите diffusers: `pip install -U diffusers transformers`                                                             |
| Чёрный результат изображения     | Убедитесь, что `torch_dtype=torch.bfloat16` для Large/Turbo; fp32 может вызывать тихие сбои на некоторых картах         |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/generaciya-izobrazhenii/stable-diffusion-3-5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
