> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/nauka-i-issledovaniya/alphafold2.md).

# Предсказание белков AlphaFold2

> **Предсказывайте структуры белков с ИИ, удостоенным Нобелевской премии, — с ускорением на GPU на Clore.ai**

AlphaFold2, разработанный DeepMind, произвёл революцию в структурной биологии, предсказывая 3D-структуры белков с атомной точностью. Он был применён к более чем 200 миллионам белковых последовательностей и получил Нобелевскую премию по химии 2024 года. Для работы AlphaFold2 требуется значительный объём памяти GPU и вычислительных ресурсов — Clore.ai предоставляет доступные цены на высокопроизводительные GPU, которые для этого нужны.

**GitHub:** [google-deepmind/alphafold](https://github.com/google-deepmind/alphafold) — 13K+ ⭐

***

## Предварительные требования

* Учётная запись Clore.ai с достаточным балансом
* Базовое знакомство с командной строкой Linux
* Ваши целевые последовательности белка в формате FASTA
* \~2,5 ТБ дискового пространства для полных генетических баз данных (или используйте сокращённые базы данных для тестирования)

***

## Зачем запускать AlphaFold2 на Clore.ai?

AlphaFold2 получает огромную пользу от ускорения на GPU:

| Оборудование   | Время предсказания (типичный белок \~400 а.о.) |
| -------------- | ---------------------------------------------- |
| Только CPU     | 6–24+ часов                                    |
| Один A100 80GB | 15–45 минут                                    |
| Один RTX 4090  | 20–60 минут                                    |
| Один RTX 3090  | 30–90 минут                                    |

Clore.ai предлагает узлы A100, RTX 4090 и RTX 3090 по цене лишь части стоимости облачных провайдеров, делая доступными крупномасштабные исследования протеомики.

***

## Шаг 1 — Выберите аренду GPU на Clore.ai

{% hint style="info" %}
**Рекомендуемые GPU для AlphaFold2:**

* **A100 80 ГБ** — Лучше всего для крупных белков (>700 а.о.) и предсказания мультимеров
* **RTX 4090 24GB** — Отлично подходит для стандартных мономеров (<500 а.о.)
* **RTX 3090 24GB** — Экономичный вариант для небольших белков

Для предсказания мультимеров настоятельно рекомендуется 40+ ГБ VRAM.
{% endhint %}

1. Войдите в [маркетплейсе clore.ai](https://clore.ai) и перейдите к **Маркетплейс**
2. Отфильтруйте по модели GPU (рекомендуются A100 или RTX 4090)
3. Убедитесь, что на сервере есть **не менее 100 ГБ дискового пространства** (или 2,5 ТБ для полных баз данных)
4. Выберите сервер и нажмите **Аренда**

***

## Шаг 2 — Настройте развёртывание

При настройке заказа аренды используйте следующую конфигурацию:

**Docker-образ:**

```
nvidia/cuda:11.8.0-cudnn8-runtime-ubuntu20.04
```

{% hint style="warning" %}
AlphaFold2 требует пользовательской настройки Docker. Мы установим его из исходников внутри контейнера. В качестве альтернативы используйте образ сообщества `catgumag/alphafold` или `merteroglu/alphafold2` который включает окружение заранее.
{% endhint %}

**Открываемые порты:**

```
22
```

**Переменные среды:**

```
NVIDIA_VISIBLE_DEVICES=all
NVIDIA_DRIVER_CAPABILITIES=compute,utility
```

**Минимальные ресурсы:**

* CPU: 8 ядер
* ОЗУ: 32 ГБ (64 ГБ рекомендуется для крупных белков)
* Диск: минимум 100 ГБ (2,5 ТБ для полных баз данных)

***

## Шаг 3 — Подключение по SSH

После запуска инстанса:

```bash
ssh root@<server-ip> -p <ssh-port>
```

Проверьте, что GPU виден:

```bash
nvidia-smi
```

Ожидаемый вывод должен показать вашу GPU (например, A100 80GB SXM4).

***

## Шаг 4 — Установка AlphaFold2

### Вариант A: Использование официального скрипта установки

```bash
# Обновить системные пакеты
apt-get update && apt-get install -y \
    wget \\
    git \\
    python3-pip \\
    python3-dev \
    aria2 \
    hmmer \
    kalign \
    hhsuite

# Установить Miniconda
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh -O miniconda.sh
bash miniconda.sh -b -p /opt/conda
export PATH="/opt/conda/bin:$PATH"

# Клонировать AlphaFold2
git clone https://github.com/google-deepmind/alphafold.git /opt/alphafold
cd /opt/alphafold

# Создать conda-окружение
conda env create -f environment.yml
conda activate alphafold
```

### Вариант B: Использование pip (более быстрая настройка)

```bash
# Установить системные зависимости
apt-get update && apt-get install -y \
    wget curl git aria2 hmmer kalign

# Установить hhsuite
conda install -c bioconda hhsuite

# Клонировать и установить AlphaFold2
git clone https://github.com/google-deepmind/alphafold.git /opt/alphafold
cd /opt/alphafold

pip install -r requirements.txt
pip install --upgrade "jax[cuda11_pip]" -f https://storage.googleapis.com/jax-releases/jax_cuda_releases.html

# Установить сам AlphaFold
python3 setup.py install
```

***

## Шаг 5 — Скачать генетические базы данных

{% hint style="warning" %}
**Для полной загрузки баз данных требуется \~2,5 ТБ дискового пространства, и это может занять 6–24 часа.** Для начального тестирования используйте сокращённые базы данных (см. раздел Reduced DB ниже).
{% endhint %}

### Полные базы данных (для продакшена)

```bash
cd /opt/alphafold

# Скачать все базы данных с помощью предоставленного скрипта
bash scripts/download_all_data.sh /data/alphafold_databases
```

Загружает следующие данные:

* **BFD** (\~270 ГБ) — Большая фантастическая база данных
* **UniRef90** (\~58 ГБ) — Кластеры-референсы UniProt
* **MGnify** (\~64 ГБ) — Метагеномные последовательности
* **PDB70** (\~56 ГБ) — Репрезентативные структуры Protein Data Bank
* **PDB seqres** (\~0,2 ГБ)
* **UniClust30** (\~86 ГБ)
* **Small BFD** (\~17 ГБ) — Упрощённая версия

### Сокращённые базы данных (тестирование/разработка)

Для тестирования при ограниченном диске:

```bash
# Скачать только small_bfd и необходимые базы данных
bash scripts/download_small_bfd.sh /data/alphafold_databases
bash scripts/download_pdb70.sh /data/alphafold_databases
bash scripts/download_uniclust30.sh /data/alphafold_databases
bash scripts/download_uniref90.sh /data/alphafold_databases
bash scripts/download_mgnify.sh /data/alphafold_databases
bash scripts/download_pdb_seqres.sh /data/alphafold_databases
bash scripts/download_uniprot.sh /data/alphafold_databases
```

***

## Шаг 6 — Скачать веса модели AlphaFold

```bash
# Создать директорию для параметров модели
mkdir -p /data/alphafold_databases/params

# Скачать параметры модели (~3,5 ГБ)
wget -q -P /data/alphafold_databases/params \
    https://storage.googleapis.com/alphafold/alphafold_params_2022-12-06.tar

# Извлечь
tar -xf /data/alphafold_databases/params/alphafold_params_2022-12-06.tar \
    -C /data/alphafold_databases/params
```

***

## Шаг 7 — Подготовьте входную последовательность

Создайте FASTA-файл с целевой последовательностью белка:

```bash
cat > /tmp/target_protein.fasta << 'EOF'
>my_protein
MKTLLLTLVVVTIVCLDLGAVGNGSGLKCRQTGSCVHFPKDLQALPKDDTASDLNRSLDAEAFKAFQRLAENFNATEYRDIQNFNNKIQHSLEELAKKLDEKLAKLKEKLKQLEN
EOF
```

{% hint style="info" %}
**Советы по формату FASTA:**

* Заголовочная строка начинается с `>`
* Последовательность должна содержать только стандартные буквы аминокислот (ACDEFGHIKLMNPQRSTVWY)
* Удалите все пропуски и нестандартные символы
* Для предсказания мультимеров включите все цепи с отдельными заголовками
  {% endhint %}

***

## Шаг 8 — Запустите AlphaFold2

### Предсказание мономера (одна цепь)

```bash
cd /opt/alphafold

python3 run_alphafold.py \
    --fasta_paths=/tmp/target_protein.fasta \
    --max_template_date=2022-01-01 \
    --model_preset=monomer \
    --db_preset=full_dbs \
    --data_dir=/data/alphafold_databases \
    --output_dir=/tmp/alphafold_output \
    --uniref90_database_path=/data/alphafold_databases/uniref90/uniref90.fasta \
    --mgnify_database_path=/data/alphafold_databases/mgnify/mgy_clusters_2022_05.fa \
    --template_mmcif_dir=/data/alphafold_databases/pdb_mmcif/mmcif_files \
    --obsolete_pdbs_path=/data/alphafold_databases/pdb_mmcif/obsolete.dat \
    --pdb70_database_path=/data/alphafold_databases/pdb70/pdb70 \
    --bfd_database_path=/data/alphafold_databases/bfd/bfd_metaclust_clu_complete_id30_c90_final_seq.sorted_opt \
    --uniclust30_database_path=/data/alphafold_databases/uniclust30/uniclust30_2018_08/uniclust30_2018_08 \
    --use_gpu_relax=True
```

### Предсказание мультимера (белковый комплекс)

```bash
python3 run_alphafold.py \
    --fasta_paths=/tmp/complex.fasta \
    --max_template_date=2022-01-01 \
    --model_preset=multimer \
    --db_preset=full_dbs \
    --data_dir=/data/alphafold_databases \
    --output_dir=/tmp/alphafold_output \
    --uniref90_database_path=/data/alphafold_databases/uniref90/uniref90.fasta \
    --mgnify_database_path=/data/alphafold_databases/mgnify/mgy_clusters_2022_05.fa \
    --template_mmcif_dir=/data/alphafold_databases/pdb_mmcif/mmcif_files \
    --obsolete_pdbs_path=/data/alphafold_databases/pdb_mmcif/obsolete.dat \
    --uniprot_database_path=/data/alphafold_databases/uniprot/uniprot.fasta \
    --pdb_seqres_database_path=/data/alphafold_databases/pdb_seqres/pdb_seqres.txt \
    --use_gpu_relax=True
```

***

## Шаг 9 — Понимание выходных файлов

AlphaFold2 создаёт несколько выходных файлов для каждого предсказания:

```
/tmp/alphafold_output/my_protein/
├── ranked_0.pdb          # Лучшая предсказанная структура
├── ranked_1.pdb          # Вторая по качеству предсказанная структура
├── ranked_2.pdb
├── ranked_3.pdb
├── ranked_4.pdb
├── result_model_1.pkl    # Полные данные предсказания (pickle)
├── result_model_2.pkl
├── ...
├── msas/                 # Множественные выравнивания последовательностей
│   ├── bfd_uniclust_hits.a3m
│   ├── mgnify_hits.sto
│   └── uniref90_hits.sto
└── timings.json          # Разбивка по времени выполнения
```

{% hint style="info" %}
**Интерпретация результатов:**

* **ranked\_0.pdb** — это ваша лучшая структура — откройте её в PyMOL, ChimeraX или UCSF Chimera
* **Оценка pLDDT** (0–100): уверенность по каждому остатку. >90 = очень высокая, 70–90 = хорошая, 50–70 = низкая, <50 = неупорядоченная
* **PAE (предсказанная ошибка выравнивания)** графики показывают уверенность между доменами
  {% endhint %}

***

## Шаг 10 — Визуализация результатов

### Скачайте PDB-файлы на свой локальный компьютер

```bash
# С вашего локального компьютера:
scp -P <ssh-port> root@<server-ip>:/tmp/alphafold_output/my_protein/ranked_0.pdb ./

# Или используйте rsync для всей директории с результатами:
rsync -avz -e "ssh -p <ssh-port>" \
    root@<server-ip>:/tmp/alphafold_output/ \
    ./alphafold_results/
```

### Визуализируйте в PyMOL (локально)

```python
# В PyMOL:
load ranked_0.pdb
spectrum b, blue_white_red, minimum=0, maximum=100
# Окраска по оценке pLDDT (хранится в столбце B-factor)
```

### Быстрый анализ pLDDT

```python
import numpy as np

# Извлечь B-factor (pLDDT) из PDB
plddt_scores = []
with open('ranked_0.pdb', 'r') as f:
    for line in f:
        if line.startswith('ATOM'):
            plddt = float(line[60:66].strip())
            plddt_scores.append(plddt)

print(f"Средний pLDDT: {np.mean(plddt_scores):.1f}")
print(f"Остатков с pLDDT >90: {sum(s > 90 for s in plddt_scores)}/{len(plddt_scores)}")
```

***

## Использование ColabFold (более быстрая альтернатива)

ColabFold — это более быстрая реализация AlphaFold2, использующая MMseqs2 для генерации MSA:

```bash
pip install colabfold[alphafold]

# Запустить предсказание (значительно более быстрый этап MSA)
colabfold_batch /tmp/target_protein.fasta /tmp/colabfold_output \
    --num-recycle 3 \
    --use-gpu-relax
```

{% hint style="success" %}
**ColabFold обычно в 10–40 раз быстрее** оригинального пайплайна AlphaFold2 благодаря серверу MSA на базе MMseqs2. Идеально для итеративных исследовательских рабочих процессов.
{% endhint %}

***

## Устранение неполадок

### Недостаточно памяти CUDA

```bash
# Уменьшите сложность модели или используйте объединённую память
export XLA_PYTHON_CLIENT_ALLOCATOR=platform
export XLA_PYTHON_CLIENT_MEM_FRACTION=0.85

# Или запустите с уменьшенным числом циклов перерасчёта
--num_multimer_predictions_per_model 1
```

### Ошибки HHblits / Jackhmmer

```bash
# Убедитесь, что hhsuite установлен корректно
which hhblits
hhblits --version

# Переустановите при необходимости
conda install -c bioconda hhsuite -y
```

### Сбои при загрузке баз данных

```bash
# Возобновить прерванные загрузки с помощью aria2
aria2c -c -x 16 -s 16 <database-url> -d /data/alphafold_databases/
```

### Проблемы совместимости JAX/CUDA

```bash
# Проверьте, что JAX видит GPU
python3 -c "import jax; print(jax.devices())"

# Переустановите JAX с правильной версией CUDA
pip install --upgrade "jax[cuda11_pip]" \
    -f https://storage.googleapis.com/jax-releases/jax_cuda_releases.html
```

***

## Советы по производительности

{% hint style="success" %}
**Оптимизируйте свои запуски AlphaFold2:**

1. **Используйте ColabFold** для более быстрой генерации MSA (ускорение в 10–40 раз)
2. **Установите `--num-recycle 1`** для быстрой первичной проверки, используйте 3 для финальных предсказаний
3. **Используйте `--db_preset=reduced_dbs`** для исследовательской работы
4. **Пакетно обрабатывайте несколько последовательностей** в одном FASTA-файле для эффективного выполнения пайплайна
5. **Включите GPU-расслабление** (`--use_gpu_relax=True`) — намного быстрее, чем CPU-расслабление
   {% endhint %}

***

## Оценка стоимости на Clore.ai

| Сценарий                       | GPU        | Оцен. время | Оцен. стоимость |
| ------------------------------ | ---------- | ----------- | --------------- |
| Один белок (\~300 а.о.)        | RTX 3090   | 1–2 ч       | \~$0,30–0,60    |
| Один белок (\~500 а.о.)        | RTX 4090   | 45–90 мин   | \~$0,40–0,80    |
| Мультимерный комплекс          | A100 80 ГБ | 2–4 ч       | \~$1,50–3,00    |
| Скрининг протеома (100 белков) | A100 80 ГБ | 8–12 ч      | \~$6–10         |

*Стоимость приблизительная и зависит от текущих рыночных цен.*

***

## Дополнительные ресурсы

* [AlphaFold2 GitHub](https://github.com/google-deepmind/alphafold)
* [База данных AlphaFold](https://alphafold.ebi.ac.uk/) — Предварительно вычисленные структуры для 200M+ белков
* [ColabFold GitHub](https://github.com/sokrypton/ColabFold)
* [Блог DeepMind AlphaFold](https://www.deepmind.com/research/highlighted-research/alphafold)
* [OpenFold](https://github.com/aqlaboratory/openfold) — Реализация на PyTorch, которую можно обучать
* [ESMFold](https://github.com/facebookresearch/esm) — более быстрая альтернатива от Meta

***

*Это руководство охватывает развёртывание AlphaFold2 на GPU-аренде Clore.ai. Для новейшего AlphaFold3 см. отдельное руководство по AlphaFold3.*

***

## Рекомендации по GPU для Clore.ai

| Сценарий использования        | Рекомендуемый GPU | Оценочная стоимость на Clore.ai             |
| ----------------------------- | ----------------- | ------------------------------------------- |
| Разработка/тестирование       | RTX 3090 (24 ГБ)  | $0.07–0.21/гпу/ч                            |
| Стандартные белки             | RTX 4090 (24 ГБ)  | $0.14–0.42/гпу/ч                            |
| Крупные молекулы / мультимеры | A100 80 ГБ        | [голое железо](https://clore.ai/bare-metal) |

> 💡 Все примеры в этом руководстве можно развернуть на [Clore.ai](https://clore.ai/marketplace) GPU-серверах. Просматривайте доступные GPU и арендуйте по часам — без обязательств, с полным root-доступом.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/nauka-i-issledovaniya/alphafold2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
