> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/platformy-i-agenty-ii/continue-dev.md).

# Continue.dev AI Coding

Усильте Continue.dev с помощью GPU Clore.ai — запускайте CodeLlama 34B, DeepSeek Coder и Qwen2.5-Coder локально на дешёвой аренде GPU для приватной помощи в AI-кодинге.

Continue.dev — это AI-ассистент для кодинга с открытым исходным кодом для VS Code и JetBrains с более чем 25 тыс. звёзд на GitHub. Это **расширение работает на вашем локальном компьютере** (или в вашей IDE), но для инференса подключается к серверу бэкенд-модели. Если направить Continue.dev на мощный GPU, арендованный через Clore.ai, вы получите:

* **Модели для кодинга высшего уровня** (с параметрами 34B+), которые не поместятся на вашем ноутбуке
* **Полную конфиденциальность** — код остаётся на инфраструктуре, которую вы контролируете
* **Гибкие расходы** — платите только пока пишете код (\~$0.20–0.50/ч против $19/мес. за Copilot)
* **API, совместимый с OpenAI** — Continue.dev без проблем подключается к Ollama, vLLM или TabbyML

Это руководство сосредоточено на настройке **GPU-бэкенда Clore.ai** (Ollama или vLLM), к которому подключается ваше локальное расширение Continue.dev.

{% hint style="success" %}
Все примеры GPU-серверов используют серверы, арендованные через [маркетплейс CLORE.AI](https://clore.ai/marketplace).
{% endhint %}

{% hint style="info" %}
**Архитектура**: Ваша IDE (с расширением Continue.dev) → Интернет → GPU-сервер Clore.ai (работающий Ollama / vLLM / TabbyML) → локальный инференс модели. Код никогда не попадает в сторонний API.
{% endhint %}

## Обзор

| Параметр                 | Подробности                                                                                            |
| ------------------------ | ------------------------------------------------------------------------------------------------------ |
| **Проект**               | [continuedev/continue](https://github.com/continuedev/continue)                                        |
| **Лицензия**             | Apache 2.0                                                                                             |
| **Звёзды GitHub**        | 25K+                                                                                                   |
| **Поддержка IDE**        | VS Code, JetBrains (IntelliJ, PyCharm, WebStorm, GoLand и т. д.)                                       |
| **Файл конфигурации**    | `~/.continue/config.json`                                                                              |
| **Варианты бэкенда**     | Ollama, vLLM, TabbyML, LM Studio, llama.cpp, API, совместимые с OpenAI                                 |
| **Сложность**            | Легко (установка расширения) / Средне (самостоятельно размещённый бэкенд)                              |
| **Нужен GPU?**           | На сервере Clore.ai (да); на вашем ноутбуке (нет)                                                      |
| **Ключевые особенности** | Автодополнение, чат, режим редактирования, контекст кодовой базы (RAG), пользовательские slash-команды |

### Рекомендуемые модели для кодинга

| Модель                | VRAM    | Сила                              | Примечания                                  |
| --------------------- | ------- | --------------------------------- | ------------------------------------------- |
| `codellama:7b`        | \~6 ГБ  | Быстрое автодополнение            | Хорошая отправная точка                     |
| `codellama:13b`       | \~10 ГБ | Сбалансированная                  | Лучшее качество/скорость для автодополнения |
| `codellama:34b`       | \~22 ГБ | Лучшее качество CodeLlama         | Требуется RTX 3090 / A100                   |
| `deepseek-coder:6.7b` | \~5 ГБ  | Специалист по Python/JS           | Отлично подходит для веб-разработки         |
| `deepseek-coder:33b`  | \~22 ГБ | Open source высшего уровня        | Соперничает с GPT-4 по коду                 |
| `qwen2.5-coder:7b`    | \~6 ГБ  | Многоязычный код                  | Сильна в более чем 40 языках                |
| `qwen2.5-coder:32b`   | \~22 ГБ | Передовой                         | Лучшая open-source модель для кодинга 2024  |
| `starcoder2:15b`      | \~12 ГБ | Специалист по автодополнению кода | Поддержка FIM (fill-in-the-middle)          |

## Требования

### Требования к серверу Clore.ai

| Тариф                  | GPU        | VRAM  | ОЗУ   | Диск   | Цена                                        | Модели                                           |
| ---------------------- | ---------- | ----- | ----- | ------ | ------------------------------------------- | ------------------------------------------------ |
| **Бюджетная**          | RTX 3060   | 12 ГБ | 16 ГБ | 40 ГБ  | $0.03–0.07/час                              | CodeLlama 7B, DeepSeek 6.7B, Qwen2.5-Coder 7B    |
| **Рекомендуется**      | RTX 3090   | 24 ГБ | 32 ГБ | 80 ГБ  | $0.07–0.21/ч                                | CodeLlama 34B, DeepSeek 33B, Qwen2.5-Coder 32B   |
| **Производительность** | RTX 4090   | 24 ГБ | 32 ГБ | 80 ГБ  | $0.14–0.42/ч                                | Те же модели, что и выше, более быстрый инференс |
| **Мощность**           | A100 40 ГБ | 40 ГБ | 64 ГБ | 120 ГБ | [голое железо](https://clore.ai/bare-metal) | Несколько моделей 34B одновременно               |
| **Максимум**           | A100 80 ГБ | 80 ГБ | 80 ГБ | 200 ГБ | [голое железо](https://clore.ai/bare-metal) | Модели 70B (CodeLlama 70B)                       |

### Локальные требования (ваша машина)

* VS Code или любая IDE JetBrains
* Установлено расширение Continue.dev
* Стабильное интернет-соединение с вашим сервером Clore.ai
* **Локальный GPU не нужен** — весь инференс происходит на Clore.ai

## Быстрый старт

### Часть 1: Настройка бэкенда Clore.ai

#### Вариант A — бэкенд Ollama (рекомендуется большинству пользователей)

Ollama — самый простой бэкенд для Continue.dev: простая настройка, отличное управление моделями, API, совместимый с OpenAI.

```bash
# 1. Подключитесь по SSH к вашему серверу Clore.ai
ssh root@<clore-server-ip> -p <port>

# 2. Запустите Ollama с поддержкой GPU
docker run -d \
  --name ollama \\
  --gpus all \
  -p 11434:11434 \\
  -v /workspace/ollama:/root/.ollama \
  --restart unless-stopped \
  ollama/ollama

# 3. Проверьте, что Ollama запущен
curl http://localhost:11434/

# 4. Скачайте вашу модель для кодинга (выберите в зависимости от VRAM)
# Для 12 ГБ VRAM (RTX 3060):
docker exec ollama ollama pull codellama:13b

# Для 24 ГБ VRAM (RTX 3090 / RTX 4090):
docker exec ollama ollama pull qwen2.5-coder:32b
# или:
docker exec ollama ollama pull deepseek-coder:33b

# 5. Скачайте быструю модель автодополнения (отдельно от чат-модели)
docker exec ollama ollama pull starcoder2:3b   # Очень быстро, отлично подходит для FIM-автодополнения

# 6. Проверьте, что модели доступны
docker exec ollama ollama list

# 7. Протестируйте инференс
docker exec ollama ollama run qwen2.5-coder:32b "Напиши функцию на Python для бинарного поиска в отсортированном списке"
```

Чтобы сделать Ollama доступным извне (чтобы ваше локальное IDE могло подключиться):

```bash
# Перезапустите Ollama с включённым внешним доступом
docker stop ollama && docker rm ollama

docker run -d \
  --name ollama \\
  --gpus all \
  -p 11434:11434 \\
  -v /workspace/ollama:/root/.ollama \
  -e OLLAMA_HOST=0.0.0.0 \
  --restart unless-stopped \
  ollama/ollama

# Проверка с вашего ЛОКАЛЬНОГО компьютера:
curl http://<clore-server-ip>:11434/api/tags
```

{% hint style="warning" %}
Порт 11434, открытый публично, по умолчанию не имеет аутентификации. Для использования в production вместо этого настройте SSH-туннель (см. [Советы и лучшие практики](#tips--best-practices)).
{% endhint %}

#### Вариант B — бэкенд vLLM (высокая пропускная способность / совместимость с OpenAI)

vLLM обеспечивает более быстрый инференс и поддержку нескольких пользователей. Идеально, если несколько разработчиков используют один сервер Clore.ai.

```bash
# Запустите vLLM с API, совместимым с OpenAI
docker run -d \
  --name vllm \\
  --gpus all \
  -p 8000:8000 \\
  -v /workspace/hf-models:/root/.cache/huggingface \
  -e HF_TOKEN="ваш-huggingface-токен" \
  --restart unless-stopped \
  vllm/vllm-openai:latest \\
  --model Qwen/Qwen2.5-Coder-32B-Instruct \
  --dtype auto \
  --max-model-len 32768 \
  --tensor-parallel-size 1 \\
  --gpu-memory-utilization 0.90 \
  --served-model-name qwen2.5-coder-32b

# Для нескольких GPU (например, двух RTX 3090):
docker run -d \
  --name vllm \\
  --gpus all \
  -p 8000:8000 \\
  -v /workspace/hf-models:/root/.cache/huggingface \
  -e HF_TOKEN="ваш-huggingface-токен" \
  vllm/vllm-openai:latest \\
  --model deepseek-ai/DeepSeek-Coder-V2-Lite-Instruct \
  --tensor-parallel-size 2 \
  --dtype auto \
  --max-model-len 65536 \\
  --served-model-name deepseek-coder-v2

# Проверить API
curl http://localhost:8000/v1/models
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "qwen2.5-coder-32b",
    "messages": [{"role": "user", "content": "Напиши hello world на Rust"}],
    "max_tokens": 200
  }'
```

#### Вариант C — бэкенд TabbyML (специалист по FIM-автодополнению)

TabbyML обеспечивает превосходное автодополнение fill-in-the-middle (FIM) — встроенные подсказки призрачным текстом. См. [документацию TabbyML](https://tabby.tabbyml.com/) для полного описания настройки.

```bash
# Быстрая настройка TabbyML для автодополнения Continue.dev
docker run -d \
  --name tabby \
  --gpus all \
  -p 8080:8080 \
  -v /workspace/tabby-data:/data \
  --restart unless-stopped \
  tabbyml/tabby serve \
  --model StarCoder2-7B \
  --chat-model Mistral-7B \
  --device cuda

# Проверить
curl http://localhost:8080/v1/health
```

### Часть 2: Установите расширение Continue.dev

**VS Code:**

1. Откройте панель расширений (`Ctrl+Shift+X` / `Cmd+Shift+X`)
2. Найдите **"Continue"** — установите официальное расширение от Continue (continuedev)
3. Нажмите на значок Continue на боковой панели (или `Ctrl+Shift+I`)

**JetBrains (IntelliJ, PyCharm, WebStorm, GoLand):**

1. `Файл → Настройки → Плагины → Marketplace`
2. Найдите **"Continue"** и установите
3. Перезапустите IDE; панель Continue появится в правой боковой панели

### Часть 3: Настройте Continue.dev для использования Clore.ai

Отредактируйте `~/.continue/config.json` на вашем **локальном компьютере**:

```json
{
  "models": [
    {
      "title": "Clore.ai — Qwen2.5-Coder 32B",
      "provider": "ollama",
      "model": "qwen2.5-coder:32b",
      "apiBase": "http://<clore-server-ip>:11434",
      "contextLength": 32768,
      "completionOptions": {
        "temperature": 0.1,
        "topP": 0.95,
        "maxTokens": 4096
      }
    },
    {
      "title": "Clore.ai — CodeLlama 13B (быстрый)",
      "provider": "ollama",
      "model": "codellama:13b",
      "apiBase": "http://<clore-server-ip>:11434",
      "contextLength": 16384
    }
  ],
  "tabAutocompleteModel": {
    "title": "StarCoder2 3B (автодополнение)",
    "provider": "ollama",
    "model": "starcoder2:3b",
    "apiBase": "http://<clore-server-ip>:11434"
  },
  "embeddingsProvider": {
    "provider": "ollama",
    "model": "nomic-embed-text",
    "apiBase": "http://<clore-server-ip>:11434"
  },
  "contextProviders": [
    { "name": "code" },
    { "name": "docs" },
    { "name": "diff" },
    { "name": "terminal" },
    { "name": "problems" },
    { "name": "folder" },
    { "name": "codebase" }
  ],
  "slashCommands": [
    { "name": "edit", "description": "Редактировать выбранный код" },
    { "name": "comment", "description": "Добавить комментарии к коду" },
    { "name": "share", "description": "Экспортировать разговор в markdown" },
    { "name": "cmd", "description": "Сгенерировать команду терминала" },
    { "name": "commit", "description": "Сгенерировать сообщение коммита git" }
  ]
}
```

Для **бэкенда vLLM** вместо Ollama:

```json
{
  "models": [
    {
      "title": "Clore.ai — DeepSeek Coder 33B (vLLM)",
      "provider": "openai",
      "model": "deepseek-coder-v2",
      "apiBase": "http://<clore-server-ip>:8000/v1",
      "apiKey": "не требуется",
      "contextLength": 65536,
      "completionOptions": {
        "temperature": 0.0,
        "maxTokens": 8192
      }
    }
  ]
}
```

Для **бэкенд TabbyML** (только автодополнение):

```json
{
  "tabAutocompleteModel": {
    "title": "Clore.ai — TabbyML StarCoder2",
    "provider": "openai",
    "model": "StarCoder2-7B",
    "apiBase": "http://<clore-server-ip>:8080/v1",
    "apiKey": "auth-token-if-set"
  }
}
```

## Конфигурация

### Настройка SSH-туннеля (безопасный удалённый доступ)

Вместо того чтобы открывать порты публично, используйте SSH-туннель с вашего локального компьютера:

```bash
# Откройте SSH-туннель: локальный порт 11434 → порт сервера Clore.ai 11434
ssh -N -L 11434:localhost:11434 root@<clore-server-ip> -p <clore-ssh-port>

# Чтобы туннель оставался активным (добавьте в ~/.ssh/config):
Host clore-coding
  HostName <clore-server-ip>
  Port <clore-ssh-port>
  User root
  LocalForward 11434 localhost:11434
  LocalForward 8000 localhost:8000
  ServerAliveInterval 60
  ServerAliveCountMax 3

# Подключиться с помощью:
ssh -N clore-coding

# Затем в config.json используйте localhost:
# "apiBase": "http://localhost:11434"
```

### Постоянный туннель с autossh

```bash
# Установите autossh на ваш локальный компьютер (Linux/macOS)
sudo apt install autossh   # Ubuntu/Debian
brew install autossh       # macOS

# Запустите постоянный туннель, который автоматически переподключается
autossh -M 0 -N \
  -o "ServerAliveInterval 30" \
  -o "ServerAliveCountMax 3" \
  -L 11434:localhost:11434 \
  root@<clore-server-ip> -p <clore-ssh-port>

# Добавьте в systemd для автоматического запуска при загрузке (Linux)
cat > ~/.config/systemd/user/clore-tunnel.service << 'EOF'
[Unit]
Description=SSH-туннель к серверу кодинга Clore.ai
After=network.target

[Service]
ExecStart=autossh -M 0 -N \
  -o StrictHostKeyChecking=accept-new \
  -o ServerAliveInterval=30 \
  -o ServerAliveCountMax=3 \
  -L 11434:localhost:11434 \
  root@CLORE_IP -p CLORE_PORT
Restart=always
RestartSec=10

[Install]
WantedBy=default.target
EOF

systemctl --user enable clore-tunnel
systemctl --user start clore-tunnel
```

### Загрузите несколько моделей для разных задач

Для RTX 3090 (24 ГБ) вы можете одновременно запускать большую чат-модель и маленькую модель автодополнения:

```bash
# На сервере Clore.ai:

# Скачайте модели
docker exec ollama ollama pull qwen2.5-coder:32b      # Чат (22 ГБ)
docker exec ollama ollama pull starcoder2:3b           # Автодополнение (2 ГБ)
docker exec ollama ollama pull nomic-embed-text        # Эмбеддинги (0.5 ГБ)

# Ollama автоматически управляет переключением моделей
# Все три помещаются в 24 ГБ VRAM благодаря умному кэшированию

# Следите за использованием VRAM
nvidia-smi --query-gpu=memory.used,memory.free --format=csv -l 5
```

### Индексирование кодовой базы (RAG для вашего репозитория)

Continue.dev может индексировать вашу кодовую базу для контекстно-зависимых подсказок. Скачайте модель эмбеддингов:

```bash
# На сервере Clore.ai — добавьте модель эмбеддингов в Ollama
docker exec ollama ollama pull nomic-embed-text

# В config.json (локально) эмбеддинги уже настроены выше.
# Continue.dev автоматически проиндексирует ваше открытое рабочее пространство.
# Запустить ручное переиндексирование: Ctrl+Shift+P → "Continue: Index Codebase"
```

## Ускорение на GPU

### Контролируйте производительность инференса

```bash
# На вашем сервере Clore.ai — следите за GPU во время сеансов кодинга
watch -n 1 nvidia-smi

# Проверьте количество токенов в секунду (логи Ollama)
docker logs ollama --tail 20 -f

# Подробная статистика GPU
nvidia-smi dmon -s u -d 2

# Разбивка по памяти
nvidia-smi --query-gpu=name,memory.used,memory.free,utilization.gpu \
  --format=csv,noheader -l 5
```

### Ожидаемая производительность по GPU

| GPU           | Модель                   | Контекст | Токенов/сек (примерно) |
| ------------- | ------------------------ | -------- | ---------------------- |
| RTX 3060 12GB | CodeLlama 7B             | 8K       | \~40–60 т/с            |
| RTX 3060 12GB | DeepSeek-Coder 6.7B      | 8K       | \~45–65 т/с            |
| RTX 3090 24GB | Qwen2.5-Coder 32B (Q4)   | 16K      | \~15–25 т/с            |
| RTX 3090 24GB | DeepSeek-Coder 33B (Q4)  | 16K      | \~15–22 т/с            |
| RTX 4090 24GB | Qwen2.5-Coder 32B (Q4)   | 16K      | \~25–40 т/с            |
| A100 40 ГБ    | Qwen2.5-Coder 32B (FP16) | 32K      | \~35–50 т/с            |
| A100 80 ГБ    | CodeLlama 70B (Q4)       | 32K      | \~20–30 т/с            |

Для автодополнения (fill-in-the-middle), **starcoder2:3b** или **codellama:7b** может достигать 50–100 т/с — достаточно быстро, чтобы ощущаться мгновенным в IDE.

### Настройте Ollama для лучшей производительности

```bash
# На сервере Clore.ai — оптимизируйте настройки Ollama
docker stop ollama && docker rm ollama

docker run -d \
  --name ollama \\
  --gpus all \
  -p 11434:11434 \\
  -v /workspace/ollama:/root/.ollama \
  -e OLLAMA_HOST=0.0.0.0 \
  -e OLLAMA_NUM_PARALLEL=2 \
  -e OLLAMA_MAX_LOADED_MODELS=2 \
  -e OLLAMA_FLASH_ATTENTION=1 \
  --restart unless-stopped \
  ollama/ollama

# OLLAMA_NUM_PARALLEL=2: обслуживать 2 запроса одновременно
# OLLAMA_MAX_LOADED_MODELS=2: держать 2 модели в памяти GPU
# OLLAMA_FLASH_ATTENTION=1: включить flash attention (быстрее, меньше памяти)
```

## Советы и лучшие практики

### Используйте разные модели для разных задач

Настройте Continue.dev со специализированными моделями для каждого типа задач — интерфейс позволяет переключать модели в середине разговора:

```json
{
  "models": [
    {
      "title": "Чат — Qwen2.5-Coder 32B",
      "provider": "ollama",
      "model": "qwen2.5-coder:32b",
      "apiBase": "http://localhost:11434",
      "contextLength": 32768,
      "description": "Лучше всего для сложных вопросов, ревью кода, архитектурных решений"
    },
    {
      "title": "Быстро — CodeLlama 7B",
      "provider": "ollama",
      "model": "codellama:7b",
      "apiBase": "http://localhost:11434",
      "contextLength": 8192,
      "description": "Быстрые ответы, простые дополнения, низкая задержка"
    },
    {
      "title": "Автодополнение — StarCoder2 3B",
      "provider": "ollama",
      "model": "starcoder2:3b",
      "apiBase": "http://localhost:11434",
      "contextLength": 4096,
      "description": "Встроенные подсказки призрачным текстом"
    }
  ]
}
```

### Сравнение стоимости

| Решение               | Ежемесячная стоимость (при использовании 8 ч/день) | Конфиденциальность | Качество модели       |
| --------------------- | -------------------------------------------------- | ------------------ | --------------------- |
| GitHub Copilot        | $19/польз./мес.                                    | ❌ облако Microsoft | GPT-4o (закрытая)     |
| Cursor Pro            | $20/польз./мес.                                    | ❌ Облако Cursor    | Claude 3.5 (закрытая) |
| RTX 3060 на Clore.ai  | \~$24/мес.                                         | ✅ Ваш сервер       | CodeLlama 13B         |
| RTX 3090 на Clore.ai  | \~$48/мес.                                         | ✅ Ваш сервер       | Qwen2.5-Coder 32B     |
| RTX 4090 на Clore.ai  | \~$84/мес.                                         | ✅ Ваш сервер       | Qwen2.5-Coder 32B     |
| A100 80GB на Clore.ai | \~$264/мес.                                        | ✅ Ваш сервер       | CodeLlama 70B         |

Для команды из 3+ разработчиков, использующих один RTX 3090 на Clore.ai (\~$48/мес. всего), стоимость на одного пользователя ниже, чем у Copilot, при этом предоставляется более крупная приватная модель.

### Выключайте, когда не кодируете

Clore.ai взимает плату почасово. Используйте простой скрипт для запуска/остановки сервера:

```bash
# Сохраните это как локальные скрипты

# start-coding-server.sh
#!/bin/bash
echo "Открываю SSH-туннель к Clore.ai..."
ssh -N -f -L 11434:localhost:11434 clore-coding
echo "Туннель открыт. Continue.dev готов."

# stop-coding-server.sh
#!/bin/bash
echo "Закрываю SSH-туннель..."
pkill -f "ssh.*clore-coding"
echo "Туннель закрыт. Не забудьте остановить заказ в Clore.ai, чтобы прекратить списание средств!"
```

### Используйте пользовательские команды Continue.dev

Добавьте пользовательские slash-команды в `config.json` для типичных рабочих процессов программирования:

```json
{
  "customCommands": [
    {
      "name": "review",
      "prompt": "Проверьте этот код на наличие ошибок, проблем безопасности и производительности. Будьте конкретны и предлагайте практические действия.",
      "description": "Проверка кода"
    },
    {
      "name": "test",
      "prompt": "Напишите исчерпывающие модульные тесты для этого кода. Включите крайние случаи. Используйте тот же язык/фреймворк, что и у кода.",
      "description": "Генерация тестов"
    },
    {
      "name": "docstring",
      "prompt": "Добавьте к этому коду понятные, подробные docstring-комментарии в соответствии с лучшими практиками для этого языка.",
      "description": "Добавление документации"
    },
    {
      "name": "optimize",
      "prompt": "Оптимизируйте этот код по производительности. Объясните, что вы изменили и почему.",
      "description": "Оптимизация кода"
    }
  ]
}
```

## Устранение неполадок

| Проблема                                         | Вероятная причина                           | Решение                                                                                          |
| ------------------------------------------------ | ------------------------------------------- | ------------------------------------------------------------------------------------------------ |
| Continue.dev показывает "Отказано в подключении" | Ollama недоступен                           | Проверьте, что SSH-туннель активен; убедитесь `curl http://localhost:11434/` работает            |
| Автодополнение не срабатывает                    | Модель автодополнения по Tab не задана      | Добавьте `tabAutocompleteModel` в config.json; включите в настройках Continue                    |
| Очень медленные ответы (>30 с до первого токена) | Модель загружается с диска                  | Первый запрос загружает модель в VRAM — последующие запросы быстрые                              |
| Ошибка "Модель не найдена"                       | Модель не загружена                         | Запускайте `docker exec ollama ollama pull <model-name>` на сервере Clore.ai                     |
| Высокая задержка между токенами                  | Сетевая задержка или слишком большая модель | Используйте SSH-туннель; переключитесь на меньшую модель; проверьте загрузку GPU сервера         |
| Контекст кодовой базы не работает                | Отсутствует модель эмбеддингов              | Загрузите `nomic-embed-text` через Ollama; проверьте `embeddingsProvider` в config.json          |
| SSH-туннель часто разрывается                    | Нестабильное соединение                     | Используйте `autossh` для постоянного переподключения; добавьте `ServerAliveInterval 30`         |
| Превышено окно контекста                         | Длинные файлы/диалоги                       | Уменьшите `contextLength` в config.json; используйте модель с более длинным контекстом           |
| Плагин JetBrains не загружается                  | Несовместимость версии IDE                  | Обновите JetBrains IDE до последней версии; проверьте матрицу совместимости плагина Continue.dev |
| OOM в vLLM при загрузке                          | Недостаточно VRAM                           | Добавьте `--gpu-memory-utilization 0.85`; используйте меньшую модель или квантизированную версию |

### Команды для отладки

```bash
# На ВАШЕМ ЛОКАЛЬНОМ компьютере — проверьте соединение
curl http://localhost:11434/api/tags          # если используется SSH-туннель
curl http://<clore-ip>:11434/api/tags        # если порт открыт напрямую

# На сервере CLORE.AI — проверьте Ollama
docker logs ollama --tail 30 -f
docker exec ollama ollama list
docker exec ollama ollama ps                  # показать текущие загруженные модели

# Проверьте время отклика модели
time curl http://localhost:11434/api/generate \\
  -d '{"model": "codellama:7b", "prompt": "def hello():", "stream": false}'

# Проверить память GPU
nvidia-smi --query-gpu=memory.used,memory.free --format=csv

# Проверьте логи vLLM
docker logs vllm --tail 50 -f

# Перезапустите Ollama без потери моделей
docker restart ollama
```

### Проверка конфигурации Continue.dev

```bash
# Проверьте синтаксис config.json на вашем локальном компьютере
python3 -c "
import json, sys
try:
    config = json.load(open(sys.argv[1]))
    print('✅ Конфигурация — корректный JSON')
    print(f'Модели: {[m[\"title\"] for m in config.get(\"models\", [])]}')
except Exception as e:
    print(f'❌ Ошибка: {e}')
" ~/.continue/config.json
```

## Дополнительное чтение

* [Документация Continue.dev](https://docs.continue.dev/) — официальная документация по всем интеграциям IDE и параметрам конфигурации
* [GitHub Continue.dev](https://github.com/continuedev/continue) — исходный код, проблемы, совместимость моделей
* [Справочник по конфигурации Continue.dev](https://docs.continue.dev/reference) — полный `config.json` схема
* [Ollama на Clore.ai](/guides/guides_v2-ru/yazykovye-modeli/ollama.md) — подробное руководство по настройке Ollama (рекомендуемый бэкенд)
* [vLLM на Clore.ai](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) — высокопроизводительный альтернативный бэкенд для команд
* [TabbyML](https://tabby.tabbyml.com/) — специализированный бэкенд автодополнения с оптимизацией FIM
* [Руководство по сравнению GPU](/guides/guides_v2-ru/nachalo-raboty/gpu-comparison.md) — выберите подходящий GPU для вашей нагрузки на кодирование
* [Совместимость моделей](/guides/guides_v2-ru/nachalo-raboty/model-compatibility.md) — какие модели помещаются в какие объёмы VRAM
* [Qwen2.5-Coder](https://huggingface.co/Qwen/Qwen2.5-Coder-32B-Instruct) — на данный момент лучшая открытая модель для программирования
* [DeepSeek-Coder-V2](https://huggingface.co/deepseek-ai/DeepSeek-Coder-V2-Lite-Instruct) — сильная альтернатива с длинным контекстом
* [маркетплейс CLORE.AI](https://clore.ai/marketplace) — арендуйте GPU-серверы


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/platformy-i-agenty-ii/continue-dev.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
