For the complete documentation index, see llms.txt. This page is also available as Markdown.

Continue.dev AI 编程

用 Clore.ai GPU 为 Continue.dev 提供算力——在便宜的 GPU 租赁上本地运行 CodeLlama 34B、DeepSeek Coder 和 Qwen2.5-Coder,用于私有 AI 编程辅助。

Continue.dev 是一款面向 VS Code 和 JetBrains 的开源 AI 编码助手,拥有 2.5 万+ GitHub stars。该 扩展运行在你的本地机器上 (或在你的 IDE 中),但它会连接到一个用于推理的后端模型服务器。将 Continue.dev 指向从 Clore.ai 租用的强大 GPU 后,你将获得:

  • 顶级编码模型 (34B+ 参数),你的笔记本电脑无法承载

  • 完全隐私 —— 代码保留在你可控的基础设施上

  • 灵活成本 —— 只在你编码时付费(约 $0.20–0.50/小时,而 Copilot 为 $19/月)

  • 兼容 OpenAI 的 API —— Continue.dev 可无缝连接到 Ollama、vLLM 或 TabbyML

本指南重点介绍如何设置 Clore.ai GPU 后端 (Ollama 或 vLLM),你的本地 Continue.dev 扩展会连接到它。

架构:你的 IDE(安装 Continue.dev 扩展)→ 互联网 → Clore.ai GPU 服务器(运行 Ollama / vLLM / TabbyML)→ 本地模型推理。代码从不接触第三方 API。

概览

属性
详情

许可证

Apache 2.0

GitHub 星标

25K+

IDE 支持

VS Code、JetBrains(IntelliJ、PyCharm、WebStorm、GoLand 等)

配置文件

~/.continue/config.json

后端选项

Ollama、vLLM、TabbyML、LM Studio、llama.cpp、兼容 OpenAI 的 API

难度

简单(安装扩展)/ 中等(自托管后端)

需要 GPU?

在 Clore.ai 服务器上(是);在你的笔记本电脑上(否)

主要特性

自动补全、聊天、编辑模式、代码库上下文(RAG)、自定义斜杠命令

推荐的编码模型

模型
显存
强项
备注

codellama:7b

~6 GB

快速自动补全

不错的起点

codellama:13b

约 10 GB

均衡

自动补全的最佳质量/速度平衡

codellama:34b

~22 GB

最佳 CodeLlama 质量

需要 RTX 3090 / A100

deepseek-coder:6.7b

~5 GB

Python/JS 专家

非常适合 Web 开发

deepseek-coder:33b

~22 GB

顶级开源模型

在代码方面可与 GPT-4 匹敌

qwen2.5-coder:7b

~6 GB

多语言代码

在 40+ 种语言上表现强劲

qwen2.5-coder:32b

~22 GB

最先进

2024 年最佳开源编码模型

starcoder2:15b

~12 GB

代码补全专家

支持 FIM(中间填充)

需求

Clore.ai 服务器要求

层级
GPU
显存
内存
磁盘
价格
模型

预算

RTX 3060

12 GB

16 GB

40 GB

$0.03–0.07/小时

CodeLlama 7B、DeepSeek 6.7B、Qwen2.5-Coder 7B

推荐

RTX 3090

24 GB

32 GB

80 GB

$0.07–0.21/小时

CodeLlama 34B、DeepSeek 33B、Qwen2.5-Coder 32B

性能

RTX 4090

24 GB

32 GB

80 GB

$0.14–0.42/小时

与上面相同的模型,更快的推理

性能

A100 40GB

40 GB

64 GB

120 GB

可同时运行多个 34B 模型

最大值

A100 80GB

80 GB

80 GB

200 GB

70B 模型(CodeLlama 70B)

本地要求(你的机器)

  • VS Code 或任意 JetBrains IDE

  • 已安装 Continue.dev 扩展

  • 到你的 Clore.ai 服务器的稳定互联网连接

  • 无需本地 GPU —— 所有推理都发生在 Clore.ai 上

快速开始

第 1 部分:设置 Clore.ai 后端

选项 A —— Ollama 后端(适合大多数用户)

Ollama 是 Continue.dev 最容易上手的后端——设置简单、模型管理优秀、兼容 OpenAI 的 API。

要将 Ollama 暴露到外部(这样你的本地 IDE 才能连接):

选项 B —— vLLM 后端(高吞吐 / 兼容 OpenAI)

vLLM 提供更快的推理和多用户支持。如果多个开发者共享一台 Clore.ai 服务器,这非常理想。

选项 C —— TabbyML 后端(FIM 自动补全专家)

TabbyML 提供更出色的中间填充(FIM)自动补全——也就是行内幽灵文本建议。请参阅 TabbyML 文档 了解完整设置细节。

第 2 部分:安装 Continue.dev 扩展

VS Code:

  1. 打开扩展面板(Ctrl+Shift+X / Cmd+Shift+X)

  2. 搜索 "Continue" —— 安装 Continue(continuedev)提供的官方扩展

  3. 点击侧边栏中的 Continue 图标(或 Ctrl+Shift+I)

JetBrains(IntelliJ、PyCharm、WebStorm、GoLand):

  1. 文件 → 设置 → 插件 → Marketplace

  2. 搜索 "Continue" 然后安装

  3. 重启 IDE;Continue 面板会出现在右侧边栏

第 3 部分:配置 Continue.dev 使用 Clore.ai

编辑 ~/.continue/config.json 在你的 本地机器上:

对于 vLLM 后端 而不是 Ollama:

对于 TabbyML 后端 (仅自动补全):

配置

SSH 隧道设置(安全远程访问)

不要公开暴露端口,而是从你的本地机器使用 SSH 隧道:

使用 autossh 的持久隧道

为不同任务加载多个模型

对于 RTX 3090(24 GB),你可以同时运行一个大型聊天模型和一个小型自动补全模型:

代码库索引(为你的仓库做 RAG)

Continue.dev 可以为你的代码库建立索引,从而提供上下文感知建议。拉取一个嵌入模型:

GPU 加速

监控推理性能

不同 GPU 的预期性能

GPU
模型
上下文
每秒 token 数(约)

RTX 3060 12GB

CodeLlama 7B

8K

约 40–60 t/s

RTX 3060 12GB

DeepSeek-Coder 6.7B

8K

约 45–65 t/s

RTX 3090 24GB

Qwen2.5-Coder 32B(Q4)

16K

约 15–25 t/s

RTX 3090 24GB

DeepSeek-Coder 33B(Q4)

16K

约 15–22 t/s

RTX 4090 24GB

Qwen2.5-Coder 32B(Q4)

16K

约 25–40 t/s

A100 40GB

Qwen2.5-Coder 32B(FP16)

32K

约 35–50 t/s

A100 80GB

CodeLlama 70B(Q4)

32K

约 20–30 t/s

对于自动补全(中间填充), starcoder2:3bcodellama:7b 可达到 50–100 t/s —— 快到在 IDE 中几乎像是即时出现。

调优 Ollama 以获得更好性能

提示与最佳实践

针对不同任务使用不同模型

按任务类型为 Continue.dev 配置专门模型——界面允许你在对话过程中切换模型:

成本对比

解决方案
月度成本(每天使用 8 小时)
隐私
模型质量

GitHub Copilot

$19/用户/月

❌ 微软云

GPT-4o(闭源)

Cursor 专业版

$20/用户/月

❌ Cursor 云端

Claude 3.5(闭源)

Clore.ai 上的 RTX 3060

约 $24/月

✅ 你的服务器

CodeLlama 13B

Clore.ai 上的 RTX 3090

约 $48/月

✅ 你的服务器

Qwen2.5-Coder 32B

Clore.ai 上的 RTX 4090

约 $84/月

✅ 你的服务器

Qwen2.5-Coder 32B

Clore.ai 上的 A100 80GB

约 $264/月

✅ 你的服务器

CodeLlama 70B

对于 3 名或以上开发者共用一台 Clore.ai RTX 3090(总计约 $48/月)的小组来说,人均成本低于 Copilot,同时还能获得更大、私有的模型。

不编码时关闭

Clore.ai 按小时计费。使用一个简单脚本来启动/停止服务器:

使用 Continue.dev 自定义命令

将自定义斜杠命令添加到 config.json 以支持常见的编码工作流:

故障排查

问题
可能原因
解决方案

Continue.dev 显示“连接被拒绝”

无法连接到 Ollama

检查 SSH 隧道是否处于活动状态;验证 curl http://localhost:11434/ 正常工作

自动补全未触发

未设置 Tab 自动补全模型

tabAutocompleteModel 添加到 config.json;并在 Continue 设置中启用

响应非常慢(首个 token 超过 30 秒)

模型从磁盘加载

首次请求会将模型加载到 VRAM 中——后续请求就会很快

“未找到模型”错误

模型尚未拉取

运行 docker exec ollama ollama pull <model-name> 在 Clore.ai 服务器上

token 之间延迟很高

网络延迟或模型过大

使用 SSH 隧道;切换到更小的模型;检查服务器 GPU 利用率

代码库上下文不起作用

缺少 embeddings 模型

拉取 nomic-embed-text 通过 Ollama;检查 embeddingsProvider 在 config.json 中

SSH 隧道频繁断开

连接不稳定

使用 autossh 以实现持续重连;添加 ServerAliveInterval 30

超出上下文窗口

长文件/长对话

减少 contextLength 在 config.json 中;使用上下文更长的模型

JetBrains 插件未加载

IDE 版本不兼容

将 JetBrains IDE 更新到最新版本;检查 Continue.dev 插件兼容性矩阵

加载期间 vLLM 内存不足(OOM)

VRAM 不足

--gpu-memory-utilization 0.85;使用更小的模型或量化版本

调试命令

Continue.dev 配置验证

延伸阅读

最后更新于

这有帮助吗?