Continue.dev AI 编程
用 Clore.ai GPU 为 Continue.dev 提供算力——在便宜的 GPU 租赁上本地运行 CodeLlama 34B、DeepSeek Coder 和 Qwen2.5-Coder,用于私有 AI 编程辅助。
Continue.dev 是一款面向 VS Code 和 JetBrains 的开源 AI 编码助手,拥有 2.5 万+ GitHub stars。该 扩展运行在你的本地机器上 (或在你的 IDE 中),但它会连接到一个用于推理的后端模型服务器。将 Continue.dev 指向从 Clore.ai 租用的强大 GPU 后,你将获得:
顶级编码模型 (34B+ 参数),你的笔记本电脑无法承载
完全隐私 —— 代码保留在你可控的基础设施上
灵活成本 —— 只在你编码时付费(约 $0.20–0.50/小时,而 Copilot 为 $19/月)
兼容 OpenAI 的 API —— Continue.dev 可无缝连接到 Ollama、vLLM 或 TabbyML
本指南重点介绍如何设置 Clore.ai GPU 后端 (Ollama 或 vLLM),你的本地 Continue.dev 扩展会连接到它。
所有 GPU 服务器示例都使用通过 CLORE.AI 市场.
概览
许可证
Apache 2.0
GitHub 星标
25K+
IDE 支持
VS Code、JetBrains(IntelliJ、PyCharm、WebStorm、GoLand 等)
配置文件
~/.continue/config.json
后端选项
Ollama、vLLM、TabbyML、LM Studio、llama.cpp、兼容 OpenAI 的 API
难度
简单(安装扩展)/ 中等(自托管后端)
需要 GPU?
在 Clore.ai 服务器上(是);在你的笔记本电脑上(否)
主要特性
自动补全、聊天、编辑模式、代码库上下文(RAG)、自定义斜杠命令
推荐的编码模型
codellama:7b
~6 GB
快速自动补全
不错的起点
codellama:13b
约 10 GB
均衡
自动补全的最佳质量/速度平衡
codellama:34b
~22 GB
最佳 CodeLlama 质量
需要 RTX 3090 / A100
deepseek-coder:6.7b
~5 GB
Python/JS 专家
非常适合 Web 开发
deepseek-coder:33b
~22 GB
顶级开源模型
在代码方面可与 GPT-4 匹敌
qwen2.5-coder:7b
~6 GB
多语言代码
在 40+ 种语言上表现强劲
qwen2.5-coder:32b
~22 GB
最先进
2024 年最佳开源编码模型
starcoder2:15b
~12 GB
代码补全专家
支持 FIM(中间填充)
需求
Clore.ai 服务器要求
预算
RTX 3060
12 GB
16 GB
40 GB
$0.03–0.07/小时
CodeLlama 7B、DeepSeek 6.7B、Qwen2.5-Coder 7B
推荐
RTX 3090
24 GB
32 GB
80 GB
$0.07–0.21/小时
CodeLlama 34B、DeepSeek 33B、Qwen2.5-Coder 32B
性能
RTX 4090
24 GB
32 GB
80 GB
$0.14–0.42/小时
与上面相同的模型,更快的推理
本地要求(你的机器)
VS Code 或任意 JetBrains IDE
已安装 Continue.dev 扩展
到你的 Clore.ai 服务器的稳定互联网连接
无需本地 GPU —— 所有推理都发生在 Clore.ai 上
快速开始
第 1 部分:设置 Clore.ai 后端
选项 A —— Ollama 后端(适合大多数用户)
Ollama 是 Continue.dev 最容易上手的后端——设置简单、模型管理优秀、兼容 OpenAI 的 API。
要将 Ollama 暴露到外部(这样你的本地 IDE 才能连接):
默认公开暴露 11434 端口没有认证。生产环境请改为设置 SSH 隧道(见 提示与最佳实践).
选项 B —— vLLM 后端(高吞吐 / 兼容 OpenAI)
vLLM 提供更快的推理和多用户支持。如果多个开发者共享一台 Clore.ai 服务器,这非常理想。
选项 C —— TabbyML 后端(FIM 自动补全专家)
TabbyML 提供更出色的中间填充(FIM)自动补全——也就是行内幽灵文本建议。请参阅 TabbyML 文档 了解完整设置细节。
第 2 部分:安装 Continue.dev 扩展
VS Code:
打开扩展面板(
Ctrl+Shift+X/Cmd+Shift+X)搜索 "Continue" —— 安装 Continue(continuedev)提供的官方扩展
点击侧边栏中的 Continue 图标(或
Ctrl+Shift+I)
JetBrains(IntelliJ、PyCharm、WebStorm、GoLand):
文件 → 设置 → 插件 → Marketplace搜索 "Continue" 然后安装
重启 IDE;Continue 面板会出现在右侧边栏
第 3 部分:配置 Continue.dev 使用 Clore.ai
编辑 ~/.continue/config.json 在你的 本地机器上:
对于 vLLM 后端 而不是 Ollama:
对于 TabbyML 后端 (仅自动补全):
配置
SSH 隧道设置(安全远程访问)
不要公开暴露端口,而是从你的本地机器使用 SSH 隧道:
使用 autossh 的持久隧道
为不同任务加载多个模型
对于 RTX 3090(24 GB),你可以同时运行一个大型聊天模型和一个小型自动补全模型:
代码库索引(为你的仓库做 RAG)
Continue.dev 可以为你的代码库建立索引,从而提供上下文感知建议。拉取一个嵌入模型:
GPU 加速
监控推理性能
不同 GPU 的预期性能
RTX 3060 12GB
CodeLlama 7B
8K
约 40–60 t/s
RTX 3060 12GB
DeepSeek-Coder 6.7B
8K
约 45–65 t/s
RTX 3090 24GB
Qwen2.5-Coder 32B(Q4)
16K
约 15–25 t/s
RTX 3090 24GB
DeepSeek-Coder 33B(Q4)
16K
约 15–22 t/s
RTX 4090 24GB
Qwen2.5-Coder 32B(Q4)
16K
约 25–40 t/s
A100 40GB
Qwen2.5-Coder 32B(FP16)
32K
约 35–50 t/s
A100 80GB
CodeLlama 70B(Q4)
32K
约 20–30 t/s
对于自动补全(中间填充), starcoder2:3b 或 codellama:7b 可达到 50–100 t/s —— 快到在 IDE 中几乎像是即时出现。
调优 Ollama 以获得更好性能
提示与最佳实践
针对不同任务使用不同模型
按任务类型为 Continue.dev 配置专门模型——界面允许你在对话过程中切换模型:
成本对比
GitHub Copilot
$19/用户/月
❌ 微软云
GPT-4o(闭源)
Cursor 专业版
$20/用户/月
❌ Cursor 云端
Claude 3.5(闭源)
Clore.ai 上的 RTX 3060
约 $24/月
✅ 你的服务器
CodeLlama 13B
Clore.ai 上的 RTX 3090
约 $48/月
✅ 你的服务器
Qwen2.5-Coder 32B
Clore.ai 上的 RTX 4090
约 $84/月
✅ 你的服务器
Qwen2.5-Coder 32B
Clore.ai 上的 A100 80GB
约 $264/月
✅ 你的服务器
CodeLlama 70B
对于 3 名或以上开发者共用一台 Clore.ai RTX 3090(总计约 $48/月)的小组来说,人均成本低于 Copilot,同时还能获得更大、私有的模型。
不编码时关闭
Clore.ai 按小时计费。使用一个简单脚本来启动/停止服务器:
使用 Continue.dev 自定义命令
将自定义斜杠命令添加到 config.json 以支持常见的编码工作流:
故障排查
Continue.dev 显示“连接被拒绝”
无法连接到 Ollama
检查 SSH 隧道是否处于活动状态;验证 curl http://localhost:11434/ 正常工作
自动补全未触发
未设置 Tab 自动补全模型
在 tabAutocompleteModel 添加到 config.json;并在 Continue 设置中启用
响应非常慢(首个 token 超过 30 秒)
模型从磁盘加载
首次请求会将模型加载到 VRAM 中——后续请求就会很快
“未找到模型”错误
模型尚未拉取
运行 docker exec ollama ollama pull <model-name> 在 Clore.ai 服务器上
token 之间延迟很高
网络延迟或模型过大
使用 SSH 隧道;切换到更小的模型;检查服务器 GPU 利用率
代码库上下文不起作用
缺少 embeddings 模型
拉取 nomic-embed-text 通过 Ollama;检查 embeddingsProvider 在 config.json 中
SSH 隧道频繁断开
连接不稳定
使用 autossh 以实现持续重连;添加 ServerAliveInterval 30
超出上下文窗口
长文件/长对话
减少 contextLength 在 config.json 中;使用上下文更长的模型
JetBrains 插件未加载
IDE 版本不兼容
将 JetBrains IDE 更新到最新版本;检查 Continue.dev 插件兼容性矩阵
加载期间 vLLM 内存不足(OOM)
VRAM 不足
在 --gpu-memory-utilization 0.85;使用更小的模型或量化版本
调试命令
Continue.dev 配置验证
延伸阅读
Continue.dev 文档 — 所有 IDE 集成和配置选项的官方文档
Continue.dev GitHub — 源代码、问题、模型兼容性
Continue.dev 配置参考 — 完整
config.json架构Clore.ai 上的 Ollama — 详细的 Ollama 设置指南(推荐后端)
Clore.ai 上的 vLLM — 面向团队的高性能替代后端
TabbyML — 具有 FIM 优化的专用自动补全后端
GPU 比较指南 — 为你的编码工作负载选择合适的 GPU
模型兼容性 — 哪些模型适合哪些 VRAM 容量
Qwen2.5-Coder — 目前最好的开源编码模型
DeepSeek-Coder-V2 — 具有长上下文能力的强力替代方案
CLORE.AI 市场 — 租用 GPU 服务器
最后更新于
这有帮助吗?