Ollama
在 Clore.ai 的 GPU 上使用 Ollama 本地运行 LLM
服务器要求
参数
最低
推荐
为什么选择 Ollama?
在 CLORE.AI 上快速部署
验证是否正常工作
访问你的服务
安装
使用 Docker(推荐)
手动安装
运行模型
拉取并运行
热门模型
模型
大小
使用场景
模型变体
v0.6+ 新增内容
结构化输出(JSON Schema)
兼容 OpenAI 的 Embeddings 端点(/api/embed)
并发模型加载
API 使用
聊天完成
兼容 OpenAI 的端点
流式输出
Embeddings
文本生成(非聊天)
完整 API 参考
模型管理
端点
方法
描述
列出模型
显示模型详情
通过 API 拉取模型
删除模型
列出正在运行的模型
获取版本
推理端点
端点
方法
描述
自定义模型创建
GPU 配置
检查 GPU 使用情况
多 GPU
内存管理
自定义模型(Modelfile)
作为服务运行
Systemd
性能提示
基准测试
生成速度(tokens/秒)
模型
RTX 3060
RTX 3090
RTX 4090
A100 40GB
首个 token 时间(毫秒)
模型
RTX 3090
RTX 4090
A100
上下文长度 vs VRAM(Q4)
模型
2K 上下文
4K 上下文
8K 上下文
16K 上下文
GPU 要求
模型
Q4 VRAM
Q8 VRAM
成本估算
GPU
VRAM
价格/天
适合用途
故障排查
模型无法加载
生成缓慢
连接被拒绝
http_pub URL 上出现 HTTP 502
下一步
最后更新于
这有帮助吗?