在 CLORE.AI GPU 上运行大型语言模型 (LLM) 以用于推理和聊天应用。
Ollama
最简单的 LLM 设置
入门
打开 WebUI
类似 ChatGPT 的界面
vLLM
高吞吐量生产服务
中等
Llama.cpp 服务器
高效 GGUF 推理
简单
文本生成 WebUI
功能齐全的聊天界面
ExLlamaV2
最快的 EXL2 推理
LocalAI
兼容 OpenAI 的 API
SGLang
快速结构化生成
文本生成推理 (TGI)
HuggingFace 服务解决方案
LMDeploy
MMlab 服务工具包
Aphrodite 引擎
带有额外功能的 vLLM 分支
MLC-LLM
机器学习编译
困难
LiteLLM
统一 API 代理
PowerInfer
稀疏模型推理
Mistral.rs
基于 Rust 的推理引擎
DeepSeek-V3
671B MoE
推理、代码、数学
DeepSeek-R1
高级推理
DeepSeek V4
待定
下一代 DeepSeek
Qwen2.5
0.5B-72B
多语言、代码
Qwen3.5
最新的 Qwen 版本
Llama 3.3
70B
Meta 最新的 70B
Llama 4
Scout 与 Maverick 变体
DeepSeek Coder
6.7B-33B
代码生成
CodeLlama
7B-34B
代码补全
GLM-4.7-Flash
4.7B
快速的中英文
GLM-5
智谱 AI 最新
Kimi K2.5
Moonshot AI 模型
Ling-2.5-1T
1T
大规模开源 LLM
LFM2-24B
24B
Liquid AI 模型
MiMo-V2-Flash
快速推理模型
Gemma 2
2B-27B
高效推理
Gemma 3
Google 最新的紧凑型
Phi-4
14B
小巧但强大
Mistral/Mixtral
7B / 8x7B
通用用途
Mistral Large 3
675B MoE
企业级
Mistral Small 3.1
高效的 Mistral 变体
7B (Q4)
RTX 3060 12GB
RTX 3090
13B (Q4)
RTX 3090 24GB
RTX 4090
34B (Q4)
2x RTX 3090
A100 40GB
70B (Q4)
A100 80GB
2x A100
Q2_K
最低
较差
最快
Q4_K_M
低
良好
快
Q5_K_M
很好
Q8_0
高
优秀
较慢
FP16
最高
最佳
最慢
训练与微调
视觉-语言模型
最后更新于 5个月前
这有帮助吗?