Ling-2.5-1T(1 万亿参数)
在 Clore.ai GPU 上运行 Ling-2.5-1T——蚂蚁集团的 1 万亿参数开源 LLM,采用混合线性注意力
蚂蚁集团的 Ling-2.5-1T(于 2026 年 2 月 16 日发布)是有史以来发布的最大开源语言模型之一—— 总参数量 1 万亿,激活参数 630 亿。它引入了一种混合线性注意力架构,使其能够在最长 100 万 token 的上下文长度上高效推理。与此同时,蚂蚁集团发布了 Ring-2.5-1T,这是世界上首个混合线性架构的思考模型。二者共同代表了开源 AI 的新前沿——在推理和智能体基准上可与 GPT-5.2、DeepSeek V3.2 和 Kimi K2.5 竞争。
HuggingFace: inclusionAI/Ling-2.5-1T 配套模型: inclusionAI/Ring-2.5-1T (思考/推理变体) 许可证: 开源(蚂蚁集团 InclusionAI 许可证)
主要特性
总参数 1 万亿,激活 630 亿 —— 规模巨大,且采用高效的 MoE 风格激活
混合线性注意力 —— 将 MLA(多头线性注意力)与 Lightning Linear Attention 结合,在长序列上实现卓越吞吐
100 万 token 上下文窗口 —— 通过从原生 256K 扩展到 YaRN,可处理整个代码库和书籍长度文档
前沿推理 —— 在使用约 4 倍更少输出 token 的同时,性能接近思考模型
Agentic 能力 —— 采用 Agentic RL 训练,兼容 Claude Code、OpenCode 和 OpenClaw
Ring-2.5-1T 配套模型 —— 专用推理变体达到 IMO 2025 和 CMO 2025 金牌水平
架构详情
总参数量
1 万亿(1,000B)
激活参数量
630 亿
架构
混合线性注意力(MLA + Lightning Linear)
预训练数据
29 万亿 token
原生上下文
256K token
扩展上下文
100 万 token(YaRN)
发布日期
2026 年 2 月 16 日
要求
Clore.ai 市场中未列出多 GPU 的 80GB 级机器。 目前列出的最大机器是 4× RTX PRO 6000 Blackwell(每张 96GB,总计 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量以 裸金属 形式按需提供。请在配置部署前查看 GPU 价格与可用性 。
以全精度运行 Ling-2.5-1T 需要大量资源。量化版本让它更易获取。
GPU
8× RTX 4090
8× H100 80GB
16× H100 80GB
显存
8×24GB(192GB)
8×80GB(640GB)
16×80GB(1.28TB)
内存
256GB
512GB
1TB
磁盘
600GB
1.2TB
2TB+
CUDA
12.8+
12.8+
12.8+
推荐的 Clore.ai 配置:
量化版(Q4): 8× RTX 4090($1.12–3.36/小时)—— 适合实验和中等负载
生产环境(FP8): 8× H100(约 $8.32/小时)—— 完整质量,吞吐量良好
注意: 这是一个极其庞大的模型。对于预算有限的用户,可考虑在 HuggingFace.
使用 vLLM 快速开始
vLLM 是 Ling-2.5-1T 推荐的服务框架:
使用 llama.cpp 快速开始(量化版)
对于消费级 GPU 环境,可使用 GGUF 量化版:
使用示例
1. 通过 OpenAI API 进行聊天补全
一旦 vLLM 或 llama-server 运行起来:
2. 长上下文文档分析
Ling-2.5-1T 的混合线性注意力使其在长文档上极其高效:
3. 智能体工具使用
Ling-2.5-1T 采用 Agentic RL 进行工具调用训练:
Ling-2.5-1T 与 Ring-2.5-1T 对比
类型
即时(快速)模型
思考(推理)模型
架构
混合线性注意力
混合线性注意力
最适合
日常聊天、编程、智能体任务
数学、形式推理、复杂问题
输出风格
直接回答
思维链推理
Token 效率
高(输出 token 更少)
推理会使用更多 token
IMO 2025
有竞争力
金牌水平
给 Clore.ai 用户的建议
这个模型需要相当强大的硬件 —— 在 1 万亿参数规模下,即便 Q4 量化也需要约 500GB 存储和 192GB 以上显存。下载前请确保你的 Clore.ai 实例有足够的磁盘空间和多 GPU 配置。
先从
--max-model-len 8192—— 首次测试时,请使用较短上下文以验证模型能正确加载并运行。一切正常后再逐步增加上下文长度。使用持久存储 —— 该模型大小为 1–2TB。请在 Clore.ai 上挂载一个大型持久卷,以避免重复下载。只需使用一次
huggingface-cli download.对于推理任务,可考虑 Ring-2.5-1T —— 如果你的使用场景主要是数学、逻辑或形式推理,那么配套的 Ring-2.5-1T 模型专门针对思维链推理进行了优化。
监控 GPU 内存 —— 在 8 GPU 配置下,使用
nvidia-smi -l 1以监控内存使用情况,并观察长上下文生成时是否发生 OOM。
故障排查
CUDA 内存不足
减少 --max-model-len;确保 --tensor-parallel-size 与 GPU 数量匹配;尝试 --gpu-memory-utilization 0.95
生成非常慢
线性注意力需要预热;最初几次请求可能会很慢。还要检查 GPU 之间是否有 NVLink
模型下载失败
BF16 版本约为 2TB。确保磁盘空间足够。使用 --resume-download 标志与 huggingface-cli
vLLM 不支持该架构
请确保你使用的是 vLLM ≥0.7.0,并配合 --trust-remote-code;自定义注意力层需要此标志
GGUF 不可用
查看 unsloth 或社区量化版本;该模型可能需要一些时间才会有社区量化
回复质量差
对于事实类任务,请使用 temperature ≤0.1;添加系统提示;确保没有截断上下文
延伸阅读
官方公告(BusinessWire) —— 发布详情和基准测试
HuggingFace —— Ling-2.5-1T —— 模型权重和文档
HuggingFace —— Ring-2.5-1T —— 思考模型配套版
ModelScope 镜像 —— 亚洲地区更快下载
vLLM 文档 —— 服务框架
最后更新于
这有帮助吗?