> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/clore.ai/clore.ai-eng-zh/mian-xiang-zhu-ji-ti-gong-zhe/advanced/bare-metal.md).

# 裸金属

## Clore 裸金属 — 要求与指南

**Clore 裸金属** 是物理（非虚拟化）服务器，拥有完整 root 访问权限，不共享资源，也没有功率限制。适用于 AI/ML、HPC、3D 渲染以及任何重负载工作。

**可用 GPU（示例）：** B200、H100、H200、A100、L40S、RTX 5090、RTX 4090 等。\
**位置（起始）：** 美国、日本、香港等\
**SLA：** 三级及以上数据中心，目标可用性 **99.99%**.

***

### 1) 什么是 Clore 上的裸金属

* 你获得一整台物理机器（CPU、RAM、磁盘、网络、GPU）。
* 完整的 root 访问/SSH，以及在可用时可使用 IPMI/KVM 进行重装系统。
* 没有 PL 限制/隔离层——性能与硬件一致。
* 与基于容器的租用（HiveOS/Docker）不同，资源不会共享。

***

### 2) 基础设施强制要求（针对提供商）

**2.1 数据中心**

* 最低 **第 3 层** （Uptime Institute 或公认的本地等效认证）。
* 文件：数据中心证明信/证书，冗余说明（电力 N+1/2N、冷却、网络）。
* **SLA 99.99%** 并配备 24/7 NOC。
* 符合消防安全标准；具备应急程序（RPO/RTO）。
* **仅限法人实体。** 不接受家庭/办公室“机房”。

**2.2 硬件基础（最低要求）**

* **CPU：** 从 64 线程起。
* **RAM：** 从 128 GB 起（多 GPU/HPC 建议 256 GB+）。
* **存储：** NVMe SSD ≥ 1 TB，吞吐量 ≥ 1 GB/s（系统和数据建议使用 RAID1/10）。
* **网络：** ≥ 1 Gbps 对称（更推荐 10 Gbps，L2/L3 冗余，静态 IPv4；IPv6 为加分项）。
* **GPU（档位）：** L40S / H200 及以上，或能够承受重负载的同等配置：\
  B200、H100、H200、A100、L40S、RTX 4090/5090（**优先选择服务器 A 系列和数据中心卡**).

**2.3 高性能互连（推荐）**

* **InfiniBand** （EDR/HDR/NDR）用于分布式训练/HPC。
* **NVLink/NVSwitch** —— 在单节点多 GPU 场景中很理想。

#### 2.4 可靠性与替换

* 如发生硬件故障—— **一对一** 更换（完全相同或严格等效的配置），且不降低 SLA。
* 必须备有备件库存 / “热备”件。

#### 2.5 安全与数据卫生

* 租用之间的磁盘清理： **blkdiscard/安全擦除/单次写零/TRIM** （记录日志）。
* IPMI 隔离，关闭 **管理** 边界，ACL/DDoS 配置。
* 操作系统镜像——经过审核，包含最新微码/补丁，并支持 **NVIDIA** 驱动。

***

### 3) 最低商业条款

* **最短租期：** 从 **2 周**.
* **定价：** 按地理位置制定具有竞争力的价目表（考虑流量/电力/VAT 成本）。
* **API 集成** 对于自动开通、续租和监控是强制/期望的（取决于业务量）。

***

### 4) 软件与镜像要求

* **操作系统：** Ubuntu 22.04/24.04 LTS、Rocky/RHEL 9；按需可提供 Windows Server（含许可）。
* **GPU 软件栈：** NVIDIA 550.xx+（或针对特定 GPU 推荐的版本），CUDA 12.2/12.4+。
* **管理：** SSH（必需），IPMI/KVM（推荐），并为租户提供临时账号。
* **容器化：** 按需提供 Docker/Podman；Kubernetes——若 master 部署在同一数据中心，则允许。

***

### 5) 提供商如何接入裸金属

1. **申请与验证：**
   * 法人实体、与三级及以上数据中心的正式合同、SLA 99.99%、24/7 NOC。
   * 文件包：三级/等效证书、SLA、消防安全、冗余方案。
   * 验收测试：公网 IPv4、IPMI（KVM）截图/访问、iPerf3/磁盘性能结果。
2. **SKU 目录与定价：**
   * 标准化卡片（GPU 组成、CPU 线程、RAM、NVMe、网络、IB/NVLink、数据中心/位置、流量限制）。
   * 价格与地理位置挂钩。最短期限——2 周。
3. **运营政策：**
   * 事件响应时间：≤ 15 分钟；硬件更换：立即提供等效件。
   * 磁盘清理记录、归还后关闭管理员访问、审计。
   * 每月可用性/事件报告。

### 6) 网络与吞吐量要求

* 最低 **1 Gbps** （对称），更推荐 **10 Gbps** 并具备冗余。
* 公网 IPv4，按需支持 rDNS；IPv6 为佳。
* 基础 ACL、反 DDoS 配置、独立 **管理 VLAN** 用于 IPMI。
* 对于 **InfiniBand** —— 在机架/房间内直接进行 L2 分段，并提供 OFED。

***

### 7) 示例工作负载

* **多 GPU LLM 训练：** 8×L40S/NVLink 或 A100/H100/H200 节点的 IB 集群。
* **视频渲染：** 4×RTX 4090/5090，配合本地 NVMe 缓存和 **10 Gbps** 出站流量。
* **HFT/交易：** 低延迟，CPU **64–128** 线程，RAM **256–512 GB**，NVMe **RAID1** 且 **10 Gbps** 网络。
* **基因组学/HPC：** A100/H100 配合 IB **HDR/NDR**, **SLURM** / MPI 支持。

***

## 标准租用与裸金属的比较

| 参数                  | 标准租用（HiveOS/Docker）   | 裸金属                              |
| ------------------- | --------------------- | -------------------------------- |
| 是什么                 | 宿主操作系统内的容器/环境         | 整台物理服务器                          |
| 资源（CPU/RAM/带宽）      | 由调度器共享；cgroup 配额，可能限流 | 独占；可预测的 CPU/RAM/带宽               |
| Root/权限             | 容器内的 root，无 BIOS 访问权限 | 完整服务器 root；BIOS/UEFI 访问          |
| GPU 驱动（CUDA/NVIDIA） | 由宿主机版本决定              | 你自行安装所需版本（CUDA/OFED 等）           |
| GPU 控制              | 带限制的直通（按宿主策略限制 PL/OC） | 完全的 PL/OC 控制；NVLink/NVSwitch（如有） |
| IPMI/KVM/虚拟介质       | 否                     | 是（远程控制台、ISO 挂载）                  |
| 存储                  | 宿主卷/挂载；带宽可能波动         | 直接 NVMe/RAID；稳定的 IOPS/吞吐量        |
| 网络                  | 端口/NAT/共享带宽           | 专用 NIC 1–10G+；rDNS、VLAN；公网 IPv4  |
| 可靠性 / SLA           | 取决于宿主；不保证同等替换         | 三级及以上数据中心，目标 SLA 99.99%，必须同等替换   |
| 最短期限                | 通常为数小时/数天             | 从 2 周起                           |
| 成本                  | 更低                    | 更高（独占 + 数据中心）                    |
| 启动时间                | 数秒至数分钟                | 从 1 小时到 48 小时可启动                 |
| HPC / InfiniBand    | 通常没有                  | 推荐（InfiniBand）、NVLink/NVSwitch   |
| 最适合                 | 快速任务、测试、挖矿、短会话        | AI/ML/HPC、生产工作负载、长期项目            |
| 提供商要求               | 基础                    | 法人实体、三级及以上数据中心、24/7 NOC、区域定价、API |
| 安全 / 数据             | 在宿主策略范围内              | 租用之间的磁盘清理、隔离的管理通道（IPMI）          |

## 常见问题

**裸金属与容器租用有何不同？**\
裸金属是 **完全属于你的物理机器** （CPU/RAM/磁盘/网络/GPU）。在容器租用中，资源是共享的，你在隔离环境中工作。

**IPMI 是必需的吗？**\
推荐。它能加快操作系统重装，并提供 KVM 访问，尤其是在网络/SSH 出现问题时。

**节点可以通过 IB 互联吗？**\
可以，建议在分布式训练/HPC 中使用 InfiniBand。在 SKU 中注明 IB 带宽/类型。

**GPU 的最低要求是什么？**\
L40S / H200 级别及以上，或能够承受重负载的同等配置（B200、H100、A100 等）。

**如果服务器“宕机”怎么办？**\
提供商必须及时提供 **完全相同的替换件** 且不降级（SLA 99.99%）。


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/clore.ai/clore.ai-eng-zh/mian-xiang-zhu-ji-ti-gong-zhe/advanced/bare-metal.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
