> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/learn-the-platform/zh/mo-kuai-9-jian-kong-yu-gu-zhang-pai-chu/01-dashboard-health.md).

# 仪表板与系统健康

## 监控理念

VergeOS 采用 **单一控制台** 基础设施监控方式。所有组件——计算、存储、网络以及硬件健康——都可通过内置 UI 直接查看，无需任何外部监控工具。系统在各个层级提供实时指标、历史趋势和事件日志：单个节点、集群、vSAN 分层、网络、VM 和租户。

本页介绍你每天用于评估系统健康状况和排查问题的主要监控界面。

```mermaid
graph TB
    subgraph ui["VergeOS UI — 监控层级"]
        direction TB
        MAIN["主仪表板<br/>全局概览"]
        CLUSTER["集群视图<br/>汇总资源池"]
        NODE["节点仪表板<br/>每节点硬件与指标"]
        VSAN["vSAN 状态<br/>分层健康与容量"]
        NET["网络状态<br/>连接性与流量"]
        VM["VM / 租户仪表板<br/>每工作负载指标"]

        MAIN --> CLUSTER
        MAIN --> VSAN
        MAIN --> NET
        CLUSTER --> NODE
        NODE --> VM
    end

    style ui fill:#f0f4ff,stroke:#336
```

## 节点仪表板

该 **节点仪表板** 是你用于监控环境中单个物理（或虚拟）服务器的主要界面。通过 **基础架构 → 节点**进入，然后选择特定节点。

### 节点状态信息

在节点仪表板顶部，你会看到以下关键状态字段：

| 字段            | 说明                                          |
| ------------- | ------------------------------------------- |
| **状态**        | 当前运行状态——运行中或离线；在维护工作流期间，可能显示为迁移中、维护模式或退出维护  |
| **维护模式**      | 节点是否处于维护状态（工作负载已迁移离开）                       |
| **上次开机时间**    | 最近一次启动的时间戳                                  |
| **IPMI 状态**   | 智能平台管理接口的状态                                 |
| **IPMI 网络地址** | 用于远程访问的 BMC/iDRAC/iLO 管理 IP                 |
| **系统版本**      | VergeOS 版本拆分——OS、vSAN、Appserver 和 Kernel 版本 |

### 硬件配置

仪表板还会显示物理硬件配置：

* **CPU** ——处理器型号和代次
* **CPU 核心数** ——物理核心数量
* **RAM** ——物理内存总容量
* **故障转移 RAM** ——为故障转移场景保留的内存
* **超额承诺 RAM** ——可用于超分配的内存
* **集群** ——此节点所属的集群
* **型号 / 资产标签** ——硬件平台和库存资产标签

### CPU 使用率图表

CPU 使用率图表是最常查看的指标之一。它提供实时和历史趋势可视化，并带有多个拆分类别：

| 指标         | 显示内容                   |
| ---------- | ---------------------- |
| **总 CPU**  | 所有核心的 CPU 总利用率         |
| **核心峰值**   | 利用率最高的单个核心（有助于识别单线程瓶颈） |
| **用户**     | 在用户空间进程中花费的时间          |
| **系统**     | 在内核空间操作中花费的时间          |
| **I/O 等待** | CPU 空闲等待 I/O 操作完成的时间   |
| **VM 使用量** | 此节点上运行的虚拟机所消耗的 CPU     |
| **IRQ**    | 处理硬件和软件中断所花费的时间        |

### 节点统计卡片

在 CPU 图表下方，仪表板会展示用于快速参考的指标卡片：

* **物理 RAM** ——当前内存利用率百分比和总容量
* **虚拟 RAM** ——已分配的虚拟内存（在未超额承诺时通常为 0%）
* **温度** ——当前节点温度，并带有颜色编码指示（根据阈值显示绿色/黄色/红色）
* **运行中的机器** ——此节点上活动 VM、vNet 容器和系统服务的数量
* **核心使用率** ——当前正在使用的 CPU 核心百分比
* **RAM 使用率** ——所有运行中机器的内存消耗

## 硬件资源面板

节点仪表板的下半部分提供每个物理硬件组件的详细视图。

### 磁盘

附加到节点的所有物理磁盘都会列出完整的健康数据：

| 列              | 用途                          |
| -------------- | --------------------------- |
| **状态**         | 在线 / 离线指示器                  |
| **名称**         | 设备标识符（例如， `nvme0n1`, `sda`) |
| **模型**         | 制造商和型号                      |
| **层**          | vSAN 存储分层分配（在安装时设置）         |
| **vSAN 磁盘 ID** | vSAN 内的唯一标识符                |
| **固件**         | 当前磁盘固件版本                    |
| **总线**         | 硬件总线连接类型（NVMe、SATA、SAS）     |
| **使用情况**       | 带有可视化进度条的容量利用率              |
| **修复中**        | 磁盘当前是否正在重建                  |
| **读/写错误**      | 用于主动健康监控的错误计数器              |

你可以点击任意磁盘访问其 **S.M.A.R.T.** 诊断——重映射扇区、温度、通电时长、磨损均衡以及其他预测性故障指标。

### 网络接口卡（NIC）

节点中的每张 NIC 都会显示运行状态和 fabric 状态：

* **状态** ——正常或异常
* **Fabric 状态** ——核心 fabric 连接。 **已确认** 表示 NIC 已正确集成； **无路径** 以及 **降级** 是需要关注的问题状态； **无** 表示不属于核心 fabric 的 NIC。地球图标表示连接到核心 fabric 的 NIC
* **端口** ——NIC 上的物理端口标识符
* **名称** ——接口标识符（例如， `enp2s0f0`)
* **型号 / 厂商 / 驱动** ——硬件和软件详细信息
* **速率** ——协商后的链路速度（例如，10000 Mb/s、25000 Mb/s）
* **MAC** ——硬件 MAC 地址
* **网络** ——关联的 VergeOS 网络
* **RX / TX** ——接收和发送的总数据量
* **RX / TX 速率** ——当前传输速率

### 其他硬件部分

| 部分                 | 显示内容                         |
| ------------------ | ---------------------------- |
| **内存模块**           | 已安装 RAM——模块数量、容量、类型和规格       |
| **LLDP 邻居**        | 链路层发现协议数据——已连接交换机、端口映射、网络拓扑  |
| **PCI 设备**         | 所有 PCI/PCIe 设备及其总线分配和直通可用性   |
| **SR-IOV NIC 设备**  | 支持 SR-IOV 的 NIC 的虚拟功能数量和分配状态 |
| **NVIDIA vGPU 设备** | GPU 型号、可用的 vGPU 配置文件和分配状态    |
| **USB 设备**         | 具有直通能力的已连接 USB 设备            |

## Fabric 状态监控

该 **core fabric** 是连接所有 VergeOS 节点的骨干网络。监控 fabric 健康至关重要，因为 fabric 降级会影响 vSAN 复制、VM 在线迁移以及节点间通信。

在每个节点的 NIC 表中，查找 **Fabric 状态** 列：

* **已确认** ——NIC 已正确集成到核心 fabric 中，并与对等节点通信
* **无路径** 或 **降级** ——表示 NIC 未成功参与 fabric 的问题状态。可能意味着电缆问题、交换机配置错误或 NIC 故障
* **无** ——显示给不属于核心 fabric 的 NIC（例如外部网络 NIC）

{% hint style="success" %}
**快速 fabric 健康检查**

从主仪表板导航到 **基础架构 → 节点** ，并扫描所有节点的 NIC fabric 状态。每个核心 fabric NIC 都应显示 **已确认**。任何 **无路径** 或 **降级** 状态都需要立即排查——检查物理布线、交换机端口配置和 NIC 驱动状态。
{% endhint %}

## 事件日志

每个节点仪表板都包含一个 **事件日志** 部分，用于显示该节点范围内的系统事件。事件按严重级别分类：

| 层级     | 说明             | 示例                  |
| ------ | -------------- | ------------------- |
| **严重** | 需要立即处理的威胁系统的情况 | 节点离线，vSAN 降级        |
| **错误** | 影响功能的故障        | 磁盘故障，操作失败           |
| **警告** | 若不处理，可能升级的情况   | 温度超过阈值，磁盘错误增加       |
| **消息** | 正常运行事件         | 电源状态变更、维护模式转换、VM 迁移 |

### 常见日志条目

* **温度警告** -- `“Core has reached warning temperature '96 / 95'”` 表示某个 CPU 核心超过了配置的阈值。这两个数字分别是当前读数和该 CPU 计算出的警告阈值。默认情况下（`max_core_temp = 0` 在 集群设置 → 节点温度 中），VergeOS 会查询每个 CPU 的硬件额定最高温度，并在 `max_core_temp_warn_perc` （默认 **10%**）低于该最大值时触发警告
* **磁盘状态事件** ——当磁盘离线、开始修复或报告新的读/写错误时的通知
* **电源状态变更** ——节点重启、关机和上电事件记录
* **维护模式转换** ——节点进入或退出维护模式时的日志

每条日志条目都包括 **时间戳**, **source** （例如， `node1`），以及一条 **详细消息**。点击 **查看更多** 以访问完整日志历史。

## 节点管理操作

节点仪表板左侧菜单提供关键管理操作：

### 电源控制

* **开机 / 关机** ——通过 IPMI 执行标准电源操作
* **重启** ——节点的平滑重启
* **强制断电** ——强制关机（仅在平滑方式失败时使用）

### 维护模式

**在进行硬件更改或系统更新之前，务必先启用维护模式。** 当你将节点置于维护模式时，VergeOS 会将符合条件的运行中工作负载在线迁移到集群中的其他节点。启用了 GPU 直通或主机直通 CPU 类型（也包括 USB 直通或 SR-IOV NIC）的 VM 无法迁移，必须关闭电源——手动，或者如果 VM 的迁移方式设置为自动，则可自动关闭。

### 远程控制台

通过 IPMI/iDRAC/iLO 提供对节点的直接控制台访问。当 VergeOS UI 无法访问或你需要 BIOS 级访问时，用于排障场景。

### 其他操作

* **编辑** ——修改节点设置（故障转移 RAM、超额承诺、标签）
* **扩容** ——从此节点向集群添加资源
* **诊断** ——访问节点级诊断工具（ARP 扫描、ethtool、IPMI 传感器、S.M.A.R.T. 测试等）
* **刷新** ——强制刷新所有仪表板数据

## 集群级视图

节点仪表板显示单个服务器健康状况， **集群视图** 则提供集群中所有节点的汇总资源利用率。

导航至 **系统 → 集群** 查看：

* **总 CPU** ——所有节点的合并处理能力和利用率
* **总 RAM** ——汇总内存及其利用率拆分
* **节点数量** ——集群中活动节点与总节点数
* **工作负载分布** ——VM 和服务在各节点间的分布情况

集群视图对于容量规划至关重要——它们帮助你识别集群何时接近资源限制，以及何时需要通过增加节点来横向扩展。

## vSAN 状态概览

vSAN 状态可通过主仪表板点击 **vSAN 层级** 计数框，或通过 **基础设施 → vSAN 分层**.

关键指标包括：

* **分层健康** ——通过 `状态` 字段（`online`, `noredundant`, `repairing`, `outofspace`, `offline`，...）和 `redundant` 布尔值显示每层状态。 `working` 标志表示当前是否正在执行 Journal Walk，而不是整体分层健康状况（健康且空闲的分层显示 `working=false`)
* **每层容量** ——每一层的总存储、已用和可用存储
* **冗余状态** ——是否满足数据冗余要求（在磁盘或节点故障后尤为关键）
* **修复状态** ——当前修复操作及其进度（正常运行期间应全部为零）
* **设备数量** ——每一层参与的磁盘数量

{% hint style="warning" %}
**存储限流阈值**

随着存储空间逐渐填满，VergeOS 会自动应用 I/O 限流：

* **低于 91%** ——正常运行，无限流
* **91–95%** ——开始低空间限流（增加 10ms 延迟）
* **96%+** ——严重限流（增加 50ms 延迟），性能显著下降

主动监控分层容量，并在达到这些阈值之前配置告警。
{% endhint %}

## 网络状态

网络健康状况从 **网络** 在主导航中进行监控。对于每个网络（外部、内部、DMZ、租户网络），你可以查看：

* **连接状态** ——网络是否正在运行且可达
* **流量统计** ——每个网络的 RX/TX 流量和速率
* **已连接机器** ——连接了哪些 VM 和服务
* **防火墙规则命中次数** ——已配置防火墙规则上的活动
* **特定网络日志** ——该特定网络范围内的事件

## 运行中的机器视图

每个节点仪表板都包含一个 **运行中的机器** 部分，用于显示所有活动工作负载：

| 列           | 说明               |
| ----------- | ---------------- |
| **状态**      | 运行状态指示器          |
| **类型**      | 虚拟机、vNet 容器或系统服务 |
| **名称**      | 机器标识符            |
| **CPU 核心数** | 分配的核心数           |
| **CPU 使用率** | 当前处理器利用率百分比      |
| **RAM**     | 已分配内存及其利用率百分比    |
| **上次启动时间**  | 工作负载启动时间戳        |

常见机器类型包括 VM、vNet 容器（网络服务）和系统服务（NAS、DMZ、外部网络等）。

{% hint style="info" %}
**来自 VMware 或 Nutanix？**

在 VergeOS 中，节点硬件、集群资源、存储健康、网络状态和工作负载指标都位于同一个内置 UI 中——无需安装单独的管理服务器、监控套件或 CLI 即可获得日常可见性。
{% endhint %}

## 最佳实践

### 每日健康检查

检查所有节点的节点温度、磁盘错误计数器和 fabric 状态。对任何显示 **无路径** 或 **降级**，或磁盘错误增加的 fabric NIC 立即处理。

### 使用维护模式

在进行硬件更改、固件更新或系统更新之前，始终启用维护模式。符合条件的工作负载会先在线迁移离开，然后你再操作节点；无法在线迁移的 VM（GPU 直通、主机直通 CPU 类型、USB 直通、SR-IOV）必须关闭电源。

### 监控 vSAN 容量

将分层利用率保持在 85% 以下，以维持性能余量。配置订阅告警（下一节会介绍），以便在达到限流阈值之前通知你。

### 定期查看日志

定期检查事件日志中的温度警告、磁盘错误和意外状态变化。尽早发现问题可防止级联故障。


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/learn-the-platform/zh/mo-kuai-9-jian-kong-yu-gu-zhang-pai-chu/01-dashboard-health.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
