For the complete documentation index, see llms.txt. This page is also available as Markdown.

节点概述

VergeOS 节点管理概述,包括节点状态、硬件配置、资源指标、驱动器、NIC、Fabric 状态、运行中的机器和管理操作。

VergeOS 中的节点表示一台物理或虚拟服务器,它为您的环境提供计算、存储和网络资源。节点仪表板为系统中的每个节点提供全面的监控和管理功能。

关键组件

节点状态信息

  • 状态:显示当前运行状态(运行/离线)

  • 运行中:表示该节点正在正常运行

  • 维护模式:表示该节点处于维护状态

  • 最后开机时间:节点上次启动的时间戳

  • 本地时间:节点上的当前时间

  • IPMI 状态:显示智能平台管理接口的状态

  • IPMI 网络地址:用于远程管理访问的网络地址

  • 系统版本:显示当前 VergeOS 版本(OS 版本、vSAN 版本、Appserver 版本、内核版本)

硬件配置

  • CPU:处理器型号和代际

  • CPU 核心数:物理处理器核心数量

  • RAM:物理内存总容量

  • 故障切换 RAM:为故障切换场景预留的内存

  • 超配 RAM:可用于超额分配的内存

  • 集群:该节点所属的集群

  • PXE 网络:用于 PXE 启动操作的网络

  • 型号:硬件平台信息

  • 系列:产品系列名称

资产标签和功能

  • 物理:表示物理硬件资产

  • 采集系统日志:系统日志记录状态

  • LLDP:链路层发现协议状态

  • iOMMU(VT-d)支持:硬件虚拟化支持

  • 需要重启:表示是否需要重启

  • 需要重新加载驱动:表示驱动更新是否需要重新加载

资源指标

仪表板通过以下方式提供实时和历史监控:

  • CPU 使用率图表:显示当前、平均和最大 CPU 利用率,并提供历史趋势可视化

    • 总 CPU

    • 核心峰值

    • 使用情况(用户、系统、IO 等待、VM 使用、IRQ)

节点统计

仪表板按类别组织,提供关键指标:

  • 物理 RAM:当前内存利用率百分比和容量

  • 虚拟 RAM:已分配的虚拟内存(未超配时通常为 0%)

  • 温度:节点当前温度,并带有可视化指示器(根据阈值显示绿/黄/红)

  • 正在运行的计算机:节点上活动工作负载的数量

  • 核心使用率:正在使用的 CPU 核心百分比

  • RAM 使用率:运行中机器的内存消耗

硬件资源

驱动器

显示连接到该节点的所有物理驱动器:

  • 状态:在线/离线指示器

  • 名称:驱动器标识符(例如 nvme0n1、nvme1n1)

  • 型号:制造商和型号

  • 层级:vSAN 存储层分配

  • vSAN 驱动器 ID:vSAN 内的唯一标识符

  • 固件:驱动器固件版本

  • 总线:硬件总线连接

  • 使用情况:容量利用率,并带有可视化指示器

  • 正在修复:驱动器重建状态

  • 读/写错误:用于驱动器健康监控的错误计数器

网络接口卡(NIC)

全面的 NIC 信息和状态:

  • 状态:运行状态(正常/关闭)

  • Fabric 状态:核心 Fabric 连接状态(已确认/未确认),并带有可视化指示器

    • 地球图标表示连接到核心 Fabric 的 NIC

    • “已确认”状态表示 NIC 已正确集成到网络 Fabric 中

  • 名称:接口标识符(例如 enp2s0f0、enp8s0)

  • 型号:网络适配器型号

  • 供应商:网络适配器制造商

  • 驱动程序:正在使用的网络驱动程序

  • 端口:物理端口号

  • 速度:链路速度(例如 10000Mb/s、2500Mb/s)

  • MAC:硬件 MAC 地址

  • 网络:关联的 VergeOS 网络

  • RX/TX:接收和发送的数据量

  • RX/TX 速率:当前传输速率

  • 动作:NIC 操作的快捷访问图标(控制台、图表、配置)

内存模块

显示已安装的 RAM 配置:

  • 模块数量和容量

  • 内存类型和规格

LLDP 邻居

显示已连接网络设备的链路层发现协议信息:

  • 已连接交换机信息

  • 端口映射

  • 网络拓扑可视化

PCI 设备

列出所有 PCI/PCIe 设备:

  • 设备类型和型号

  • 总线分配

  • 直通可用性

SR-IOV NIC 设备

适用于支持单根 I/O 虚拟化的 NIC 的虚拟功能信息:

  • 虚拟功能数量

  • 分配状态

NVIDIA vGPU 设备

可用于虚拟 GPU 分配的 GPU 资源(如适用):

  • GPU 型号和容量

  • 可用的 vGPU 配置文件

  • 分配状态

USB 设备

已连接的 USB 设备:

  • 设备识别

  • 直通能力

资源

资源分配和限制:

  • 核心分配

  • 内存分配

  • 存储分配

任务

活动和计划任务:

  • 正在运行的操作

  • 排队中的作业

  • 任务历史

正在运行的计算机

显示具有详细资源消耗的活动工作负载:

  • 状态:运行状态指示器

  • 类型:工作负载类型(虚拟机、vNet 容器)

  • 名称:机器标识符

  • CPU 核心数:分配的核心数

  • CPU 使用率:当前处理器利用率百分比

  • RAM:已分配内存及其利用率百分比和可视化指示器

  • 上次启动:机器启动的时间戳

常见的机器类型包括:

  • 虚拟机(VM)

  • vNet 容器(网络服务)

  • 系统服务(NAS、DMZ、External 等)

主要特性

管理操作

可从左侧菜单获取:

  • 电源控制:

    • 开机/关机

    • 重启

    • 强制断电(强制关闭)

  • 维护操作:

    • 启用/禁用维护模式

    • 扩容(向集群添加资源)

  • 远程控制台:直接访问节点控制台进行故障排查

  • 配置:

    • 编辑节点设置

    • 分配标签以便组织管理

    • 删除节点(在适当情况下)

    • 添加备注以便文档记录

  • 刷新:更新仪表板数据

  • IPMI 管理:远程管理接口访问

监控

  • 实时资源利用率:CPU、内存和温度的实时图表

  • 历史性能数据:通过历史链接进行趋势分析

  • 事件日志:节点事件的全面日志记录,包括:

    • 级别:警告/信息/错误分类

    • 时间:每个事件的时间戳

    • :来源组件(例如 node1)

    • 消息:详细事件描述(例如温度警告)

    • 用于扩展日志历史的“查看更多”选项

  • 硬件健康状态:驱动器错误、NIC 状态和组件监控

日志和诊断

日志部分提供关键系统事件:

  • 温度警告:核心温度阈值告警

  • 硬件事件:驱动器状态变化、NIC 事件

  • 系统事件:电源状态变化、维护模式切换

  • 性能告警:资源利用率警告

常见日志条目包括带有具体阈值的核心温度警告(例如,“核心已达到警告温度 96 / 95”)。

最佳实践

  • 监控节点健康状况:定期查看节点健康指标,尤其是温度和驱动器状态

  • 维护模式:在执行系统更新或硬件更改之前,始终启用维护模式

  • 查看日志:定期检查日志以发现潜在问题,特别是温度警告和驱动器错误

  • 负载均衡:保持集群中各节点之间的工作负载分布均衡

  • 保持更新:通过系统菜单保持固件和系统软件为最新版本

  • 远程控制台访问:在需要物理控制台或 SSH 访问时,使用远程控制台功能进行直接故障排查

  • Fabric 状态监控:监控核心 NIC 的 Fabric 状态,以确保正确的网络集成和冗余

  • 驱动器健康:监控驱动器错误计数器和修复状态,以主动处理存储问题

  • 温度管理:通过检查冷却系统和气流来处理反复出现的温度警告

最后更新于

这有帮助吗?