节点概述
VergeOS 节点管理概述,包括节点状态、硬件配置、资源指标、驱动器、NIC、Fabric 状态、运行中的机器和管理操作。
VergeOS 中的节点表示一台物理或虚拟服务器,它为您的环境提供计算、存储和网络资源。节点仪表板为系统中的每个节点提供全面的监控和管理功能。
关键组件
节点状态信息
状态:显示当前运行状态(运行/离线)
运行中:表示该节点正在正常运行
维护模式:表示该节点处于维护状态
最后开机时间:节点上次启动的时间戳
本地时间:节点上的当前时间
IPMI 状态:显示智能平台管理接口的状态
IPMI 网络地址:用于远程管理访问的网络地址
系统版本:显示当前 VergeOS 版本(OS 版本、vSAN 版本、Appserver 版本、内核版本)
硬件配置
CPU:处理器型号和代际
CPU 核心数:物理处理器核心数量
RAM:物理内存总容量
故障切换 RAM:为故障切换场景预留的内存
超配 RAM:可用于超额分配的内存
集群:该节点所属的集群
PXE 网络:用于 PXE 启动操作的网络
型号:硬件平台信息
系列:产品系列名称
资产标签和功能
物理:表示物理硬件资产
采集系统日志:系统日志记录状态
LLDP:链路层发现协议状态
iOMMU(VT-d)支持:硬件虚拟化支持
需要重启:表示是否需要重启
需要重新加载驱动:表示驱动更新是否需要重新加载
资源指标
仪表板通过以下方式提供实时和历史监控:
CPU 使用率图表:显示当前、平均和最大 CPU 利用率,并提供历史趋势可视化
总 CPU
核心峰值
使用情况(用户、系统、IO 等待、VM 使用、IRQ)
节点统计
仪表板按类别组织,提供关键指标:
物理 RAM:当前内存利用率百分比和容量
虚拟 RAM:已分配的虚拟内存(未超配时通常为 0%)
温度:节点当前温度,并带有可视化指示器(根据阈值显示绿/黄/红)
正在运行的计算机:节点上活动工作负载的数量
核心使用率:正在使用的 CPU 核心百分比
RAM 使用率:运行中机器的内存消耗
硬件资源
驱动器
显示连接到该节点的所有物理驱动器:
状态:在线/离线指示器
名称:驱动器标识符(例如 nvme0n1、nvme1n1)
型号:制造商和型号
层级:vSAN 存储层分配
vSAN 驱动器 ID:vSAN 内的唯一标识符
固件:驱动器固件版本
总线:硬件总线连接
使用情况:容量利用率,并带有可视化指示器
正在修复:驱动器重建状态
读/写错误:用于驱动器健康监控的错误计数器
网络接口卡(NIC)
全面的 NIC 信息和状态:
状态:运行状态(正常/关闭)
Fabric 状态:核心 Fabric 连接状态(已确认/未确认),并带有可视化指示器
地球图标表示连接到核心 Fabric 的 NIC
“已确认”状态表示 NIC 已正确集成到网络 Fabric 中
名称:接口标识符(例如 enp2s0f0、enp8s0)
型号:网络适配器型号
供应商:网络适配器制造商
驱动程序:正在使用的网络驱动程序
端口:物理端口号
速度:链路速度(例如 10000Mb/s、2500Mb/s)
MAC:硬件 MAC 地址
网络:关联的 VergeOS 网络
RX/TX:接收和发送的数据量
RX/TX 速率:当前传输速率
动作:NIC 操作的快捷访问图标(控制台、图表、配置)
内存模块
显示已安装的 RAM 配置:
模块数量和容量
内存类型和规格
LLDP 邻居
显示已连接网络设备的链路层发现协议信息:
已连接交换机信息
端口映射
网络拓扑可视化
PCI 设备
列出所有 PCI/PCIe 设备:
设备类型和型号
总线分配
直通可用性
SR-IOV NIC 设备
适用于支持单根 I/O 虚拟化的 NIC 的虚拟功能信息:
虚拟功能数量
分配状态
NVIDIA vGPU 设备
可用于虚拟 GPU 分配的 GPU 资源(如适用):
GPU 型号和容量
可用的 vGPU 配置文件
分配状态
USB 设备
已连接的 USB 设备:
设备识别
直通能力
资源
资源分配和限制:
核心分配
内存分配
存储分配
任务
活动和计划任务:
正在运行的操作
排队中的作业
任务历史
正在运行的计算机
显示具有详细资源消耗的活动工作负载:
状态:运行状态指示器
类型:工作负载类型(虚拟机、vNet 容器)
名称:机器标识符
CPU 核心数:分配的核心数
CPU 使用率:当前处理器利用率百分比
RAM:已分配内存及其利用率百分比和可视化指示器
上次启动:机器启动的时间戳
常见的机器类型包括:
虚拟机(VM)
vNet 容器(网络服务)
系统服务(NAS、DMZ、External 等)
主要特性
管理操作
可从左侧菜单获取:
电源控制:
开机/关机
重启
强制断电(强制关闭)
维护操作:
启用/禁用维护模式
扩容(向集群添加资源)
远程控制台:直接访问节点控制台进行故障排查
配置:
编辑节点设置
分配标签以便组织管理
删除节点(在适当情况下)
添加备注以便文档记录
刷新:更新仪表板数据
IPMI 管理:远程管理接口访问
监控
实时资源利用率:CPU、内存和温度的实时图表
历史性能数据:通过历史链接进行趋势分析
事件日志:节点事件的全面日志记录,包括:
级别:警告/信息/错误分类
时间:每个事件的时间戳
源:来源组件(例如 node1)
消息:详细事件描述(例如温度警告)
用于扩展日志历史的“查看更多”选项
硬件健康状态:驱动器错误、NIC 状态和组件监控
日志和诊断
日志部分提供关键系统事件:
温度警告:核心温度阈值告警
硬件事件:驱动器状态变化、NIC 事件
系统事件:电源状态变化、维护模式切换
性能告警:资源利用率警告
常见日志条目包括带有具体阈值的核心温度警告(例如,“核心已达到警告温度 96 / 95”)。
最佳实践
监控节点健康状况:定期查看节点健康指标,尤其是温度和驱动器状态
维护模式:在执行系统更新或硬件更改之前,始终启用维护模式
查看日志:定期检查日志以发现潜在问题,特别是温度警告和驱动器错误
负载均衡:保持集群中各节点之间的工作负载分布均衡
保持更新:通过系统菜单保持固件和系统软件为最新版本
远程控制台访问:在需要物理控制台或 SSH 访问时,使用远程控制台功能进行直接故障排查
Fabric 状态监控:监控核心 NIC 的 Fabric 状态,以确保正确的网络集成和冗余
驱动器健康:监控驱动器错误计数器和修复状态,以主动处理存储问题
温度管理:通过检查冷却系统和气流来处理反复出现的温度警告
最后更新于
这有帮助吗?