Tableau de bord et état du système
Visibilité système en temps réel depuis l’interface VergeOS — tableaux de bord des nœuds, ressources matérielles, état du fabric, journaux d’événements et supervision au niveau du cluster.
Philosophie de supervision
VergeOS adopte une vue unifiée approche de supervision de l'infrastructure. Chaque composant -- calcul, stockage, réseau et santé matérielle -- est visible depuis l'interface intégrée, sans aucun outil de supervision externe. Le système fournit des métriques en temps réel, des tendances historiques et des journaux d'événements à tous les niveaux : nœuds individuels, clusters, niveaux vSAN, réseaux, VM et locataires.
Cette page couvre les surfaces de supervision principales que vous utiliserez au quotidien pour évaluer l'état du système et résoudre les problèmes.
Tableau de bord du nœud
Le Le tableau de bord des nœuds est votre interface principale pour surveiller les serveurs physiques (ou virtuels) individuels dans l'environnement. Accédez-y via Infrastructure → Nœuds, puis sélectionnez un nœud spécifique.
Informations sur l'état du nœud
En haut du tableau de bord du nœud, vous trouverez les champs d'état clés :
Statut
État opérationnel actuel -- En cours d'exécution ou Hors ligne ; pendant les workflows de maintenance, il peut afficher Migration, Mode maintenance ou Sortie de maintenance
Mode maintenance
Indique si le nœud est en état de maintenance (charges de travail migrées ailleurs)
Dernière mise sous tension
Horodatage du dernier démarrage
État IPMI
État de l'Intelligent Platform Management Interface
Adresse réseau IPMI
IP de gestion BMC/iDRAC/iLO pour l'accès à distance
Version du système
Répartition de la version VergeOS -- versions de l'OS, du vSAN, d'Appserver et du Kernel
Configuration matérielle
Le tableau de bord affiche également le profil matériel physique :
CPU -- Modèle et génération du processeur
Cœurs CPU -- Nombre de cœurs physiques
RAM -- Capacité totale de mémoire physique
RAM de basculement -- Mémoire réservée aux scénarios de basculement
RAM surengagée -- Mémoire disponible pour la surallocation
Cluster -- À quel cluster appartient ce nœud
Modèle / étiquette d'actif -- Plateforme matérielle et étiquette d'inventaire
Graphique d'utilisation CPU
Le graphique d'utilisation CPU est l'une des métriques les plus consultées. Il fournit une visualisation en temps réel et des tendances historiques avec plusieurs catégories de détail :
CPU total
Utilisation CPU agrégée sur tous les cœurs
Pic du cœur
Le cœur unique le plus sollicité (aide à identifier les goulots d'étranglement sur un seul thread)
Utilisateur
Temps passé dans les processus de l'espace utilisateur
Système
Temps passé dans les opérations de l'espace noyau
Attente E/S
Temps pendant lequel le CPU est inactif en attente de la fin des opérations d'E/S
Utilisation VM
CPU consommé par les machines virtuelles exécutées sur ce nœud
IRQ
Temps passé à gérer les interruptions matérielles et logicielles
Cartes de statistiques du nœud
Sous le graphique CPU, le tableau de bord présente des cartes de métriques de référence rapide :
RAM physique -- Pourcentage d'utilisation actuel de la mémoire et capacité totale
RAM virtuelle -- Mémoire virtuelle allouée (généralement 0 % lorsqu'elle n'est pas surengagée)
Température -- Température actuelle du nœud avec un indicateur codé par couleur (vert / jaune / rouge selon les seuils)
Machines en cours d'exécution -- Nombre de VM actives, de conteneurs vNet et de services système sur ce nœud
Utilisation des cœurs -- Pourcentage des cœurs CPU actuellement utilisés
Utilisation de la RAM -- Consommation mémoire sur toutes les machines en cours d'exécution
Panneau des ressources matérielles
La section inférieure du tableau de bord du nœud fournit des vues détaillées de chaque composant matériel physique.
Disques
Tous les disques physiques connectés au nœud sont répertoriés avec toutes les données de santé :
Statut
Indicateur en ligne / hors ligne
Nom
Identifiant du périphérique (par ex., nvme0n1, sda)
Modèle
Fabricant et numéro de modèle
Niveau
Affectation du niveau de stockage vSAN (définie lors de l'installation)
Identifiant de disque vSAN
Identifiant unique au sein du vSAN
Firmware
Version actuelle du firmware du disque
Bus
Type de connexion du bus matériel (NVMe, SATA, SAS)
Utilisation
Utilisation de la capacité avec barre de progression visuelle
En cours de réparation
Indique si le disque est actuellement en cours de reconstruction
Erreurs de lecture/écriture
Compteurs d'erreurs pour la supervision proactive de l'état
Vous pouvez cliquer sur n'importe quel disque pour accéder à ses S.M.A.R.T. diagnostics -- secteurs réalloués, température, heures de mise sous tension, équilibrage de l'usure et autres indicateurs prédictifs de panne.
Cartes réseau (NIC)
Chaque NIC du nœud est affichée avec son état opérationnel et son état de fabric :
Statut -- En service ou Hors service
État de fabric -- Connectivité du fabric principal. Confirmé indique que la NIC est correctement intégrée ; Aucun chemin et Dégradé sont les états problématiques à surveiller ; Aucune s'affiche pour les NIC qui ne font pas partie du fabric principal. Une icône de globe indique les NIC connectées au fabric principal
Port -- Identifiant du port physique sur la NIC
Nom -- Identifiant de l'interface (par ex.,
enp2s0f0)Modèle / fournisseur / pilote -- Détails matériels et logiciels
Rapidité -- Vitesse de lien négociée (par ex., 10000 Mb/s, 25000 Mb/s)
MAC -- Adresse MAC matérielle
Réseau -- Réseau VergeOS associé
RX / TX -- Données totales reçues et transmises
Débit RX / TX -- Débits de transfert actuels
Sections matérielles supplémentaires
Modules mémoire
RAM installée -- nombre de modules, capacité, type et spécifications
Voisins LLDP
Données du Link Layer Discovery Protocol -- commutateur connecté, mappage des ports, topologie du réseau
Périphériques PCI
Tous les périphériques PCI/PCIe avec affectation de bus et disponibilité du passthrough
Périphériques NIC SR-IOV
Nombre de fonctions virtuelles et état d'affectation pour les NIC compatibles SR-IOV
Périphériques NVIDIA vGPU
Modèle de GPU, profils vGPU disponibles et état d'allocation
Périphériques USB
Périphériques USB connectés avec capacité de passthrough
Supervision de l'état du fabric
Le core fabric est le réseau dorsal qui relie tous les nœuds VergeOS. Surveiller l'état du fabric est crucial, car une dégradation du fabric a un impact sur la réplication vSAN, la migration à chaud des VM et la communication entre nœuds.
Dans la table NIC de chaque nœud, recherchez la État de fabric colonne :
Confirmé -- La NIC est correctement intégrée au fabric principal et communique avec les nœuds pairs
Aucun chemin ou Dégradé -- États problématiques indiquant que la NIC ne participe pas correctement au fabric. Peut indiquer un problème de câble, une mauvaise configuration du commutateur ou une défaillance de la NIC
Aucune -- Affiché pour les NIC qui ne font pas partie du fabric principal (par ex., NIC de réseau externe)
Vérification rapide de l'état du fabric
Depuis le tableau de bord principal, accédez à Infrastructure → Nœuds et examinez l'état du fabric NIC sur tous les nœuds. Chaque NIC du fabric principal devrait afficher Confirmé. Tout Aucun chemin ou Dégradé état justifie une enquête immédiate -- vérifiez le câblage physique, la configuration des ports du commutateur et l'état du pilote de la NIC.
Journaux d'événements
Chaque tableau de bord de nœud comprend une Journaux d'événements section qui affiche les événements système limités à ce nœud. Les événements sont classés par niveau de gravité :
Critique
Conditions susceptibles de menacer le système nécessitant une action immédiate
Nœud hors ligne, vSAN dégradé
Erreur
Défaillances qui impactent la fonctionnalité
Panne de disque, opérations ayant échoué
Avertissement
Conditions pouvant s'aggraver si elles ne sont pas traitées
Seuil de température dépassé, erreurs de disque en augmentation
Message
Événements opérationnels normaux
Changements d'état d'alimentation, transitions du mode maintenance, migrations de VM
Entrées de journal courantes
Avertissements de température --
"Le cœur a atteint la température d'alerte '96 / 95'"indique qu'un cœur de CPU a dépassé le seuil configuré. Les deux nombres correspondent à la mesure actuelle et au seuil d'alerte calculé pour ce CPU. Par défaut (max_core_temp = 0dans Paramètres du cluster → Température du nœud), VergeOS interroge le maximum matériel de chaque CPU et déclenche l'alerte àmax_core_temp_warn_perc(par défaut 10%) en dessous de ce maximumÉvénements d'état des disques -- Notifications lorsque les disques passent hors ligne, commencent à être réparés ou signalent de nouvelles erreurs de lecture/écriture
Changements d'état d'alimentation -- Enregistrements des redémarrages, des arrêts et des mises sous tension du nœud
Transitions du mode maintenance -- Journaux lorsque un nœud entre en mode maintenance ou en sort
Chaque entrée de journal inclut le horodatage, source (par ex. node1), et un message détaillé. Cliquez sur Voir plus pour accéder à l'historique complet des journaux.
Actions de gestion du nœud
Le menu de gauche du tableau de bord du nœud fournit les opérations de gestion essentielles :
Contrôle de l'alimentation
Mise sous / hors tension -- Opérations d'alimentation standard via IPMI
Redémarrer -- Redémarrage en douceur du nœud
Couper l'alimentation -- Arrêt forcé (à utiliser uniquement lorsque les méthodes en douceur échouent)
Mode maintenance
Activez toujours le mode maintenance avant d'effectuer des modifications matérielles ou des mises à jour système. Lorsque vous placez un nœud en mode maintenance, VergeOS migre à chaud les charges de travail éligibles vers d'autres nœuds du cluster. Les VM avec passthrough GPU ou un type de CPU host-passthrough (ainsi que le passthrough USB ou les NIC SR-IOV) ne sont pas migrables et doivent être arrêtées -- manuellement, ou automatiquement si la méthode de migration de la VM est définie sur Automatique.
Console distante
Fournit un accès direct à la console du nœud via IPMI/iDRAC/iLO. Utilisez cela pour les scénarios de dépannage lorsque l'interface VergeOS est inaccessible ou lorsque vous avez besoin d'un accès au niveau BIOS.
Actions supplémentaires
Modifier -- Modifier les paramètres du nœud (RAM de basculement, surallocation, balises)
Montée en charge -- Ajouter des ressources au cluster à partir de ce nœud
Diagnostics -- Accéder aux outils de diagnostic au niveau du nœud (analyse ARP, ethtool, capteurs IPMI, tests S.M.A.R.T. et plus encore)
Actualiser -- Forcer une mise à jour de toutes les données du tableau de bord
Vues au niveau du cluster
Alors que les tableaux de bord des nœuds affichent l'état de chaque serveur, les vues du cluster fournissent l'utilisation agrégée des ressources sur tous les nœuds d'un cluster.
Accédez à Système → Clusters pour voir :
CPU total -- Capacité de traitement combinée et utilisation sur tous les nœuds
RAM totale -- Mémoire agrégée avec répartition de l'utilisation
Nombre de nœuds -- Nombre de nœuds actifs par rapport au total dans le cluster
Répartition des charges de travail -- Répartition des VM et services entre les nœuds
Les vues du cluster sont essentielles pour la planification de capacité -- elles vous aident à identifier quand un cluster approche des limites de ressources et quand il est temps de passer à l'échelle avec des nœuds supplémentaires.
Aperçu de l'état du vSAN
L'état du vSAN est accessible depuis le tableau de bord principal en cliquant sur la compteur Niveaux vSAN boîte de compteur, ou via Infrastructure → Niveaux vSAN.
Les indicateurs clés comprennent :
État du niveau -- État par niveau affiché via le
étatchamp (online,noredundant,repairing,outofspace,offline, ...) et leredundantbooléen. Leen coursindicateur montre si un Journal Walk est actuellement en cours, et non l'état global du niveau (un niveau sain et inactif afficheworking=false)Capacité par niveau -- Stockage total, utilisé et disponible pour chaque niveau
État de redondance -- Indique si les exigences de redondance des données sont satisfaites (critique après une panne de disque ou de nœud)
État de réparation -- Opérations de réparation actives et progression (devraient toutes être à zéro en fonctionnement normal)
Nombre de périphériques -- Nombre de disques participant à chaque niveau
Seuils de limitation du stockage
VergeOS applique automatiquement la limitation des E/S lorsque le stockage se remplit :
En dessous de 91 % -- Fonctionnement normal, aucune limitation
91–95 % -- Début de la limitation en cas de manque d'espace (10 ms de latence ajoutées)
96%+ -- Limitation critique (50 ms de latence ajoutées) avec une grave dégradation des performances
Surveillez de manière proactive la capacité des niveaux et configurez des alertes avant d'atteindre ces seuils.
État du réseau
L'état du réseau est surveillé depuis Réseaux dans la navigation principale. Pour chaque réseau (externe, interne, DMZ, réseaux de locataires), vous pouvez voir :
État de connectivité -- Si le réseau est opérationnel et joignable
Statistiques de trafic -- Volume et débits RX/TX par réseau
Machines connectées -- Quelles VM et quels services sont connectés
Nombre d'occurrences des règles de pare-feu -- Activité sur les règles de pare-feu configurées
Journaux spécifiques au réseau -- Événements limités à ce réseau particulier
Vue des machines en cours d'exécution
Chaque tableau de bord de nœud comprend une Machines en cours d'exécution section affichant toutes les charges de travail actives :
Statut
Indicateur d'état d'exécution
Type
Machine virtuelle, conteneur vNet ou service système
Nom
Identifiant de la machine
Cœurs CPU
Nombre de cœurs attribués
Utilisation CPU
Pourcentage d'utilisation actuel du processeur
RAM
Mémoire allouée avec pourcentage d'utilisation
Dernier démarrage
Horodatage du démarrage de la charge de travail
Les types de machines courants incluent les VM, les conteneurs vNet (services réseau) et les services système (NAS, DMZ, réseau externe, etc.).
Bonnes pratiques
Vérifications quotidiennes de l'état
Examinez les températures des nœuds, les compteurs d'erreurs des disques et l'état du fabric sur tous les nœuds. Traitez immédiatement toute NIC de fabric présentant Aucun chemin ou Dégradé, ou une augmentation des erreurs de disque, immédiatement.
Utiliser le mode maintenance
Activez toujours le mode maintenance avant des modifications matérielles, des mises à jour du firmware ou des mises à jour système. Les charges de travail éligibles sont migrées à chaud avant que vous n'interveniez sur le nœud ; les VM qui ne peuvent pas être migrées à chaud (passthrough GPU, type de CPU host-passthrough, passthrough USB, SR-IOV) doivent être arrêtées.
Surveiller la capacité du vSAN
Gardez l'utilisation des niveaux sous 85 % pour conserver une marge de performance. Configurez des alertes d'abonnement (couverts dans la section suivante) pour être averti avant d'atteindre les seuils de limitation.
Consulter régulièrement les journaux
Vérifiez périodiquement les journaux d'événements pour les avertissements de température, les erreurs de disque et les changements d'état inattendus. Détecter les problèmes tôt évite les défaillances en cascade.
Mis à jour
Ce contenu vous a-t-il été utile ?