For the complete documentation index, see llms.txt. This page is also available as Markdown.

Tableau de bord et état du système

Visibilité système en temps réel depuis l’interface VergeOS — tableaux de bord des nœuds, ressources matérielles, état du fabric, journaux d’événements et supervision au niveau du cluster.

Philosophie de supervision

VergeOS adopte une vue unifiée approche de supervision de l'infrastructure. Chaque composant -- calcul, stockage, réseau et santé matérielle -- est visible depuis l'interface intégrée, sans aucun outil de supervision externe. Le système fournit des métriques en temps réel, des tendances historiques et des journaux d'événements à tous les niveaux : nœuds individuels, clusters, niveaux vSAN, réseaux, VM et locataires.

Cette page couvre les surfaces de supervision principales que vous utiliserez au quotidien pour évaluer l'état du système et résoudre les problèmes.

Tableau de bord du nœud

Le Le tableau de bord des nœuds est votre interface principale pour surveiller les serveurs physiques (ou virtuels) individuels dans l'environnement. Accédez-y via Infrastructure → Nœuds, puis sélectionnez un nœud spécifique.

Informations sur l'état du nœud

En haut du tableau de bord du nœud, vous trouverez les champs d'état clés :

Champ
Description

Statut

État opérationnel actuel -- En cours d'exécution ou Hors ligne ; pendant les workflows de maintenance, il peut afficher Migration, Mode maintenance ou Sortie de maintenance

Mode maintenance

Indique si le nœud est en état de maintenance (charges de travail migrées ailleurs)

Dernière mise sous tension

Horodatage du dernier démarrage

État IPMI

État de l'Intelligent Platform Management Interface

Adresse réseau IPMI

IP de gestion BMC/iDRAC/iLO pour l'accès à distance

Version du système

Répartition de la version VergeOS -- versions de l'OS, du vSAN, d'Appserver et du Kernel

Configuration matérielle

Le tableau de bord affiche également le profil matériel physique :

  • CPU -- Modèle et génération du processeur

  • Cœurs CPU -- Nombre de cœurs physiques

  • RAM -- Capacité totale de mémoire physique

  • RAM de basculement -- Mémoire réservée aux scénarios de basculement

  • RAM surengagée -- Mémoire disponible pour la surallocation

  • Cluster -- À quel cluster appartient ce nœud

  • Modèle / étiquette d'actif -- Plateforme matérielle et étiquette d'inventaire

Graphique d'utilisation CPU

Le graphique d'utilisation CPU est l'une des métriques les plus consultées. Il fournit une visualisation en temps réel et des tendances historiques avec plusieurs catégories de détail :

Métrique
Ce qu'elle montre

CPU total

Utilisation CPU agrégée sur tous les cœurs

Pic du cœur

Le cœur unique le plus sollicité (aide à identifier les goulots d'étranglement sur un seul thread)

Utilisateur

Temps passé dans les processus de l'espace utilisateur

Système

Temps passé dans les opérations de l'espace noyau

Attente E/S

Temps pendant lequel le CPU est inactif en attente de la fin des opérations d'E/S

Utilisation VM

CPU consommé par les machines virtuelles exécutées sur ce nœud

IRQ

Temps passé à gérer les interruptions matérielles et logicielles

Cartes de statistiques du nœud

Sous le graphique CPU, le tableau de bord présente des cartes de métriques de référence rapide :

  • RAM physique -- Pourcentage d'utilisation actuel de la mémoire et capacité totale

  • RAM virtuelle -- Mémoire virtuelle allouée (généralement 0 % lorsqu'elle n'est pas surengagée)

  • Température -- Température actuelle du nœud avec un indicateur codé par couleur (vert / jaune / rouge selon les seuils)

  • Machines en cours d'exécution -- Nombre de VM actives, de conteneurs vNet et de services système sur ce nœud

  • Utilisation des cœurs -- Pourcentage des cœurs CPU actuellement utilisés

  • Utilisation de la RAM -- Consommation mémoire sur toutes les machines en cours d'exécution

Panneau des ressources matérielles

La section inférieure du tableau de bord du nœud fournit des vues détaillées de chaque composant matériel physique.

Disques

Tous les disques physiques connectés au nœud sont répertoriés avec toutes les données de santé :

Colonne
Rôle

Statut

Indicateur en ligne / hors ligne

Nom

Identifiant du périphérique (par ex., nvme0n1, sda)

Modèle

Fabricant et numéro de modèle

Niveau

Affectation du niveau de stockage vSAN (définie lors de l'installation)

Identifiant de disque vSAN

Identifiant unique au sein du vSAN

Firmware

Version actuelle du firmware du disque

Bus

Type de connexion du bus matériel (NVMe, SATA, SAS)

Utilisation

Utilisation de la capacité avec barre de progression visuelle

En cours de réparation

Indique si le disque est actuellement en cours de reconstruction

Erreurs de lecture/écriture

Compteurs d'erreurs pour la supervision proactive de l'état

Vous pouvez cliquer sur n'importe quel disque pour accéder à ses S.M.A.R.T. diagnostics -- secteurs réalloués, température, heures de mise sous tension, équilibrage de l'usure et autres indicateurs prédictifs de panne.

Cartes réseau (NIC)

Chaque NIC du nœud est affichée avec son état opérationnel et son état de fabric :

  • Statut -- En service ou Hors service

  • État de fabric -- Connectivité du fabric principal. Confirmé indique que la NIC est correctement intégrée ; Aucun chemin et Dégradé sont les états problématiques à surveiller ; Aucune s'affiche pour les NIC qui ne font pas partie du fabric principal. Une icône de globe indique les NIC connectées au fabric principal

  • Port -- Identifiant du port physique sur la NIC

  • Nom -- Identifiant de l'interface (par ex., enp2s0f0)

  • Modèle / fournisseur / pilote -- Détails matériels et logiciels

  • Rapidité -- Vitesse de lien négociée (par ex., 10000 Mb/s, 25000 Mb/s)

  • MAC -- Adresse MAC matérielle

  • Réseau -- Réseau VergeOS associé

  • RX / TX -- Données totales reçues et transmises

  • Débit RX / TX -- Débits de transfert actuels

Sections matérielles supplémentaires

Section
Ce qu'elle montre

Modules mémoire

RAM installée -- nombre de modules, capacité, type et spécifications

Voisins LLDP

Données du Link Layer Discovery Protocol -- commutateur connecté, mappage des ports, topologie du réseau

Périphériques PCI

Tous les périphériques PCI/PCIe avec affectation de bus et disponibilité du passthrough

Périphériques NIC SR-IOV

Nombre de fonctions virtuelles et état d'affectation pour les NIC compatibles SR-IOV

Périphériques NVIDIA vGPU

Modèle de GPU, profils vGPU disponibles et état d'allocation

Périphériques USB

Périphériques USB connectés avec capacité de passthrough

Supervision de l'état du fabric

Le core fabric est le réseau dorsal qui relie tous les nœuds VergeOS. Surveiller l'état du fabric est crucial, car une dégradation du fabric a un impact sur la réplication vSAN, la migration à chaud des VM et la communication entre nœuds.

Dans la table NIC de chaque nœud, recherchez la État de fabric colonne :

  • Confirmé -- La NIC est correctement intégrée au fabric principal et communique avec les nœuds pairs

  • Aucun chemin ou Dégradé -- États problématiques indiquant que la NIC ne participe pas correctement au fabric. Peut indiquer un problème de câble, une mauvaise configuration du commutateur ou une défaillance de la NIC

  • Aucune -- Affiché pour les NIC qui ne font pas partie du fabric principal (par ex., NIC de réseau externe)

Journaux d'événements

Chaque tableau de bord de nœud comprend une Journaux d'événements section qui affiche les événements système limités à ce nœud. Les événements sont classés par niveau de gravité :

Niveau
Description
Exemples

Critique

Conditions susceptibles de menacer le système nécessitant une action immédiate

Nœud hors ligne, vSAN dégradé

Erreur

Défaillances qui impactent la fonctionnalité

Panne de disque, opérations ayant échoué

Avertissement

Conditions pouvant s'aggraver si elles ne sont pas traitées

Seuil de température dépassé, erreurs de disque en augmentation

Message

Événements opérationnels normaux

Changements d'état d'alimentation, transitions du mode maintenance, migrations de VM

Entrées de journal courantes

  • Avertissements de température -- "Le cœur a atteint la température d'alerte '96 / 95'" indique qu'un cœur de CPU a dépassé le seuil configuré. Les deux nombres correspondent à la mesure actuelle et au seuil d'alerte calculé pour ce CPU. Par défaut (max_core_temp = 0 dans Paramètres du cluster → Température du nœud), VergeOS interroge le maximum matériel de chaque CPU et déclenche l'alerte à max_core_temp_warn_perc (par défaut 10%) en dessous de ce maximum

  • Événements d'état des disques -- Notifications lorsque les disques passent hors ligne, commencent à être réparés ou signalent de nouvelles erreurs de lecture/écriture

  • Changements d'état d'alimentation -- Enregistrements des redémarrages, des arrêts et des mises sous tension du nœud

  • Transitions du mode maintenance -- Journaux lorsque un nœud entre en mode maintenance ou en sort

Chaque entrée de journal inclut le horodatage, source (par ex. node1), et un message détaillé. Cliquez sur Voir plus pour accéder à l'historique complet des journaux.

Actions de gestion du nœud

Le menu de gauche du tableau de bord du nœud fournit les opérations de gestion essentielles :

Contrôle de l'alimentation

  • Mise sous / hors tension -- Opérations d'alimentation standard via IPMI

  • Redémarrer -- Redémarrage en douceur du nœud

  • Couper l'alimentation -- Arrêt forcé (à utiliser uniquement lorsque les méthodes en douceur échouent)

Mode maintenance

Activez toujours le mode maintenance avant d'effectuer des modifications matérielles ou des mises à jour système. Lorsque vous placez un nœud en mode maintenance, VergeOS migre à chaud les charges de travail éligibles vers d'autres nœuds du cluster. Les VM avec passthrough GPU ou un type de CPU host-passthrough (ainsi que le passthrough USB ou les NIC SR-IOV) ne sont pas migrables et doivent être arrêtées -- manuellement, ou automatiquement si la méthode de migration de la VM est définie sur Automatique.

Console distante

Fournit un accès direct à la console du nœud via IPMI/iDRAC/iLO. Utilisez cela pour les scénarios de dépannage lorsque l'interface VergeOS est inaccessible ou lorsque vous avez besoin d'un accès au niveau BIOS.

Actions supplémentaires

  • Modifier -- Modifier les paramètres du nœud (RAM de basculement, surallocation, balises)

  • Montée en charge -- Ajouter des ressources au cluster à partir de ce nœud

  • Diagnostics -- Accéder aux outils de diagnostic au niveau du nœud (analyse ARP, ethtool, capteurs IPMI, tests S.M.A.R.T. et plus encore)

  • Actualiser -- Forcer une mise à jour de toutes les données du tableau de bord

Vues au niveau du cluster

Alors que les tableaux de bord des nœuds affichent l'état de chaque serveur, les vues du cluster fournissent l'utilisation agrégée des ressources sur tous les nœuds d'un cluster.

Accédez à Système → Clusters pour voir :

  • CPU total -- Capacité de traitement combinée et utilisation sur tous les nœuds

  • RAM totale -- Mémoire agrégée avec répartition de l'utilisation

  • Nombre de nœuds -- Nombre de nœuds actifs par rapport au total dans le cluster

  • Répartition des charges de travail -- Répartition des VM et services entre les nœuds

Les vues du cluster sont essentielles pour la planification de capacité -- elles vous aident à identifier quand un cluster approche des limites de ressources et quand il est temps de passer à l'échelle avec des nœuds supplémentaires.

Aperçu de l'état du vSAN

L'état du vSAN est accessible depuis le tableau de bord principal en cliquant sur la compteur Niveaux vSAN boîte de compteur, ou via Infrastructure → Niveaux vSAN.

Les indicateurs clés comprennent :

  • État du niveau -- État par niveau affiché via le état champ (online, noredundant, repairing, outofspace, offline, ...) et le redundant booléen. Le en cours indicateur montre si un Journal Walk est actuellement en cours, et non l'état global du niveau (un niveau sain et inactif affiche working=false)

  • Capacité par niveau -- Stockage total, utilisé et disponible pour chaque niveau

  • État de redondance -- Indique si les exigences de redondance des données sont satisfaites (critique après une panne de disque ou de nœud)

  • État de réparation -- Opérations de réparation actives et progression (devraient toutes être à zéro en fonctionnement normal)

  • Nombre de périphériques -- Nombre de disques participant à chaque niveau

État du réseau

L'état du réseau est surveillé depuis Réseaux dans la navigation principale. Pour chaque réseau (externe, interne, DMZ, réseaux de locataires), vous pouvez voir :

  • État de connectivité -- Si le réseau est opérationnel et joignable

  • Statistiques de trafic -- Volume et débits RX/TX par réseau

  • Machines connectées -- Quelles VM et quels services sont connectés

  • Nombre d'occurrences des règles de pare-feu -- Activité sur les règles de pare-feu configurées

  • Journaux spécifiques au réseau -- Événements limités à ce réseau particulier

Vue des machines en cours d'exécution

Chaque tableau de bord de nœud comprend une Machines en cours d'exécution section affichant toutes les charges de travail actives :

Colonne
Description

Statut

Indicateur d'état d'exécution

Type

Machine virtuelle, conteneur vNet ou service système

Nom

Identifiant de la machine

Cœurs CPU

Nombre de cœurs attribués

Utilisation CPU

Pourcentage d'utilisation actuel du processeur

RAM

Mémoire allouée avec pourcentage d'utilisation

Dernier démarrage

Horodatage du démarrage de la charge de travail

Les types de machines courants incluent les VM, les conteneurs vNet (services réseau) et les services système (NAS, DMZ, réseau externe, etc.).

Vous venez de VMware ou de Nutanix ?

Dans VergeOS, le matériel des nœuds, les ressources du cluster, l'état du stockage, l'état du réseau et les métriques des charges de travail vivent tous dans la même interface intégrée -- pas de serveur de gestion séparé, de suite de supervision ou de CLI à installer pour la visibilité quotidienne.

Bonnes pratiques

Vérifications quotidiennes de l'état

Examinez les températures des nœuds, les compteurs d'erreurs des disques et l'état du fabric sur tous les nœuds. Traitez immédiatement toute NIC de fabric présentant Aucun chemin ou Dégradé, ou une augmentation des erreurs de disque, immédiatement.

Utiliser le mode maintenance

Activez toujours le mode maintenance avant des modifications matérielles, des mises à jour du firmware ou des mises à jour système. Les charges de travail éligibles sont migrées à chaud avant que vous n'interveniez sur le nœud ; les VM qui ne peuvent pas être migrées à chaud (passthrough GPU, type de CPU host-passthrough, passthrough USB, SR-IOV) doivent être arrêtées.

Surveiller la capacité du vSAN

Gardez l'utilisation des niveaux sous 85 % pour conserver une marge de performance. Configurez des alertes d'abonnement (couverts dans la section suivante) pour être averti avant d'atteindre les seuils de limitation.

Consulter régulièrement les journaux

Vérifiez périodiquement les journaux d'événements pour les avertissements de température, les erreurs de disque et les changements d'état inattendus. Détecter les problèmes tôt évite les défaillances en cascade.

Mis à jour

Ce contenu vous a-t-il été utile ?