> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/learn-the-platform/fr/module-9-supervision-et-depannage/01-dashboard-health.md).

# Tableau de bord et état du système

## Philosophie de supervision

VergeOS adopte une **vue unifiée** approche de supervision de l'infrastructure. Chaque composant -- calcul, stockage, réseau et santé matérielle -- est visible depuis l'interface intégrée, sans aucun outil de supervision externe. Le système fournit des métriques en temps réel, des tendances historiques et des journaux d'événements à tous les niveaux : nœuds individuels, clusters, niveaux vSAN, réseaux, VM et locataires.

Cette page couvre les surfaces de supervision principales que vous utiliserez au quotidien pour évaluer l'état du système et résoudre les problèmes.

```mermaid
graph TB
    subgraph ui["Interface VergeOS — Hiérarchie de supervision"]
        direction TB
        MAIN["Tableau de bord principal<br/>Vue d'ensemble du système"]
        CLUSTER["Vues du cluster<br/>Pools de ressources agrégés"]
        NODE["Tableaux de bord des nœuds<br/>Matériel et métriques par nœud"]
        VSAN["État du vSAN<br/>Santé et capacité du niveau"]
        NET["État du réseau<br/>Connectivité et trafic"]
        VM["Tableaux de bord VM / locataire<br/>Métriques par charge de travail"]

        MAIN --> CLUSTER
        MAIN --> VSAN
        MAIN --> NET
        CLUSTER --> NODE
        NODE --> VM
    end

    style ui fill:#f0f4ff,stroke:#336
```

## Tableau de bord du nœud

Le **Le tableau de bord des nœuds** est votre interface principale pour surveiller les serveurs physiques (ou virtuels) individuels dans l'environnement. Accédez-y via **Infrastructure → Nœuds**, puis sélectionnez un nœud spécifique.

### Informations sur l'état du nœud

En haut du tableau de bord du nœud, vous trouverez les champs d'état clés :

| Champ                          | Description                                                                                                                                                                  |
| ------------------------------ | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| **Statut**                     | État opérationnel actuel -- En cours d'exécution ou Hors ligne ; pendant les workflows de maintenance, il peut afficher Migration, Mode maintenance ou Sortie de maintenance |
| **Mode maintenance**           | Indique si le nœud est en état de maintenance (charges de travail migrées ailleurs)                                                                                          |
| **Dernière mise sous tension** | Horodatage du dernier démarrage                                                                                                                                              |
| **État IPMI**                  | État de l'Intelligent Platform Management Interface                                                                                                                          |
| **Adresse réseau IPMI**        | IP de gestion BMC/iDRAC/iLO pour l'accès à distance                                                                                                                          |
| **Version du système**         | Répartition de la version VergeOS -- versions de l'OS, du vSAN, d'Appserver et du Kernel                                                                                     |

### Configuration matérielle

Le tableau de bord affiche également le profil matériel physique :

* **CPU** -- Modèle et génération du processeur
* **Cœurs CPU** -- Nombre de cœurs physiques
* **RAM** -- Capacité totale de mémoire physique
* **RAM de basculement** -- Mémoire réservée aux scénarios de basculement
* **RAM surengagée** -- Mémoire disponible pour la surallocation
* **Cluster** -- À quel cluster appartient ce nœud
* **Modèle / étiquette d'actif** -- Plateforme matérielle et étiquette d'inventaire

### Graphique d'utilisation CPU

Le graphique d'utilisation CPU est l'une des métriques les plus consultées. Il fournit une visualisation en temps réel et des tendances historiques avec plusieurs catégories de détail :

| Métrique           | Ce qu'elle montre                                                                                  |
| ------------------ | -------------------------------------------------------------------------------------------------- |
| **CPU total**      | Utilisation CPU agrégée sur tous les cœurs                                                         |
| **Pic du cœur**    | Le cœur unique le plus sollicité (aide à identifier les goulots d'étranglement sur un seul thread) |
| **Utilisateur**    | Temps passé dans les processus de l'espace utilisateur                                             |
| **Système**        | Temps passé dans les opérations de l'espace noyau                                                  |
| **Attente E/S**    | Temps pendant lequel le CPU est inactif en attente de la fin des opérations d'E/S                  |
| **Utilisation VM** | CPU consommé par les machines virtuelles exécutées sur ce nœud                                     |
| **IRQ**            | Temps passé à gérer les interruptions matérielles et logicielles                                   |

### Cartes de statistiques du nœud

Sous le graphique CPU, le tableau de bord présente des cartes de métriques de référence rapide :

* **RAM physique** -- Pourcentage d'utilisation actuel de la mémoire et capacité totale
* **RAM virtuelle** -- Mémoire virtuelle allouée (généralement 0 % lorsqu'elle n'est pas surengagée)
* **Température** -- Température actuelle du nœud avec un indicateur codé par couleur (vert / jaune / rouge selon les seuils)
* **Machines en cours d'exécution** -- Nombre de VM actives, de conteneurs vNet et de services système sur ce nœud
* **Utilisation des cœurs** -- Pourcentage des cœurs CPU actuellement utilisés
* **Utilisation de la RAM** -- Consommation mémoire sur toutes les machines en cours d'exécution

## Panneau des ressources matérielles

La section inférieure du tableau de bord du nœud fournit des vues détaillées de chaque composant matériel physique.

### Disques

Tous les disques physiques connectés au nœud sont répertoriés avec toutes les données de santé :

| Colonne                         | Rôle                                                                    |
| ------------------------------- | ----------------------------------------------------------------------- |
| **Statut**                      | Indicateur en ligne / hors ligne                                        |
| **Nom**                         | Identifiant du périphérique (par ex., `nvme0n1`, `sda`)                 |
| **Modèle**                      | Fabricant et numéro de modèle                                           |
| **Niveau**                      | Affectation du niveau de stockage vSAN (définie lors de l'installation) |
| **Identifiant de disque vSAN**  | Identifiant unique au sein du vSAN                                      |
| **Firmware**                    | Version actuelle du firmware du disque                                  |
| **Bus**                         | Type de connexion du bus matériel (NVMe, SATA, SAS)                     |
| **Utilisation**                 | Utilisation de la capacité avec barre de progression visuelle           |
| **En cours de réparation**      | Indique si le disque est actuellement en cours de reconstruction        |
| **Erreurs de lecture/écriture** | Compteurs d'erreurs pour la supervision proactive de l'état             |

Vous pouvez cliquer sur n'importe quel disque pour accéder à ses **S.M.A.R.T.** diagnostics -- secteurs réalloués, température, heures de mise sous tension, équilibrage de l'usure et autres indicateurs prédictifs de panne.

### Cartes réseau (NIC)

Chaque NIC du nœud est affichée avec son état opérationnel et son état de fabric :

* **Statut** -- En service ou Hors service
* **État de fabric** -- Connectivité du fabric principal. **Confirmé** indique que la NIC est correctement intégrée ; **Aucun chemin** et **Dégradé** sont les états problématiques à surveiller ; **Aucune** s'affiche pour les NIC qui ne font pas partie du fabric principal. Une icône de globe indique les NIC connectées au fabric principal
* **Port** -- Identifiant du port physique sur la NIC
* **Nom** -- Identifiant de l'interface (par ex., `enp2s0f0`)
* **Modèle / fournisseur / pilote** -- Détails matériels et logiciels
* **Rapidité** -- Vitesse de lien négociée (par ex., 10000 Mb/s, 25000 Mb/s)
* **MAC** -- Adresse MAC matérielle
* **Réseau** -- Réseau VergeOS associé
* **RX / TX** -- Données totales reçues et transmises
* **Débit RX / TX** -- Débits de transfert actuels

### Sections matérielles supplémentaires

| Section                       | Ce qu'elle montre                                                                                        |
| ----------------------------- | -------------------------------------------------------------------------------------------------------- |
| **Modules mémoire**           | RAM installée -- nombre de modules, capacité, type et spécifications                                     |
| **Voisins LLDP**              | Données du Link Layer Discovery Protocol -- commutateur connecté, mappage des ports, topologie du réseau |
| **Périphériques PCI**         | Tous les périphériques PCI/PCIe avec affectation de bus et disponibilité du passthrough                  |
| **Périphériques NIC SR-IOV**  | Nombre de fonctions virtuelles et état d'affectation pour les NIC compatibles SR-IOV                     |
| **Périphériques NVIDIA vGPU** | Modèle de GPU, profils vGPU disponibles et état d'allocation                                             |
| **Périphériques USB**         | Périphériques USB connectés avec capacité de passthrough                                                 |

## Supervision de l'état du fabric

Le **core fabric** est le réseau dorsal qui relie tous les nœuds VergeOS. Surveiller l'état du fabric est crucial, car une dégradation du fabric a un impact sur la réplication vSAN, la migration à chaud des VM et la communication entre nœuds.

Dans la table NIC de chaque nœud, recherchez la **État de fabric** colonne :

* **Confirmé** -- La NIC est correctement intégrée au fabric principal et communique avec les nœuds pairs
* **Aucun chemin** ou **Dégradé** -- États problématiques indiquant que la NIC ne participe pas correctement au fabric. Peut indiquer un problème de câble, une mauvaise configuration du commutateur ou une défaillance de la NIC
* **Aucune** -- Affiché pour les NIC qui ne font pas partie du fabric principal (par ex., NIC de réseau externe)

{% hint style="success" %}
**Vérification rapide de l'état du fabric**

Depuis le tableau de bord principal, accédez à **Infrastructure → Nœuds** et examinez l'état du fabric NIC sur tous les nœuds. Chaque NIC du fabric principal devrait afficher **Confirmé**. Tout **Aucun chemin** ou **Dégradé** état justifie une enquête immédiate -- vérifiez le câblage physique, la configuration des ports du commutateur et l'état du pilote de la NIC.
{% endhint %}

## Journaux d'événements

Chaque tableau de bord de nœud comprend une **Journaux d'événements** section qui affiche les événements système limités à ce nœud. Les événements sont classés par niveau de gravité :

| Niveau            | Description                                                                    | Exemples                                                                             |
| ----------------- | ------------------------------------------------------------------------------ | ------------------------------------------------------------------------------------ |
| **Critique**      | Conditions susceptibles de menacer le système nécessitant une action immédiate | Nœud hors ligne, vSAN dégradé                                                        |
| **Erreur**        | Défaillances qui impactent la fonctionnalité                                   | Panne de disque, opérations ayant échoué                                             |
| **Avertissement** | Conditions pouvant s'aggraver si elles ne sont pas traitées                    | Seuil de température dépassé, erreurs de disque en augmentation                      |
| **Message**       | Événements opérationnels normaux                                               | Changements d'état d'alimentation, transitions du mode maintenance, migrations de VM |

### Entrées de journal courantes

* **Avertissements de température** -- `"Le cœur a atteint la température d'alerte '96 / 95'"` indique qu'un cœur de CPU a dépassé le seuil configuré. Les deux nombres correspondent à la mesure actuelle et au seuil d'alerte calculé pour ce CPU. Par défaut (`max_core_temp = 0` dans Paramètres du cluster → Température du nœud), VergeOS interroge le maximum matériel de chaque CPU et déclenche l'alerte à `max_core_temp_warn_perc` (par défaut **10%**) en dessous de ce maximum
* **Événements d'état des disques** -- Notifications lorsque les disques passent hors ligne, commencent à être réparés ou signalent de nouvelles erreurs de lecture/écriture
* **Changements d'état d'alimentation** -- Enregistrements des redémarrages, des arrêts et des mises sous tension du nœud
* **Transitions du mode maintenance** -- Journaux lorsque un nœud entre en mode maintenance ou en sort

Chaque entrée de journal inclut le **horodatage**, **source** (par ex. `node1`), et un **message détaillé**. Cliquez sur **Voir plus** pour accéder à l'historique complet des journaux.

## Actions de gestion du nœud

Le menu de gauche du tableau de bord du nœud fournit les opérations de gestion essentielles :

### Contrôle de l'alimentation

* **Mise sous / hors tension** -- Opérations d'alimentation standard via IPMI
* **Redémarrer** -- Redémarrage en douceur du nœud
* **Couper l'alimentation** -- Arrêt forcé (à utiliser uniquement lorsque les méthodes en douceur échouent)

### Mode maintenance

**Activez toujours le mode maintenance avant d'effectuer des modifications matérielles ou des mises à jour système.** Lorsque vous placez un nœud en mode maintenance, VergeOS migre à chaud les charges de travail éligibles vers d'autres nœuds du cluster. Les VM avec passthrough GPU ou un type de CPU host-passthrough (ainsi que le passthrough USB ou les NIC SR-IOV) ne sont pas migrables et doivent être arrêtées -- manuellement, ou automatiquement si la méthode de migration de la VM est définie sur Automatique.

### Console distante

Fournit un accès direct à la console du nœud via IPMI/iDRAC/iLO. Utilisez cela pour les scénarios de dépannage lorsque l'interface VergeOS est inaccessible ou lorsque vous avez besoin d'un accès au niveau BIOS.

### Actions supplémentaires

* **Modifier** -- Modifier les paramètres du nœud (RAM de basculement, surallocation, balises)
* **Montée en charge** -- Ajouter des ressources au cluster à partir de ce nœud
* **Diagnostics** -- Accéder aux outils de diagnostic au niveau du nœud (analyse ARP, ethtool, capteurs IPMI, tests S.M.A.R.T. et plus encore)
* **Actualiser** -- Forcer une mise à jour de toutes les données du tableau de bord

## Vues au niveau du cluster

Alors que les tableaux de bord des nœuds affichent l'état de chaque serveur, **les vues du cluster** fournissent l'utilisation agrégée des ressources sur tous les nœuds d'un cluster.

Accédez à **Système → Clusters** pour voir :

* **CPU total** -- Capacité de traitement combinée et utilisation sur tous les nœuds
* **RAM totale** -- Mémoire agrégée avec répartition de l'utilisation
* **Nombre de nœuds** -- Nombre de nœuds actifs par rapport au total dans le cluster
* **Répartition des charges de travail** -- Répartition des VM et services entre les nœuds

Les vues du cluster sont essentielles pour la planification de capacité -- elles vous aident à identifier quand un cluster approche des limites de ressources et quand il est temps de passer à l'échelle avec des nœuds supplémentaires.

## Aperçu de l'état du vSAN

L'état du vSAN est accessible depuis le tableau de bord principal en cliquant sur la **compteur Niveaux vSAN** boîte de compteur, ou via **Infrastructure → Niveaux vSAN**.

Les indicateurs clés comprennent :

* **État du niveau** -- État par niveau affiché via le `état` champ (`online`, `noredundant`, `repairing`, `outofspace`, `offline`, ...) et le `redundant` booléen. Le `en cours` indicateur montre si un Journal Walk est actuellement en cours, et non l'état global du niveau (un niveau sain et inactif affiche `working=false`)
* **Capacité par niveau** -- Stockage total, utilisé et disponible pour chaque niveau
* **État de redondance** -- Indique si les exigences de redondance des données sont satisfaites (critique après une panne de disque ou de nœud)
* **État de réparation** -- Opérations de réparation actives et progression (devraient toutes être à zéro en fonctionnement normal)
* **Nombre de périphériques** -- Nombre de disques participant à chaque niveau

{% hint style="warning" %}
**Seuils de limitation du stockage**

VergeOS applique automatiquement la limitation des E/S lorsque le stockage se remplit :

* **En dessous de 91 %** -- Fonctionnement normal, aucune limitation
* **91–95 %** -- Début de la limitation en cas de manque d'espace (10 ms de latence ajoutées)
* **96%+** -- Limitation critique (50 ms de latence ajoutées) avec une grave dégradation des performances

Surveillez de manière proactive la capacité des niveaux et configurez des alertes avant d'atteindre ces seuils.
{% endhint %}

## État du réseau

L'état du réseau est surveillé depuis **Réseaux** dans la navigation principale. Pour chaque réseau (externe, interne, DMZ, réseaux de locataires), vous pouvez voir :

* **État de connectivité** -- Si le réseau est opérationnel et joignable
* **Statistiques de trafic** -- Volume et débits RX/TX par réseau
* **Machines connectées** -- Quelles VM et quels services sont connectés
* **Nombre d'occurrences des règles de pare-feu** -- Activité sur les règles de pare-feu configurées
* **Journaux spécifiques au réseau** -- Événements limités à ce réseau particulier

## Vue des machines en cours d'exécution

Chaque tableau de bord de nœud comprend une **Machines en cours d'exécution** section affichant toutes les charges de travail actives :

| Colonne               | Description                                          |
| --------------------- | ---------------------------------------------------- |
| **Statut**            | Indicateur d'état d'exécution                        |
| **Type**              | Machine virtuelle, conteneur vNet ou service système |
| **Nom**               | Identifiant de la machine                            |
| **Cœurs CPU**         | Nombre de cœurs attribués                            |
| **Utilisation CPU**   | Pourcentage d'utilisation actuel du processeur       |
| **RAM**               | Mémoire allouée avec pourcentage d'utilisation       |
| **Dernier démarrage** | Horodatage du démarrage de la charge de travail      |

Les types de machines courants incluent les VM, les conteneurs vNet (services réseau) et les services système (NAS, DMZ, réseau externe, etc.).

{% hint style="info" %}
**Vous venez de VMware ou de Nutanix ?**

Dans VergeOS, le matériel des nœuds, les ressources du cluster, l'état du stockage, l'état du réseau et les métriques des charges de travail vivent tous dans la même interface intégrée -- pas de serveur de gestion séparé, de suite de supervision ou de CLI à installer pour la visibilité quotidienne.
{% endhint %}

## Bonnes pratiques

### Vérifications quotidiennes de l'état

Examinez les températures des nœuds, les compteurs d'erreurs des disques et l'état du fabric sur tous les nœuds. Traitez immédiatement toute NIC de fabric présentant **Aucun chemin** ou **Dégradé**, ou une augmentation des erreurs de disque, immédiatement.

### Utiliser le mode maintenance

Activez toujours le mode maintenance avant des modifications matérielles, des mises à jour du firmware ou des mises à jour système. Les charges de travail éligibles sont migrées à chaud avant que vous n'interveniez sur le nœud ; les VM qui ne peuvent pas être migrées à chaud (passthrough GPU, type de CPU host-passthrough, passthrough USB, SR-IOV) doivent être arrêtées.

### Surveiller la capacité du vSAN

Gardez l'utilisation des niveaux sous 85 % pour conserver une marge de performance. Configurez des alertes d'abonnement (couverts dans la section suivante) pour être averti avant d'atteindre les seuils de limitation.

### Consulter régulièrement les journaux

Vérifiez périodiquement les journaux d'événements pour les avertissements de température, les erreurs de disque et les changements d'état inattendus. Détecter les problèmes tôt évite les défaillances en cascade.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/learn-the-platform/fr/module-9-supervision-et-depannage/01-dashboard-health.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
