> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/learn-the-platform/fr/module-9-supervision-et-depannage/lab.md).

# Atelier : Supervision et dépannage

## Objectif

Mettez en pratique la surveillance de l’état de santé de l’infrastructure VergeOS, la configuration des alertes, l’analyse des journaux système et le diagnostic des problèmes courants. À la fin de ce laboratoire, vous serez à l’aise pour naviguer dans les outils de surveillance VergeOS et suivre un flux de travail structuré de résolution des problèmes.

## Prérequis

* Module 1 terminé : Fondamentaux de l'architecture
* Module 4 terminé : Mise en réseau
* Module 5 terminé : Stockage
* Lecture du module 9 terminée (Tableau de bord, Alertes, Diagnostics, Escalade)
* Un cluster VergeOS en cours d’exécution avec accès administrateur

## Difficulté

**Intermédiaire** -- Nécessite une familiarité avec l’interface utilisateur VergeOS et les concepts de base de l’administration système

## Temps estimé

**1,5 heure**

## Étapes

### Partie 1 : Exploration du tableau de bord

Familiarisez-vous avec le tableau de bord de surveillance VergeOS.

1. Connectez-vous à l’interface utilisateur VergeOS avec des identifiants administrateur
2. Accédez au tableau de bord principal et identifiez :
   * Indicateurs d’état des nœuds (en ligne, hors ligne, maintenance)
   * Graphiques d’utilisation du processeur, de la mémoire et du stockage
   * État de la connectivité réseau
   * Alertes et notifications actives
3. Accédez à la page de détails d’un nœud individuel
4. Consultez l’aperçu de l’état de santé du cluster et identifiez les métriques clés
5. Examinez l’état du pool de stockage et vérifiez que tous les disques sont en bon état
6. Consignez la base de référence actuelle de l’utilisation des ressources de votre cluster

### Partie 2 : Configuration des alertes

Configurez des alertes et des règles de notification.

1. Accédez à la section de configuration des alertes (Système → Abonnements)
2. Examinez les règles d’abonnement existantes et leurs critères d’alerte configurés
3. Créez une alerte d’abonnement personnalisée pour :
   * Utilisation élevée du processeur (>85 % soutenue)
   * Capacité de stockage faible (moins de 20 % d’espace libre)
   * Perte de connectivité d’un nœud
4. Configurez un canal de notification (e-mail via SMTP, ou un webhook pour des intégrations comme Slack)
5. Testez la notification d’alerte en déclenchant un seuil (si possible dans votre environnement de laboratoire)
6. Configurez le transfert des journaux vers un serveur syslog externe (ou un collecteur de journaux local)

### Partie 3 : Analyse des journaux et diagnostics

Entraînez-vous à analyser les journaux système et à utiliser les outils de diagnostic.

1. Accédez à la section des journaux système
2. Filtrez les journaux par niveau de gravité (Critique, Erreur, Avertissement, Message)
3. Recherchez des événements spécifiques liés à :
   * Opérations de VM (démarrage, arrêt, migration)
   * Événements de stockage (erreurs de disque, rééquilibrage)
   * Événements réseau (changements d’état de liaison)
4. Identifiez les schémas d’erreurs courants et leurs causes probables
5. Utilisez les outils de diagnostic intégrés pour vérifier :
   * L’état de santé du sous-système de stockage
   * La connectivité réseau entre les nœuds
   * L’état des services à l’échelle du cluster
6. Entraînez-vous à générer un bundle de diagnostic pour l’escalade au support

### Partie 4 : Scénarios de dépannage

Diagnostiquez des problèmes simulés à l’aide des outils que vous avez appris.

1. **Scénario A : Performances lentes d’une VM** -- Un utilisateur signale qu’une VM fonctionne lentement. Utilisez le tableau de bord et les journaux pour :
   * Vérifier l’allocation et l’utilisation des ressources de la VM
   * Identifier si le nœud hôte est surchargé
   * Vérifier la latence d’E/S du stockage
   * Recommander une solution
2. **Scénario B : Problème de connectivité réseau** -- Un locataire signale qu’il ne peut pas atteindre les réseaux externes. Enquêtez :
   * Configuration du réseau du locataire
   * Connectivité de la couche réseau virtuelle
   * État du réseau physique sur les nœuds hôtes
   * Identifiez la cause racine et la solution
3. **Scénario C : Alerte de stockage** -- Le système génère un avertissement de capacité de stockage. Déterminez :
   * Quel pool de stockage est concerné
   * Qu’est-ce qui consomme le plus d’espace
   * Actions recommandées (nettoyage, विस्तार, ou migration)

## Vérification

Votre laboratoire de surveillance et de dépannage est terminé lorsque vous pouvez répondre **oui** à tout ce qui suit :

* [ ] A navigué avec succès dans le tableau de bord VergeOS et identifié les principales métriques de santé
* [ ] Créé des règles d’alerte personnalisées avec des seuils appropriés
* [ ] Configuré au moins un canal de notification (e-mail ou webhook)
* [ ] Filtré et recherché dans les journaux système pour trouver des événements spécifiques
* [ ] Utilisé les outils de diagnostic pour vérifier l’état du stockage, du réseau et des services
* [ ] Traité au moins deux scénarios de dépannage et identifié les causes racines
* [ ] Généré un bundle de diagnostic adapté à l’escalade au support


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/learn-the-platform/fr/module-9-supervision-et-depannage/lab.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
