For the complete documentation index, see llms.txt. This page is also available as Markdown.

Lab : supervision et dépannage

Explorer le tableau de bord VergeOS, configurer des alertes, analyser les journaux système et s’exercer au diagnostic des problèmes courants.

Objectif

Mettez en pratique la surveillance de l’état de santé de l’infrastructure VergeOS, la configuration des alertes, l’analyse des journaux système et le diagnostic des problèmes courants. À la fin de ce laboratoire, vous serez à l’aise pour naviguer dans les outils de surveillance VergeOS et suivre un flux de travail structuré de résolution des problèmes.

Prérequis

  • Module 1 terminé : Fondamentaux de l'architecture

  • Module 4 terminé : Mise en réseau

  • Module 5 terminé : Stockage

  • Lecture du module 9 terminée (Tableau de bord, Alertes, Diagnostics, Escalade)

  • Un cluster VergeOS en cours d’exécution avec accès administrateur

Difficulté

Intermédiaire -- Nécessite une familiarité avec l’interface utilisateur VergeOS et les concepts de base de l’administration système

Temps estimé

1,5 heure

Étapes

Partie 1 : Exploration du tableau de bord

Familiarisez-vous avec le tableau de bord de surveillance VergeOS.

  1. Connectez-vous à l’interface utilisateur VergeOS avec des identifiants administrateur

  2. Accédez au tableau de bord principal et identifiez :

    • Indicateurs d’état des nœuds (en ligne, hors ligne, maintenance)

    • Graphiques d’utilisation du processeur, de la mémoire et du stockage

    • État de la connectivité réseau

    • Alertes et notifications actives

  3. Accédez à la page de détails d’un nœud individuel

  4. Consultez l’aperçu de l’état de santé du cluster et identifiez les métriques clés

  5. Examinez l’état du pool de stockage et vérifiez que tous les disques sont en bon état

  6. Consignez la base de référence actuelle de l’utilisation des ressources de votre cluster

Partie 2 : Configuration des alertes

Configurez des alertes et des règles de notification.

  1. Accédez à la section de configuration des alertes (Système → Abonnements)

  2. Examinez les règles d’abonnement existantes et leurs critères d’alerte configurés

  3. Créez une alerte d’abonnement personnalisée pour :

    • Utilisation élevée du processeur (>85 % soutenue)

    • Capacité de stockage faible (moins de 20 % d’espace libre)

    • Perte de connectivité d’un nœud

  4. Configurez un canal de notification (e-mail via SMTP, ou un webhook pour des intégrations comme Slack)

  5. Testez la notification d’alerte en déclenchant un seuil (si possible dans votre environnement de laboratoire)

  6. Configurez le transfert des journaux vers un serveur syslog externe (ou un collecteur de journaux local)

Partie 3 : Analyse des journaux et diagnostics

Entraînez-vous à analyser les journaux système et à utiliser les outils de diagnostic.

  1. Accédez à la section des journaux système

  2. Filtrez les journaux par niveau de gravité (Critique, Erreur, Avertissement, Message)

  3. Recherchez des événements spécifiques liés à :

    • Opérations de VM (démarrage, arrêt, migration)

    • Événements de stockage (erreurs de disque, rééquilibrage)

    • Événements réseau (changements d’état de liaison)

  4. Identifiez les schémas d’erreurs courants et leurs causes probables

  5. Utilisez les outils de diagnostic intégrés pour vérifier :

    • L’état de santé du sous-système de stockage

    • La connectivité réseau entre les nœuds

    • L’état des services à l’échelle du cluster

  6. Entraînez-vous à générer un bundle de diagnostic pour l’escalade au support

Partie 4 : Scénarios de dépannage

Diagnostiquez des problèmes simulés à l’aide des outils que vous avez appris.

  1. Scénario A : Performances lentes d’une VM -- Un utilisateur signale qu’une VM fonctionne lentement. Utilisez le tableau de bord et les journaux pour :

    • Vérifier l’allocation et l’utilisation des ressources de la VM

    • Identifier si le nœud hôte est surchargé

    • Vérifier la latence d’E/S du stockage

    • Recommander une solution

  2. Scénario B : Problème de connectivité réseau -- Un locataire signale qu’il ne peut pas atteindre les réseaux externes. Enquêtez :

    • Configuration du réseau du locataire

    • Connectivité de la couche réseau virtuelle

    • État du réseau physique sur les nœuds hôtes

    • Identifiez la cause racine et la solution

  3. Scénario C : Alerte de stockage -- Le système génère un avertissement de capacité de stockage. Déterminez :

    • Quel pool de stockage est concerné

    • Qu’est-ce qui consomme le plus d’espace

    • Actions recommandées (nettoyage, विस्तार, ou migration)

Vérification

Votre laboratoire de surveillance et de dépannage est terminé lorsque vous pouvez répondre oui à tout ce qui suit :

Mis à jour

Ce contenu vous a-t-il été utile ?