Lab : supervision et dépannage
Explorer le tableau de bord VergeOS, configurer des alertes, analyser les journaux système et s’exercer au diagnostic des problèmes courants.
Objectif
Mettez en pratique la surveillance de l’état de santé de l’infrastructure VergeOS, la configuration des alertes, l’analyse des journaux système et le diagnostic des problèmes courants. À la fin de ce laboratoire, vous serez à l’aise pour naviguer dans les outils de surveillance VergeOS et suivre un flux de travail structuré de résolution des problèmes.
Prérequis
Module 1 terminé : Fondamentaux de l'architecture
Module 4 terminé : Mise en réseau
Module 5 terminé : Stockage
Lecture du module 9 terminée (Tableau de bord, Alertes, Diagnostics, Escalade)
Un cluster VergeOS en cours d’exécution avec accès administrateur
Difficulté
Intermédiaire -- Nécessite une familiarité avec l’interface utilisateur VergeOS et les concepts de base de l’administration système
Temps estimé
1,5 heure
Étapes
Partie 1 : Exploration du tableau de bord
Familiarisez-vous avec le tableau de bord de surveillance VergeOS.
Connectez-vous à l’interface utilisateur VergeOS avec des identifiants administrateur
Accédez au tableau de bord principal et identifiez :
Indicateurs d’état des nœuds (en ligne, hors ligne, maintenance)
Graphiques d’utilisation du processeur, de la mémoire et du stockage
État de la connectivité réseau
Alertes et notifications actives
Accédez à la page de détails d’un nœud individuel
Consultez l’aperçu de l’état de santé du cluster et identifiez les métriques clés
Examinez l’état du pool de stockage et vérifiez que tous les disques sont en bon état
Consignez la base de référence actuelle de l’utilisation des ressources de votre cluster
Partie 2 : Configuration des alertes
Configurez des alertes et des règles de notification.
Accédez à la section de configuration des alertes (Système → Abonnements)
Examinez les règles d’abonnement existantes et leurs critères d’alerte configurés
Créez une alerte d’abonnement personnalisée pour :
Utilisation élevée du processeur (>85 % soutenue)
Capacité de stockage faible (moins de 20 % d’espace libre)
Perte de connectivité d’un nœud
Configurez un canal de notification (e-mail via SMTP, ou un webhook pour des intégrations comme Slack)
Testez la notification d’alerte en déclenchant un seuil (si possible dans votre environnement de laboratoire)
Configurez le transfert des journaux vers un serveur syslog externe (ou un collecteur de journaux local)
Partie 3 : Analyse des journaux et diagnostics
Entraînez-vous à analyser les journaux système et à utiliser les outils de diagnostic.
Accédez à la section des journaux système
Filtrez les journaux par niveau de gravité (Critique, Erreur, Avertissement, Message)
Recherchez des événements spécifiques liés à :
Opérations de VM (démarrage, arrêt, migration)
Événements de stockage (erreurs de disque, rééquilibrage)
Événements réseau (changements d’état de liaison)
Identifiez les schémas d’erreurs courants et leurs causes probables
Utilisez les outils de diagnostic intégrés pour vérifier :
L’état de santé du sous-système de stockage
La connectivité réseau entre les nœuds
L’état des services à l’échelle du cluster
Entraînez-vous à générer un bundle de diagnostic pour l’escalade au support
Partie 4 : Scénarios de dépannage
Diagnostiquez des problèmes simulés à l’aide des outils que vous avez appris.
Scénario A : Performances lentes d’une VM -- Un utilisateur signale qu’une VM fonctionne lentement. Utilisez le tableau de bord et les journaux pour :
Vérifier l’allocation et l’utilisation des ressources de la VM
Identifier si le nœud hôte est surchargé
Vérifier la latence d’E/S du stockage
Recommander une solution
Scénario B : Problème de connectivité réseau -- Un locataire signale qu’il ne peut pas atteindre les réseaux externes. Enquêtez :
Configuration du réseau du locataire
Connectivité de la couche réseau virtuelle
État du réseau physique sur les nœuds hôtes
Identifiez la cause racine et la solution
Scénario C : Alerte de stockage -- Le système génère un avertissement de capacité de stockage. Déterminez :
Quel pool de stockage est concerné
Qu’est-ce qui consomme le plus d’espace
Actions recommandées (nettoyage, विस्तार, ou migration)
Vérification
Votre laboratoire de surveillance et de dépannage est terminé lorsque vous pouvez répondre oui à tout ce qui suit :
Mis à jour
Ce contenu vous a-t-il été utile ?