Supervision du stockage et dépannage
Maîtriser les diagnostics vSAN, l’intégration Fibre Channel, le dépannage NAS et les stratégies de maintenance préventive dans VergeOS.
Pourquoi la surveillance du stockage est importante
Le stockage est la base de chaque charge de travail dans VergeOS. Un disque dégradé, un niveau saturé ou une erreur d'intégrité passée inaperçue peut entraîner en cascade des problèmes de performances des VM, des instantanés échoués et des plaintes des locataires. VergeOS fournit des outils de diagnostic intégrés à deux niveaux -- des diagnostics vSAN pour le moteur de stockage distribué au niveau bloc, et des diagnostics NAS pour chaque instance de service de partage de fichiers -- afin que vous puissiez détecter, diagnostiquer et résoudre les problèmes avant qu'ils n'impactent la production.
Diagnostics vSAN
L'interface Diagnostics vSAN fournit un accès en temps réel à l'état interne du moteur de stockage VergeFS. Chaque diagnostic est exécuté depuis la Requête liste déroulante de l'interface Diagnostics vSAN.
Accéder aux diagnostics vSAN
Accédez à Système → Diagnostics vSAN depuis le menu supérieur
Sinon : depuis le tableau de bord principal, cliquez sur le compteur Niveaux vSAN → Diagnostics vSAN dans le menu de gauche
Sélectionnez une commande dans la Requête liste déroulante, configurez les paramètres à droite, puis cliquez sur Envoyer →
Niveau racine uniquement
Les diagnostics vSAN ne sont disponibles qu'au niveau racine/parent. Les locataires n'ont pas accès aux outils de diagnostic vSAN -- ils doivent demander les diagnostics via le fournisseur.
Référence des commandes de diagnostic
Les diagnostics suivants sont disponibles dans la Requête liste déroulante de l'interface Diagnostics vSAN, regroupés par domaine de focus.
Cluster et performances
Obtenir les taux du cluster
Métriques de débit et d'IOPS à l'échelle du cluster
Obtenir l'utilisation du cluster
Utilisation globale du stockage et capacité
Obtenir les principaux taux d'utilisation
Identifier les principaux consommateurs d'E/S de stockage
Obtenir l'utilisation
Statistiques complètes d'utilisation du vSAN
Obtenir les informations du cache
Ratios cache hit/miss et utilisation de la mémoire
Obtenir la lecture anticipée
Configuration et statistiques du cache de lecture anticipée
Obtenir le maître actuel
Identifier le nœud maître vSAN actuel
Périphérique et nœud
Obtenir la liste des périphériques
Tous les périphériques de stockage du vSAN
Obtenir l'état du périphérique
État de santé et état d'un périphérique spécifique
Obtenir l'utilisation du périphérique
Données d'utilisation et d'usure par périphérique
Obtenir la liste des nœuds
Tous les nœuds participant au vSAN
Obtenir les informations du nœud
Informations détaillées pour un nœud spécifique
Obtenir la liste des périphériques du nœud
Périphériques attachés à un nœud spécifique
Niveau et volume
Obtenir l'état du niveau
État de santé et capacité par niveau de stockage
Obtenir les cartes des périphériques par niveau
Comment les périphériques sont répartis entre les niveaux
Obtenir les cartes des nœuds par niveau
Comment les niveaux se répartissent entre les nœuds
Obtenir l'utilisation du volume
Consommation de stockage par volume
Résumer l'utilisation des disques
Résumé de l'utilisation des disques à l'échelle du cluster
Intégrité et réparation
Vérification d'intégrité
Lancer une vérification d'intégrité complète
Vérification d'intégrité du périphérique
Vérification d'intégrité sur un périphérique spécifique
Obtenir l'état de la vérification d'intégrité
Progression/résultats des vérifications d'intégrité
Obtenir l'état des réparations
Opérations actives de réparation et de reconstruction
Obtenir la liste de synchronisation
Connexions actives de synchronisation de site (réplication)
Système de fichiers et configuration
Trouver l'inode
Localiser un inode spécifique pour l'analyse
Obtenir le chemin à partir de l'inode
Résoudre un numéro d'inode en un chemin
Obtenir l'état du fichier
Réplication et intégrité d'un fichier
Obtenir les informations FUSE
Détails du montage et de l'opération FUSE
Obtenir l'état du journal
État du journal en écriture anticipée
Obtenir la configuration en cours
Configuration vSAN actuellement en cours d'exécution
Obtenir les clients
Connexions clientes vSAN actives
Flux de travail de surveillance de l'état
Suivez cette approche systématique lors de l'analyse de l'état du stockage -- commencez large et descendez vers les composants spécifiques.
Flux de travail étape par étape
Vue d'ensemble du système -- Exécutez
Obtenir l'utilisation du clusteretObtenir les taux du clusterpour comprendre l'état global, la capacité et le débitAnalyse des performances -- Vérifiez
Obtenir les principaux taux d'utilisationpour trouver les volumes très sollicités, puisObtenir les informations du cachepour les taux de réussite du cacheÉvaluation de l'état -- Vérifiez
Obtenir l'état des réparationsqu'il affiche tous des zéros (aucune réparation active) etObtenir l'état de la vérification d'intégritépour les résultats récentsPlanification de la capacité -- Utilisez
Résumer l'utilisation des disquespour une vue à l'échelle du cluster etObtenir l'état du niveaupour la capacité par niveauDépannage ciblé -- Détaillez les périphériques spécifiques (
Obtenir l'état du périphérique) ou les nœuds (Obtenir les informations du nœud) en fonction des résultats
Modèles de dépannage
Problèmes de performances
Symptômes : Latence élevée des VM, opérations d'instantané lentes, plaintes des locataires concernant la vitesse du disque.
Cochez Obtenir les taux du cluster pour le débit agrégé -- les taux sont-ils inférieurs à la référence ?
Consultez Obtenir les informations du cache -- des taux d'atteinte faibles indiquent que l'ensemble de travail dépasse le cache disponible
Examinez Obtenir les principaux taux d'utilisation pour identifier les volumes qui consomment le plus d'E/S
Cochez Obtenir l'utilisation du périphérique sur les disques individuels pour une répartition inégale de la charge
Vérifiez Obtenir l'état du journal -- un journal encombré indique une pression d'écriture soutenue
Problèmes de capacité
Symptômes : Alertes de "manque d'espace", impossibilité de créer des instantanés, écritures lentes en raison du bridage.
Exécutez Obtenir l'utilisation du cluster et Résumer l'utilisation des disques pour l'analyse globale de l'espace
Cochez Obtenir l'état du niveau pour la capacité par niveau -- un seul niveau plein peut provoquer des problèmes même si les autres ont de l'espace
Utilisez Obtenir l'utilisation du volume sur les plus grands volumes pour identifier les candidats à la croissance
Passez en revue les politiques de rétention des instantanés -- les anciens instantanés référençant des blocs modifiés consomment beaucoup d'espace
Problèmes d'intégrité des données
Symptômes : Avertissements de somme de contrôle dans les journaux, corruption suspectée après des événements matériels.
Cochez Obtenir l'état de la vérification d'intégrité pour les résultats récents de la vérification d'intégrité
Consultez Obtenir l'état des réparations pour toute reconstruction de données active
Utilisez Obtenir l'état du fichier sur des fichiers spécifiques pour vérifier leur état de réplication
Si nécessaire, exécutez Vérification d'intégrité pour lancer une analyse complète (à planifier pendant les fenêtres de maintenance)
Impact de la vérification d'intégrité
Les vérifications d'intégrité complètes peuvent avoir un impact important sur les performances du système. Programmez-les toujours pendant les fenêtres de maintenance et surveillez la charge du système pendant leur exécution.
Problèmes d'état du cluster
Symptômes : Alertes de nœud hors ligne, basculement inattendu du maître, risques de split-brain.
Vérifiez Obtenir le maître actuel pour confirmer quel nœud dirige le vSAN
Cochez Obtenir la liste des nœuds et Obtenir les informations du nœud pour l'état de chaque nœud
Consultez Obtenir l'état des réparations pour la re-réplication active des blocs qui indique qu'un nœud a été temporairement déconnecté
Examinez Obtenir les clients pour des modèles de connexion inattendus
Problèmes de périphériques
Symptômes : Avertissements SMART, erreurs de disques individuels, performances inégales entre les nœuds.
Exécutez Obtenir la liste des périphériques et Obtenir l'état du périphérique pour identifier les périphériques dégradés ou défaillants
Cochez Obtenir la liste des périphériques du nœud pour l'inventaire complet des périphériques du nœud concerné
Exécutez Vérification d'intégrité du périphérique sur les disques suspects
Faites une vérification croisée avec les données SMART capturées dans le lot Diagnostics système (collectées par nœud par l'outil de diagnostic)
Maintenance préventive
La surveillance proactive évite les mauvaises surprises. Établissez un rythme régulier pour ces vérifications :
Quotidien
Passez en revue l'utilisation du cluster et la capacité des niveaux - Vérifiez les réparations actives (elles doivent être nulles en régime stable) - Vérifiez qu'il n'y a aucune alerte liée au stockage dans le tableau de bord
Hebdomadaire
Exécutez les taux du cluster pour établir des références de performances - Consultez les principaux taux d'utilisation pour suivre les tendances de croissance - Vérifiez les taux d'atteinte du cache et ajustez si nécessaire
Mensuel
Planifiez les vérifications d'intégrité pendant les fenêtres de maintenance - Passez en revue l'état des périphériques et les données SMART - Analysez les tendances de capacité pour la planification des achats
Intégration Fibre Channel
Le vSAN VergeOS prend en charge les LUN Fibre Channel (FC) comme périphériques de stockage dans son architecture à niveaux, ce qui permet l'intégration avec l'infrastructure SAN existante.
Principes clés
Les LUN FC sont traitées de la même manière que les disques physiques -- VergeOS ne fait aucune distinction une fois qu'elles sont attribuées à un niveau
Chaque nœud doit recevoir ses propres LUN uniques -- ne présentez pas la même LUN à plusieurs nœuds (contrairement au clustering traditionnel à stockage partagé)
Le niveau 0 nécessite toujours des disques NVMe/SSD physiques dans les nœuds pour le stockage des métadonnées
Désactivez le RAID et la hiérarchisation automatique sur le SAN pour les LUN utilisées par VergeOS -- le vSAN gère la redondance nativement
multichemin actif/passif avec un délai de basculement de 7 secondes ; VergeOS sélectionne automatiquement le chemin optimal
Quand utiliser FC par rapport aux disques physiques
Verge recommande des disques physiques directement attachés aux nœuds pour la plupart des déploiements. L'intégration FC convient lorsque vous disposez d'investissements SAN existants ou d'exigences de conformité spécifiques. Les disques physiques offrent une configuration plus simple, de meilleures performances (sans surcharge SAN), moins de points de défaillance et un coût inférieur.
Diagnostics NAS
Chaque instance de service NAS possède sa propre interface de diagnostic, distincte des diagnostics vSAN. Les diagnostics NAS se concentrent sur les protocoles de partage de fichiers, la connectivité réseau et l'authentification.
Accéder aux diagnostics NAS
Accédez à NAS → Liste depuis le menu supérieur
Double-cliquez sur le service NAS souhaité
Cliquez sur Diagnostics dans le menu de gauche
Sélectionnez une commande dans la Requête de diagnostic liste déroulante et cliquez sur Envoyer →
Principales commandes de diagnostic NAS
SMB/CIFS
smbstatus, testparm, smbclient -L localhost
Connexions actives, validation de la configuration, liste des partages
NFS
exportfs -v, rpcinfo -p, showmount -e
Liste des exports, services RPC, vérification du montage
Active Directory
wbinfo -t, wbinfo -u, wbinfo -g
Vérification de la relation d'approbation, utilisateurs du domaine, groupes du domaine
Réseau
Ping, traceroute, balayage ARP, recherche DNS
Connectivité, routage, découverte des voisins
Performance
Utilisation CPU maximale, utilisation réseau maximale, capture TCP
Utilisation des ressources et analyse du trafic
Journalisation
Journaux (journalctl, journaux Samba)
Analyse des erreurs et surveillance des événements
Flux de travail de surveillance de l'état du NAS
État du service -- Vérifiez les services et l'état spécifique au protocole (Samba/NFS)
Connectivité réseau -- Vérifiez avec Ping et la configuration de l'interface
Authentification -- Testez les utilisateurs, les groupes et Winbind (pour les environnements AD)
Performance -- Surveillez l'utilisation CPU maximale et l'utilisation réseau maximale
Journaux -- Consultez les journaux de service pour détecter des erreurs ou des avertissements
Problèmes NAS courants et solutions
Windows : Impossible de se connecter aux partages CIFS
Cause : Windows 10/11 et Server 2016+ désactivent par défaut les connexions invité non sécurisées, bloquant l'accès aux partages qui autorisent l'accès anonyme.
Correctif : Activez les connexions invité non sécurisées via la stratégie de groupe :
Ouvrez
gpedit.msc→ Configuration de l'ordinateur → Modèles d'administration → Réseau → Lanman WorkstationDéfinissez Activer les connexions invité non sécurisées vers Activé
Redémarrez l'appareil Windows
macOS : Échecs de connexion SMB
Cause : Les paramètres par défaut de macOS peuvent entrer en conflit avec la version du protocole SMB du serveur ou manquer d'extensions spécifiques à Apple.
Correctif (côté client) : Forcez SMB3 dans /etc/nsmb.conf:
Videz le cache SMB (sudo rm -rf /var/db/samba/* /var/db/smb/*) puis redémarrez.
Correctif (côté serveur) : Ajoutez les paramètres du module fruit Apple/Samba sous NAS → CIFS → Options de configuration avancées:
Accès refusé sur les partages CIFS
Cause : Autorisations utilisateur/groupe incorrectes ou configuration de partage incorrecte.
Correctif :
Vérifiez que l'utilisateur a accès dans la liste des utilisateurs du service NAS
Vérifiez les paramètres du partage : assurez-vous Navigable est activé et que l'utilisateur figure dans la Utilisateurs valides liste
Si vous utilisez Forcer l'utilisateur ou Forcer le groupe options, confirmez que l'identité forcée dispose des autorisations de système de fichiers correctes
Performances CIFS lentes
Cause : Incompatibilité de version du protocole SMB, problèmes réseau ou configuration sous-optimale.
Correctif :
Vérifiez la stabilité du réseau avec les diagnostics NAS Ping et Trace de route commandes
Vérifiez la version du protocole SMB sous NAS → Volumes → Options de configuration avancées -- assurez-vous que SMB2 ou SMB3 est utilisé
Surveillez avec Utilisation réseau maximale dans les diagnostics NAS pour détecter une saturation de la bande passante
Contactez le support VergeOS pour des paramètres avancés de réglage Samba si les optimisations standard sont insuffisantes
Premiers pas
Explorez les diagnostics vSAN
Accédez à Système → Diagnostics vSAN, exécutez Obtenir l'utilisation du cluster et Obtenir les taux du cluster pour établir votre référence.
Vérifiez l’état de santé du NAS
Ouvrez la page Diagnostics de chaque service NAS. Exécutez Samba pour voir les connexions actives et NFS pour vérifier les exports. Examinez Journaux les erreurs récentes.
Consultez le guide de diagnostic
Lisez le Guide de diagnostic vSAN et Guide de diagnostic NAS dans la documentation officielle.
Mis à jour
Ce contenu vous a-t-il été utile ?