For the complete documentation index, see llms.txt. This page is also available as Markdown.

Supervision du stockage et dépannage

Maîtriser les diagnostics vSAN, l’intégration Fibre Channel, le dépannage NAS et les stratégies de maintenance préventive dans VergeOS.

Pourquoi la surveillance du stockage est importante

Le stockage est la base de chaque charge de travail dans VergeOS. Un disque dégradé, un niveau saturé ou une erreur d'intégrité passée inaperçue peut entraîner en cascade des problèmes de performances des VM, des instantanés échoués et des plaintes des locataires. VergeOS fournit des outils de diagnostic intégrés à deux niveaux -- des diagnostics vSAN pour le moteur de stockage distribué au niveau bloc, et des diagnostics NAS pour chaque instance de service de partage de fichiers -- afin que vous puissiez détecter, diagnostiquer et résoudre les problèmes avant qu'ils n'impactent la production.

Diagnostics vSAN

L'interface Diagnostics vSAN fournit un accès en temps réel à l'état interne du moteur de stockage VergeFS. Chaque diagnostic est exécuté depuis la Requête liste déroulante de l'interface Diagnostics vSAN.

Accéder aux diagnostics vSAN

  1. Accédez à Système → Diagnostics vSAN depuis le menu supérieur

  2. Sinon : depuis le tableau de bord principal, cliquez sur le compteur Niveaux vSANDiagnostics vSAN dans le menu de gauche

  3. Sélectionnez une commande dans la Requête liste déroulante, configurez les paramètres à droite, puis cliquez sur Envoyer →

Référence des commandes de diagnostic

Les diagnostics suivants sont disponibles dans la Requête liste déroulante de l'interface Diagnostics vSAN, regroupés par domaine de focus.

Cluster et performances

Commande
Rôle

Obtenir les taux du cluster

Métriques de débit et d'IOPS à l'échelle du cluster

Obtenir l'utilisation du cluster

Utilisation globale du stockage et capacité

Obtenir les principaux taux d'utilisation

Identifier les principaux consommateurs d'E/S de stockage

Obtenir l'utilisation

Statistiques complètes d'utilisation du vSAN

Obtenir les informations du cache

Ratios cache hit/miss et utilisation de la mémoire

Obtenir la lecture anticipée

Configuration et statistiques du cache de lecture anticipée

Obtenir le maître actuel

Identifier le nœud maître vSAN actuel

Périphérique et nœud

Commande
Rôle

Obtenir la liste des périphériques

Tous les périphériques de stockage du vSAN

Obtenir l'état du périphérique

État de santé et état d'un périphérique spécifique

Obtenir l'utilisation du périphérique

Données d'utilisation et d'usure par périphérique

Obtenir la liste des nœuds

Tous les nœuds participant au vSAN

Obtenir les informations du nœud

Informations détaillées pour un nœud spécifique

Obtenir la liste des périphériques du nœud

Périphériques attachés à un nœud spécifique

Niveau et volume

Commande
Rôle

Obtenir l'état du niveau

État de santé et capacité par niveau de stockage

Obtenir les cartes des périphériques par niveau

Comment les périphériques sont répartis entre les niveaux

Obtenir les cartes des nœuds par niveau

Comment les niveaux se répartissent entre les nœuds

Obtenir l'utilisation du volume

Consommation de stockage par volume

Résumer l'utilisation des disques

Résumé de l'utilisation des disques à l'échelle du cluster

Intégrité et réparation

Commande
Rôle

Vérification d'intégrité

Lancer une vérification d'intégrité complète

Vérification d'intégrité du périphérique

Vérification d'intégrité sur un périphérique spécifique

Obtenir l'état de la vérification d'intégrité

Progression/résultats des vérifications d'intégrité

Obtenir l'état des réparations

Opérations actives de réparation et de reconstruction

Obtenir la liste de synchronisation

Connexions actives de synchronisation de site (réplication)

Système de fichiers et configuration

Commande
Rôle

Trouver l'inode

Localiser un inode spécifique pour l'analyse

Obtenir le chemin à partir de l'inode

Résoudre un numéro d'inode en un chemin

Obtenir l'état du fichier

Réplication et intégrité d'un fichier

Obtenir les informations FUSE

Détails du montage et de l'opération FUSE

Obtenir l'état du journal

État du journal en écriture anticipée

Obtenir la configuration en cours

Configuration vSAN actuellement en cours d'exécution

Obtenir les clients

Connexions clientes vSAN actives

Flux de travail de surveillance de l'état

Suivez cette approche systématique lors de l'analyse de l'état du stockage -- commencez large et descendez vers les composants spécifiques.

Flux de travail étape par étape

  1. Vue d'ensemble du système -- Exécutez Obtenir l'utilisation du cluster et Obtenir les taux du cluster pour comprendre l'état global, la capacité et le débit

  2. Analyse des performances -- Vérifiez Obtenir les principaux taux d'utilisation pour trouver les volumes très sollicités, puis Obtenir les informations du cache pour les taux de réussite du cache

  3. Évaluation de l'état -- Vérifiez Obtenir l'état des réparations qu'il affiche tous des zéros (aucune réparation active) et Obtenir l'état de la vérification d'intégrité pour les résultats récents

  4. Planification de la capacité -- Utilisez Résumer l'utilisation des disques pour une vue à l'échelle du cluster et Obtenir l'état du niveau pour la capacité par niveau

  5. Dépannage ciblé -- Détaillez les périphériques spécifiques (Obtenir l'état du périphérique) ou les nœuds (Obtenir les informations du nœud) en fonction des résultats

Modèles de dépannage

Problèmes de performances

Symptômes : Latence élevée des VM, opérations d'instantané lentes, plaintes des locataires concernant la vitesse du disque.

  1. Cochez Obtenir les taux du cluster pour le débit agrégé -- les taux sont-ils inférieurs à la référence ?

  2. Consultez Obtenir les informations du cache -- des taux d'atteinte faibles indiquent que l'ensemble de travail dépasse le cache disponible

  3. Examinez Obtenir les principaux taux d'utilisation pour identifier les volumes qui consomment le plus d'E/S

  4. Cochez Obtenir l'utilisation du périphérique sur les disques individuels pour une répartition inégale de la charge

  5. Vérifiez Obtenir l'état du journal -- un journal encombré indique une pression d'écriture soutenue

Bridage du stockage

VergeOS applique un bridage progressif des E/S en fonction de l'utilisation de la capacité : fonctionnement normal en dessous de 91 %, bridage léger (10 ms ajoutées) entre 91 et 95 %, et bridage critique (50 ms ajoutées) au-dessus de 96 %. Vérifiez l'utilisation du niveau si les performances se dégradent soudainement.

Problèmes de capacité

Symptômes : Alertes de "manque d'espace", impossibilité de créer des instantanés, écritures lentes en raison du bridage.

  1. Exécutez Obtenir l'utilisation du cluster et Résumer l'utilisation des disques pour l'analyse globale de l'espace

  2. Cochez Obtenir l'état du niveau pour la capacité par niveau -- un seul niveau plein peut provoquer des problèmes même si les autres ont de l'espace

  3. Utilisez Obtenir l'utilisation du volume sur les plus grands volumes pour identifier les candidats à la croissance

  4. Passez en revue les politiques de rétention des instantanés -- les anciens instantanés référençant des blocs modifiés consomment beaucoup d'espace

Problèmes d'intégrité des données

Symptômes : Avertissements de somme de contrôle dans les journaux, corruption suspectée après des événements matériels.

  1. Cochez Obtenir l'état de la vérification d'intégrité pour les résultats récents de la vérification d'intégrité

  2. Consultez Obtenir l'état des réparations pour toute reconstruction de données active

  3. Utilisez Obtenir l'état du fichier sur des fichiers spécifiques pour vérifier leur état de réplication

  4. Si nécessaire, exécutez Vérification d'intégrité pour lancer une analyse complète (à planifier pendant les fenêtres de maintenance)

Problèmes d'état du cluster

Symptômes : Alertes de nœud hors ligne, basculement inattendu du maître, risques de split-brain.

  1. Vérifiez Obtenir le maître actuel pour confirmer quel nœud dirige le vSAN

  2. Cochez Obtenir la liste des nœuds et Obtenir les informations du nœud pour l'état de chaque nœud

  3. Consultez Obtenir l'état des réparations pour la re-réplication active des blocs qui indique qu'un nœud a été temporairement déconnecté

  4. Examinez Obtenir les clients pour des modèles de connexion inattendus

Obtenir la liste de synchronisation vs. Obtenir l'état des réparations

Obtenir la liste de synchronisation affiche les synchronisation de site (réplication) vers des sites distants -- pas de resynchronisation intra-cluster après la déconnexion d'un nœud. Utilisez Obtenir l'état des réparations pour le suivi de la reconstruction et de la re-réplication dans le cluster.

Problèmes de périphériques

Symptômes : Avertissements SMART, erreurs de disques individuels, performances inégales entre les nœuds.

  1. Exécutez Obtenir la liste des périphériques et Obtenir l'état du périphérique pour identifier les périphériques dégradés ou défaillants

  2. Cochez Obtenir la liste des périphériques du nœud pour l'inventaire complet des périphériques du nœud concerné

  3. Exécutez Vérification d'intégrité du périphérique sur les disques suspects

  4. Faites une vérification croisée avec les données SMART capturées dans le lot Diagnostics système (collectées par nœud par l'outil de diagnostic)

Maintenance préventive

La surveillance proactive évite les mauvaises surprises. Établissez un rythme régulier pour ces vérifications :

Quotidien

  • Passez en revue l'utilisation du cluster et la capacité des niveaux - Vérifiez les réparations actives (elles doivent être nulles en régime stable) - Vérifiez qu'il n'y a aucune alerte liée au stockage dans le tableau de bord

Hebdomadaire

  • Exécutez les taux du cluster pour établir des références de performances - Consultez les principaux taux d'utilisation pour suivre les tendances de croissance - Vérifiez les taux d'atteinte du cache et ajustez si nécessaire

Mensuel

  • Planifiez les vérifications d'intégrité pendant les fenêtres de maintenance - Passez en revue l'état des périphériques et les données SMART - Analysez les tendances de capacité pour la planification des achats

Intégration Fibre Channel

Le vSAN VergeOS prend en charge les LUN Fibre Channel (FC) comme périphériques de stockage dans son architecture à niveaux, ce qui permet l'intégration avec l'infrastructure SAN existante.

Principes clés

  • Les LUN FC sont traitées de la même manière que les disques physiques -- VergeOS ne fait aucune distinction une fois qu'elles sont attribuées à un niveau

  • Chaque nœud doit recevoir ses propres LUN uniques -- ne présentez pas la même LUN à plusieurs nœuds (contrairement au clustering traditionnel à stockage partagé)

  • Le niveau 0 nécessite toujours des disques NVMe/SSD physiques dans les nœuds pour le stockage des métadonnées

  • Désactivez le RAID et la hiérarchisation automatique sur le SAN pour les LUN utilisées par VergeOS -- le vSAN gère la redondance nativement

  • multichemin actif/passif avec un délai de basculement de 7 secondes ; VergeOS sélectionne automatiquement le chemin optimal

Quand utiliser FC par rapport aux disques physiques

Verge recommande des disques physiques directement attachés aux nœuds pour la plupart des déploiements. L'intégration FC convient lorsque vous disposez d'investissements SAN existants ou d'exigences de conformité spécifiques. Les disques physiques offrent une configuration plus simple, de meilleures performances (sans surcharge SAN), moins de points de défaillance et un coût inférieur.

Bande passante réseau principale

Le vSAN utilise le réseau principal pour la réplication des données. Si votre SAN FC prend en charge 32 Gb mais que votre réseau principal est à 25 Gb, le débit d'écriture sera limité par le réseau principal. Assurez-vous que la bande passante du réseau principal est égale ou supérieure à celle du SAN pour les charges de travail intensives en écriture.

Diagnostics NAS

Chaque instance de service NAS possède sa propre interface de diagnostic, distincte des diagnostics vSAN. Les diagnostics NAS se concentrent sur les protocoles de partage de fichiers, la connectivité réseau et l'authentification.

Accéder aux diagnostics NAS

  1. Accédez à NAS → Liste depuis le menu supérieur

  2. Double-cliquez sur le service NAS souhaité

  3. Cliquez sur Diagnostics dans le menu de gauche

  4. Sélectionnez une commande dans la Requête de diagnostic liste déroulante et cliquez sur Envoyer →

Principales commandes de diagnostic NAS

Catégorie
Commandes
Rôle

SMB/CIFS

smbstatus, testparm, smbclient -L localhost

Connexions actives, validation de la configuration, liste des partages

NFS

exportfs -v, rpcinfo -p, showmount -e

Liste des exports, services RPC, vérification du montage

Active Directory

wbinfo -t, wbinfo -u, wbinfo -g

Vérification de la relation d'approbation, utilisateurs du domaine, groupes du domaine

Réseau

Ping, traceroute, balayage ARP, recherche DNS

Connectivité, routage, découverte des voisins

Performance

Utilisation CPU maximale, utilisation réseau maximale, capture TCP

Utilisation des ressources et analyse du trafic

Journalisation

Journaux (journalctl, journaux Samba)

Analyse des erreurs et surveillance des événements

Flux de travail de surveillance de l'état du NAS

  1. État du service -- Vérifiez les services et l'état spécifique au protocole (Samba/NFS)

  2. Connectivité réseau -- Vérifiez avec Ping et la configuration de l'interface

  3. Authentification -- Testez les utilisateurs, les groupes et Winbind (pour les environnements AD)

  4. Performance -- Surveillez l'utilisation CPU maximale et l'utilisation réseau maximale

  5. Journaux -- Consultez les journaux de service pour détecter des erreurs ou des avertissements

Problèmes NAS courants et solutions

Windows : Impossible de se connecter aux partages CIFS

Cause : Windows 10/11 et Server 2016+ désactivent par défaut les connexions invité non sécurisées, bloquant l'accès aux partages qui autorisent l'accès anonyme.

Correctif : Activez les connexions invité non sécurisées via la stratégie de groupe :

  1. Ouvrez gpedit.mscConfiguration de l'ordinateur → Modèles d'administration → Réseau → Lanman Workstation

  2. Définissez Activer les connexions invité non sécurisées vers Activé

  3. Redémarrez l'appareil Windows

macOS : Échecs de connexion SMB

Cause : Les paramètres par défaut de macOS peuvent entrer en conflit avec la version du protocole SMB du serveur ou manquer d'extensions spécifiques à Apple.

Correctif (côté client) : Forcez SMB3 dans /etc/nsmb.conf:

Videz le cache SMB (sudo rm -rf /var/db/samba/* /var/db/smb/*) puis redémarrez.

Correctif (côté serveur) : Ajoutez les paramètres du module fruit Apple/Samba sous NAS → CIFS → Options de configuration avancées:

Accès refusé sur les partages CIFS

Cause : Autorisations utilisateur/groupe incorrectes ou configuration de partage incorrecte.

Correctif :

  1. Vérifiez que l'utilisateur a accès dans la liste des utilisateurs du service NAS

  2. Vérifiez les paramètres du partage : assurez-vous Navigable est activé et que l'utilisateur figure dans la Utilisateurs valides liste

  3. Si vous utilisez Forcer l'utilisateur ou Forcer le groupe options, confirmez que l'identité forcée dispose des autorisations de système de fichiers correctes

Performances CIFS lentes

Cause : Incompatibilité de version du protocole SMB, problèmes réseau ou configuration sous-optimale.

Correctif :

  1. Vérifiez la stabilité du réseau avec les diagnostics NAS Ping et Trace de route commandes

  2. Vérifiez la version du protocole SMB sous NAS → Volumes → Options de configuration avancées -- assurez-vous que SMB2 ou SMB3 est utilisé

  3. Surveillez avec Utilisation réseau maximale dans les diagnostics NAS pour détecter une saturation de la bande passante

  4. Contactez le support VergeOS pour des paramètres avancés de réglage Samba si les optimisations standard sont insuffisantes

Pont VMware

Vous venez de VMware ? VergeOS expose les mêmes données de diagnostic via l’ Système → Diagnostics vSAN interface utilisateur sur n’importe quel nœud contrôleur -- aucun appareil de gestion séparé, plug-in ou couche de script n’est requis. Les diagnostics NAS résident dans la VM du service NAS plutôt que dans une console centralisée.

Pont Nutanix

Vous venez de Nutanix ? VergeOS vous offre le même type de couverture de diagnostic du stockage et de vérification d’intégrité via l’ Diagnostics vSAN interface utilisateur sur n’importe quel nœud contrôleur, avec les vérifications de l’état du service NAS résidant dans la VM du service NAS elle-même plutôt que dans une console distincte de services de fichiers.

Premiers pas

Explorez les diagnostics vSAN

Accédez à Système → Diagnostics vSAN, exécutez Obtenir l'utilisation du cluster et Obtenir les taux du cluster pour établir votre référence.

Vérifiez l’état de santé du NAS

Ouvrez la page Diagnostics de chaque service NAS. Exécutez Samba pour voir les connexions actives et NFS pour vérifier les exports. Examinez Journaux les erreurs récentes.

Consultez le guide de diagnostic

Lisez le Guide de diagnostic vSAN et Guide de diagnostic NAS dans la documentation officielle.

Mis à jour

Ce contenu vous a-t-il été utile ?