Speicherüberwachung & Fehlerbehebung
Beherrschen Sie vSAN-Diagnose, Fibre-Channel-Integration, NAS-Fehlerbehebung und vorbeugende Wartungsstrategien in VergeOS.
Warum Speicherüberwachung wichtig ist
Speicher ist die Grundlage jeder Arbeitslast in VergeOS. Ein beeinträchtigtes Laufwerk, ein volles Tier oder ein unbemerkter Integritätsfehler kann sich zu VM-Leistungsproblemen, fehlgeschlagenen Snapshots und Beschwerden von Mandanten auswachsen. VergeOS bietet integrierte Diagnosewerkzeuge auf zwei Ebenen -- vSAN-Diagnosen für die verteilte Blockspeicher-Engine und NAS-Diagnosen für jede Dateifreigabe-Serviceinstanz -- damit Sie Probleme erkennen, diagnostizieren und beheben können, bevor sie die Produktion beeinträchtigen.
vSAN-Diagnosen
Die vSAN-Diagnoseoberfläche bietet Echtzeitzugriff auf den internen Zustand der VergeFS-Speicher-Engine. Jede Diagnose wird über das Abfrage Dropdown-Menü in der vSAN-Diagnose-UI ausgeführt.
Zugriff auf vSAN-Diagnosen
Navigieren Sie zu System → vSAN-Diagnosen über das obere Menü
Alternativ: Klicken Sie im Haupt-Dashboard auf das vSAN-Tiers Zählfeld → vSAN-Diagnosen im linken Menü
Wählen Sie einen Befehl aus dem Abfrage Dropdown-Menü, konfigurieren Sie die Parameter rechts und klicken Sie auf Senden →
Nur auf Root-Ebene
vSAN-Diagnosen sind nur auf der Root-/Elternebene verfügbar. Mandanten haben keinen Zugriff auf vSAN-Diagnosewerkzeuge -- sie müssen Diagnosen über den Anbieter anfordern.
Referenz der Diagnosebefehle
Die folgenden Diagnosen sind über das Abfrage Dropdown-Menü in der vSAN-Diagnose-UI verfügbar und nach Schwerpunkt gruppiert.
Cluster & Leistung
Cluster-Raten abrufen
Durchsatz- und IOPS-Metriken für den gesamten Cluster
Cluster-Nutzung abrufen
Gesamte Speicherauslastung und Kapazität
Top-Nutzungsraten abrufen
Die größten Verbraucher von Speicher-I/O identifizieren
Nutzung abrufen
Umfassende vSAN-Nutzungsstatistiken
Cache-Info abrufen
Cache-Treffer-/Fehlverhältnisse und Speichernutzung
Read-Ahead abrufen
Konfiguration und Statistiken des Read-Ahead-Cache
Aktuellen Master abrufen
Den aktuellen vSAN-Master-Knoten identifizieren
Gerät & Knoten
Geräteliste abrufen
Alle Speichergeräte im vSAN
Gerätestatus abrufen
Gesundheit und Zustand eines bestimmten Geräts
Gerätenutzung abrufen
Nutzung und Verschleißdaten pro Gerät
Knotenliste abrufen
Alle am vSAN teilnehmenden Knoten
Knoteninfo abrufen
Detaillierte Informationen zu einem bestimmten Knoten
Geräteliste des Knotens abrufen
An einen bestimmten Knoten angeschlossene Geräte
Tier & Volumen
Tier-Status abrufen
Gesundheit und Kapazität pro Speicher-Tier
Tier-Gerätemappings abrufen
Wie Geräte über die Tiers hinweg zugeordnet sind
Tier-Knoten-Mappings abrufen
Wie Tiers über Knoten verteilt sind
Volumennutzung abrufen
Speicherverbrauch pro Volume
Festplattennutzung zusammenfassen
Zusammenfassung der Festplattennutzung im gesamten Cluster
Integrität & Reparatur
Integritätsprüfung
Eine vollständige Integritätsprüfung starten
Integritätsprüfung des Geräts
Integritätsprüfung auf einem bestimmten Gerät
Status der Integritätsprüfung abrufen
Fortschritt/Ergebnisse der Integritätsprüfungen
Reparaturstatus abrufen
Aktive Reparatur- und Wiederaufbauvorgänge
Sync-Liste abrufen
Aktive Site-Sync-(Replikations-)Verbindungen
Dateisystem & Konfiguration
Inode finden
Einen bestimmten Inode zur Analyse lokalisieren
Pfad aus Inode abrufen
Eine Inode-Nummer einem Pfad zuordnen
Dateistatus abrufen
Replikation und Integrität einer Datei
FUSE-Info abrufen
Details zum FUSE-Mount und zu den Vorgängen
Journalstatus abrufen
Zustand des Write-Ahead-Journals
Laufende Konfiguration abrufen
Aktuelle laufende vSAN-Konfiguration
Clients abrufen
Aktive vSAN-Clientverbindungen
Workflow zur Gesundheitsüberwachung
Befolgen Sie diesen systematischen Ansatz bei der Untersuchung des Speicherzustands -- beginnen Sie breit und arbeiten Sie sich zu spezifischen Komponenten vor.
Schritt-für-Schritt-Workflow
Systemübersicht -- Ausführen
Cluster-Nutzung abrufenundCluster-Raten abrufenum den Gesamtzustand, die Kapazität und den Durchsatz zu verstehenLeistungsanalyse -- Prüfen
Top-Nutzungsraten abrufenum heiße Volumes zu finden, dannCache-Info abrufenfür Cache-TrefferquotenGesundheitsbewertung -- Überprüfen
Reparaturstatus abrufenzeigt alle Nullen an (keine aktiven Reparaturen) undStatus der Integritätsprüfung abrufenfür aktuelle ErgebnisseKapazitätsplanung -- Verwenden
Festplattennutzung zusammenfassenfür eine Cluster-weite Ansicht undTier-Status abrufenfür die Kapazität pro TierGezielte Fehlerbehebung -- Tiefer in bestimmte Geräte einsteigen (
Gerätestatus abrufen) oder Knoten (Knoteninfo abrufen) basierend auf den Ergebnissen
Fehlerbehebungsmuster
Leistungsprobleme
Symptome: Hohe VM-Latenz, langsame Snapshot-Vorgänge, Beschwerden von Mandanten über die Festplattengeschwindigkeit.
Prüfen Sie Cluster-Raten abrufen für den aggregierten Durchsatz -- sind die Raten niedriger als die Basislinie?
Prüfen Sie Cache-Info abrufen -- niedrige Trefferquoten deuten darauf hin, dass der Arbeitsdatensatz den verfügbaren Cache übersteigt
Untersuchen Sie Top-Nutzungsraten abrufen um zu identifizieren, welche Volumes den meisten I/O verbrauchen
Prüfen Sie Gerätenutzung abrufen auf einzelnen Laufwerken, um eine ungleichmäßige Lastverteilung zu erkennen
Überprüfen Sie Journalstatus abrufen -- ein überlastetes Journal weist auf anhaltenden Schreibdruck hin
Kapazitätsprobleme
Symptome: "Wenig Speicherplatz"-Warnungen, Unfähigkeit, Snapshots zu erstellen, langsame Schreibvorgänge aufgrund von Drosselung.
Ausführen Cluster-Nutzung abrufen und Festplattennutzung zusammenfassen für eine Analyse des Gesamtspeichers
Prüfen Sie Tier-Status abrufen für die Kapazität pro Tier -- ein einzelnes volles Tier kann Probleme verursachen, auch wenn andere noch Platz haben
Verwenden Sie Volumennutzung abrufen auf den größten Volumes, um Wachstums-Kandidaten zu identifizieren
Prüfen Sie die Aufbewahrungsrichtlinien für Snapshots -- alte Snapshots, die geänderte Blöcke referenzieren, verbrauchen erheblich Speicherplatz
Bedenken hinsichtlich der Datenintegrität
Symptome: Prüfsummenwarnungen in Protokollen, vermutete Beschädigung nach Hardwareereignissen.
Prüfen Sie Status der Integritätsprüfung abrufen für aktuelle Ergebnisse der Integritätsprüfung
Prüfen Sie Reparaturstatus abrufen für eine aktive Datenrekonstruktion
Verwenden Sie Dateistatus abrufen bei bestimmten Dateien, um deren Replikationsstatus zu überprüfen
Falls erforderlich, führen Sie Integritätsprüfung aus, um einen vollständigen Scan zu starten (während Wartungsfenstern planen)
Auswirkungen der Integritätsprüfung
Vollständige Integritätsprüfungen können die Systemleistung erheblich beeinträchtigen. Planen Sie sie immer während Wartungsfenstern und überwachen Sie die Systemlast während der Ausführung.
Probleme mit dem Cluster-Zustand
Symptome: Warnungen wegen offline Knoten, unerwartetes Master-Failover, Bedenken wegen Split-Brain.
Überprüfen Sie Aktuellen Master abrufen um zu bestätigen, welcher Knoten das vSAN leitet
Prüfen Sie Knotenliste abrufen und Knoteninfo abrufen für den Status jedes Knotens
Prüfen Sie Reparaturstatus abrufen für aktive Block-Neureplikation, die darauf hinweist, dass ein Knoten vorübergehend getrennt war
Untersuchen Sie Clients abrufen für unerwartete Verbindungsmuster
Geräteprobleme
Symptome: SMART-Warnungen, Fehler einzelner Laufwerke, ungleichmäßige Leistung über die Knoten hinweg.
Ausführen Geräteliste abrufen und Gerätestatus abrufen um beeinträchtigte oder ausgefallene Geräte zu identifizieren
Prüfen Sie Geräteliste des Knotens abrufen für das vollständige Geräteinventar des betroffenen Knotens
Ausführen Integritätsprüfung des Geräts bei verdächtigen Laufwerken
Kreuzreferenz mit SMART-Daten, die im System-Diagnostics-Bundle erfasst wurden (pro Knoten vom Diagnose-Tooling gesammelt)
Vorbeugende Wartung
Proaktive Überwachung verhindert Überraschungen. Etablieren Sie einen regelmäßigen Rhythmus für diese Prüfungen:
Täglich
Cluster-Nutzung und Tier-Kapazität überprüfen - Auf aktive Reparaturen prüfen (sollten im stabilen Zustand null sein) - Sicherstellen, dass keine speicherbezogenen Warnungen im Dashboard vorhanden sind
Wöchentlich
Cluster-Raten ausführen, um Leistungs-Baselines festzulegen - Top-Nutzungsraten auf Wachstumstrends prüfen - Cache-Trefferquoten prüfen und bei Bedarf optimieren
Monatlich
Integritätsprüfungen während Wartungsfenstern planen - Gerätegesundheit und SMART-Daten überprüfen - Kapazitätstrends für die Beschaffungsplanung analysieren
Fibre-Channel-Integration
VergeOS vSAN unterstützt Fibre-Channel-(FC)-LUNs als Speichergeräte innerhalb seiner tierierten Architektur und ermöglicht die Integration in bestehende SAN-Infrastrukturen.
Wichtige Grundsätze
FC-LUNs werden genauso behandelt wie physische Festplatten -- VergeOS macht keinen Unterschied, sobald sie einem Tier zugewiesen sind
Jeder Knoten muss seine eigenen eindeutigen LUNs erhalten -- dieselbe LUN darf nicht mehreren Knoten präsentiert werden (anders als bei traditionellem Shared-Storage-Clustering)
Tier 0 benötigt weiterhin physische NVMe-/SSD-Laufwerke in den Knoten für die Metadatenspeicherung
RAID und automatisches Tiering deaktivieren auf dem SAN für von VergeOS verwendete LUNs -- das vSAN übernimmt die Redundanz nativ
Aktiv/Passiv-Multipathing mit 7-Sekunden-Failover-Timeout; VergeOS wählt automatisch den optimalen Pfad aus
Wann FC statt physischer Festplatten verwenden
Verge empfiehlt physische Festplatten, die direkt an Knoten angeschlossen sind für die meisten Bereitstellungen. FC-Integration ist geeignet, wenn Sie bereits in SAN investiert haben oder spezifische Compliance-Anforderungen bestehen. Physische Festplatten bieten eine einfachere Konfiguration, bessere Leistung (kein SAN-Overhead), weniger Fehlerquellen und geringere Kosten.
NAS-Diagnosen
Jede NAS-Serviceinstanz verfügt über eine eigene Diagnoseoberfläche, getrennt von den vSAN-Diagnosen. NAS-Diagnosen konzentrieren sich auf Dateifreigabeprotokolle, Netzwerkkonnektivität und Authentifizierung.
Zugriff auf NAS-Diagnosen
Navigieren Sie zu NAS → Liste über das obere Menü
Doppelklicken Sie auf den gewünschten NAS-Dienst
Klicken Sie auf Diagnose im linken Menü
Wählen Sie einen Befehl aus dem Diagnoseabfrage Dropdown-Menü und klicken Sie auf Senden →
Wichtige NAS-Diagnosebefehle
SMB/CIFS
smbstatus, testparm, smbclient -L localhost
Aktive Verbindungen, Konfigurationsvalidierung, Freigabeliste
NFS
exportfs -v, rpcinfo -p, showmount -e
Exportliste, RPC-Dienste, Mount-Überprüfung
Active Directory
wbinfo -t, wbinfo -u, wbinfo -g
Trust-Prüfung, Domänenbenutzer, Domänengruppen
Netzwerk
Ping, Traceroute, ARP-Scan, DNS-Lookup
Konnektivität, Routing, Nachbarerkennung
Leistung
Top-CPU-Nutzung, Top-Netzwerknutzung, TCP-Dump
Ressourcenauslastung und Verkehrsanalyse
Protokollierung
Protokolle (journalctl, Samba-Protokolle)
Fehleranalyse und Ereignisüberwachung
Workflow zur NAS-Gesundheitsüberwachung
Dienststatus -- Dienste und protokollspezifischen Status prüfen (Samba/NFS)
Netzwerkkonnektivität -- Mit Ping und Schnittstellenkonfiguration überprüfen
Authentifizierung -- Benutzer, Gruppen und Winbind testen (für AD-Umgebungen)
Leistung -- Top-CPU-Nutzung und Top-Netzwerknutzung überwachen
Protokolle -- Dienstprotokolle auf Fehler oder Warnungen überprüfen
Häufige NAS-Probleme & Lösungen
Windows: Keine Verbindung zu CIFS-Freigaben möglich
Ursache: Windows 10/11 und Server 2016+ deaktivieren unsichere Gastanmeldungen standardmäßig, wodurch der Zugriff auf Freigaben blockiert wird, die anonymen Zugriff erlauben.
Behebung: Unsichere Gastanmeldungen über Gruppenrichtlinie aktivieren:
Öffnen Sie
gpedit.msc→ Computerkonfiguration → Administrative Vorlagen → Netzwerk → Lanman-ArbeitsstationSetzen Sie Unsichere Gastanmeldungen aktivieren in Aktiviert
Starten Sie das Windows-Gerät neu
macOS: SMB-Verbindungsfehler
Ursache: Die macOS-Standardeinstellungen können mit der SMB-Protokollversion des Servers in Konflikt stehen oder Apple-spezifische Erweiterungen vermissen lassen.
Behebung (clientseitig): SMB3 erzwingen in /etc/nsmb.conf:
Den SMB-Cache leeren (sudo rm -rf /var/db/samba/* /var/db/smb/*) und neu starten.
Behebung (serverseitig): Apple-/Samba-fruit-Modul-Einstellungen unter hinzufügen NAS → CIFS → Erweiterte Konfigurationsoptionen:
Zugriff verweigert auf CIFS-Freigaben
Ursache: Falsche Benutzer-/Gruppenberechtigungen oder Freigabekonfiguration.
Behebung:
Prüfen Sie, ob der Benutzer in der Benutzerliste des NAS-Dienstes Zugriff hat
Freigabeeinstellungen prüfen: sicherstellen, dass Browseable aktiviert ist und der Benutzer in der Valid Users Liste
Wenn Force User oder Force Group verwendet werden, bestätigen Sie, dass die erzwungene Identität die richtigen Dateisystemberechtigungen hat
Langsame CIFS-Leistung
Ursache: Nicht übereinstimmende SMB-Protokollversion, Netzwerkprobleme oder suboptimale Konfiguration.
Behebung:
Netzwerkstabilität mit den NAS-Diagnosen überprüfen Ping und Traceroute Befehle
Prüfen Sie die SMB-Protokollversion unter NAS → Volumes → Erweiterte Konfigurationsoptionen -- stellen Sie sicher, dass SMB2 oder SMB3 verwendet wird
Überwachen mit Top-Netzwerkauslastung in den NAS-Diagnosen auf Bandbreitensättigung
Kontaktieren Sie den VergeOS-Support für erweiterte Samba-Tuning-Parameter, wenn Standardoptimierungen nicht ausreichen
Erste Schritte
vSAN-Diagnosen erkunden
Navigieren Sie zu System → vSAN-Diagnosen, führen Sie Cluster-Nutzung abrufen und Cluster-Raten abrufen aus, um Ihre Ausgangsbasis festzulegen.
NAS-Zustand prüfen
Öffnen Sie die Diagnose-Seite jedes NAS-Dienstes. Führen Sie Samba aus, um aktive Verbindungen zu sehen und NFS aus, um Exporte zu überprüfen. Prüfen Sie Protokolle auf aktuelle Fehler.
Den Diagnoseleitfaden prüfen
Lesen Sie den vollständigen vSAN-Diagnoseleitfaden und NAS-Diagnoseleitfaden in der offiziellen Dokumentation.
Zuletzt aktualisiert
War das hilfreich?