For the complete documentation index, see llms.txt. This page is also available as Markdown.

Speicherüberwachung & Fehlerbehebung

Beherrschen Sie vSAN-Diagnose, Fibre-Channel-Integration, NAS-Fehlerbehebung und vorbeugende Wartungsstrategien in VergeOS.

Warum Speicherüberwachung wichtig ist

Speicher ist die Grundlage jeder Arbeitslast in VergeOS. Ein beeinträchtigtes Laufwerk, ein volles Tier oder ein unbemerkter Integritätsfehler kann sich zu VM-Leistungsproblemen, fehlgeschlagenen Snapshots und Beschwerden von Mandanten auswachsen. VergeOS bietet integrierte Diagnosewerkzeuge auf zwei Ebenen -- vSAN-Diagnosen für die verteilte Blockspeicher-Engine und NAS-Diagnosen für jede Dateifreigabe-Serviceinstanz -- damit Sie Probleme erkennen, diagnostizieren und beheben können, bevor sie die Produktion beeinträchtigen.

vSAN-Diagnosen

Die vSAN-Diagnoseoberfläche bietet Echtzeitzugriff auf den internen Zustand der VergeFS-Speicher-Engine. Jede Diagnose wird über das Abfrage Dropdown-Menü in der vSAN-Diagnose-UI ausgeführt.

Zugriff auf vSAN-Diagnosen

  1. Navigieren Sie zu System → vSAN-Diagnosen über das obere Menü

  2. Alternativ: Klicken Sie im Haupt-Dashboard auf das vSAN-Tiers Zählfeld → vSAN-Diagnosen im linken Menü

  3. Wählen Sie einen Befehl aus dem Abfrage Dropdown-Menü, konfigurieren Sie die Parameter rechts und klicken Sie auf Senden →

Referenz der Diagnosebefehle

Die folgenden Diagnosen sind über das Abfrage Dropdown-Menü in der vSAN-Diagnose-UI verfügbar und nach Schwerpunkt gruppiert.

Cluster & Leistung

Befehl
Zweck

Cluster-Raten abrufen

Durchsatz- und IOPS-Metriken für den gesamten Cluster

Cluster-Nutzung abrufen

Gesamte Speicherauslastung und Kapazität

Top-Nutzungsraten abrufen

Die größten Verbraucher von Speicher-I/O identifizieren

Nutzung abrufen

Umfassende vSAN-Nutzungsstatistiken

Cache-Info abrufen

Cache-Treffer-/Fehlverhältnisse und Speichernutzung

Read-Ahead abrufen

Konfiguration und Statistiken des Read-Ahead-Cache

Aktuellen Master abrufen

Den aktuellen vSAN-Master-Knoten identifizieren

Gerät & Knoten

Befehl
Zweck

Geräteliste abrufen

Alle Speichergeräte im vSAN

Gerätestatus abrufen

Gesundheit und Zustand eines bestimmten Geräts

Gerätenutzung abrufen

Nutzung und Verschleißdaten pro Gerät

Knotenliste abrufen

Alle am vSAN teilnehmenden Knoten

Knoteninfo abrufen

Detaillierte Informationen zu einem bestimmten Knoten

Geräteliste des Knotens abrufen

An einen bestimmten Knoten angeschlossene Geräte

Tier & Volumen

Befehl
Zweck

Tier-Status abrufen

Gesundheit und Kapazität pro Speicher-Tier

Tier-Gerätemappings abrufen

Wie Geräte über die Tiers hinweg zugeordnet sind

Tier-Knoten-Mappings abrufen

Wie Tiers über Knoten verteilt sind

Volumennutzung abrufen

Speicherverbrauch pro Volume

Festplattennutzung zusammenfassen

Zusammenfassung der Festplattennutzung im gesamten Cluster

Integrität & Reparatur

Befehl
Zweck

Integritätsprüfung

Eine vollständige Integritätsprüfung starten

Integritätsprüfung des Geräts

Integritätsprüfung auf einem bestimmten Gerät

Status der Integritätsprüfung abrufen

Fortschritt/Ergebnisse der Integritätsprüfungen

Reparaturstatus abrufen

Aktive Reparatur- und Wiederaufbauvorgänge

Sync-Liste abrufen

Aktive Site-Sync-(Replikations-)Verbindungen

Dateisystem & Konfiguration

Befehl
Zweck

Inode finden

Einen bestimmten Inode zur Analyse lokalisieren

Pfad aus Inode abrufen

Eine Inode-Nummer einem Pfad zuordnen

Dateistatus abrufen

Replikation und Integrität einer Datei

FUSE-Info abrufen

Details zum FUSE-Mount und zu den Vorgängen

Journalstatus abrufen

Zustand des Write-Ahead-Journals

Laufende Konfiguration abrufen

Aktuelle laufende vSAN-Konfiguration

Clients abrufen

Aktive vSAN-Clientverbindungen

Workflow zur Gesundheitsüberwachung

Befolgen Sie diesen systematischen Ansatz bei der Untersuchung des Speicherzustands -- beginnen Sie breit und arbeiten Sie sich zu spezifischen Komponenten vor.

Schritt-für-Schritt-Workflow

  1. Systemübersicht -- Ausführen Cluster-Nutzung abrufen und Cluster-Raten abrufen um den Gesamtzustand, die Kapazität und den Durchsatz zu verstehen

  2. Leistungsanalyse -- Prüfen Top-Nutzungsraten abrufen um heiße Volumes zu finden, dann Cache-Info abrufen für Cache-Trefferquoten

  3. Gesundheitsbewertung -- Überprüfen Reparaturstatus abrufen zeigt alle Nullen an (keine aktiven Reparaturen) und Status der Integritätsprüfung abrufen für aktuelle Ergebnisse

  4. Kapazitätsplanung -- Verwenden Festplattennutzung zusammenfassen für eine Cluster-weite Ansicht und Tier-Status abrufen für die Kapazität pro Tier

  5. Gezielte Fehlerbehebung -- Tiefer in bestimmte Geräte einsteigen (Gerätestatus abrufen) oder Knoten (Knoteninfo abrufen) basierend auf den Ergebnissen

Fehlerbehebungsmuster

Leistungsprobleme

Symptome: Hohe VM-Latenz, langsame Snapshot-Vorgänge, Beschwerden von Mandanten über die Festplattengeschwindigkeit.

  1. Prüfen Sie Cluster-Raten abrufen für den aggregierten Durchsatz -- sind die Raten niedriger als die Basislinie?

  2. Prüfen Sie Cache-Info abrufen -- niedrige Trefferquoten deuten darauf hin, dass der Arbeitsdatensatz den verfügbaren Cache übersteigt

  3. Untersuchen Sie Top-Nutzungsraten abrufen um zu identifizieren, welche Volumes den meisten I/O verbrauchen

  4. Prüfen Sie Gerätenutzung abrufen auf einzelnen Laufwerken, um eine ungleichmäßige Lastverteilung zu erkennen

  5. Überprüfen Sie Journalstatus abrufen -- ein überlastetes Journal weist auf anhaltenden Schreibdruck hin

Speicherdrosselung

VergeOS wendet eine abgestufte I/O-Drosselung basierend auf der Kapazitätsauslastung an: normaler Betrieb unter 91 %, leichte Drosselung (10 ms hinzugefügt) bei 91–95 % und kritische Drosselung (50 ms hinzugefügt) über 96 %. Prüfen Sie die Tier-Nutzung, wenn sich die Leistung plötzlich verschlechtert.

Kapazitätsprobleme

Symptome: "Wenig Speicherplatz"-Warnungen, Unfähigkeit, Snapshots zu erstellen, langsame Schreibvorgänge aufgrund von Drosselung.

  1. Ausführen Cluster-Nutzung abrufen und Festplattennutzung zusammenfassen für eine Analyse des Gesamtspeichers

  2. Prüfen Sie Tier-Status abrufen für die Kapazität pro Tier -- ein einzelnes volles Tier kann Probleme verursachen, auch wenn andere noch Platz haben

  3. Verwenden Sie Volumennutzung abrufen auf den größten Volumes, um Wachstums-Kandidaten zu identifizieren

  4. Prüfen Sie die Aufbewahrungsrichtlinien für Snapshots -- alte Snapshots, die geänderte Blöcke referenzieren, verbrauchen erheblich Speicherplatz

Bedenken hinsichtlich der Datenintegrität

Symptome: Prüfsummenwarnungen in Protokollen, vermutete Beschädigung nach Hardwareereignissen.

  1. Prüfen Sie Status der Integritätsprüfung abrufen für aktuelle Ergebnisse der Integritätsprüfung

  2. Prüfen Sie Reparaturstatus abrufen für eine aktive Datenrekonstruktion

  3. Verwenden Sie Dateistatus abrufen bei bestimmten Dateien, um deren Replikationsstatus zu überprüfen

  4. Falls erforderlich, führen Sie Integritätsprüfung aus, um einen vollständigen Scan zu starten (während Wartungsfenstern planen)

Probleme mit dem Cluster-Zustand

Symptome: Warnungen wegen offline Knoten, unerwartetes Master-Failover, Bedenken wegen Split-Brain.

  1. Überprüfen Sie Aktuellen Master abrufen um zu bestätigen, welcher Knoten das vSAN leitet

  2. Prüfen Sie Knotenliste abrufen und Knoteninfo abrufen für den Status jedes Knotens

  3. Prüfen Sie Reparaturstatus abrufen für aktive Block-Neureplikation, die darauf hinweist, dass ein Knoten vorübergehend getrennt war

  4. Untersuchen Sie Clients abrufen für unerwartete Verbindungsmuster

Get Sync List vs. Get Repair Status

Sync-Liste abrufen meldet aktive Site-Sync- (Replikations-)Verbindungen zu entfernten Standorten -- nicht die interne Cluster-Neusynchronisierung nach einer Knotenunterbrechung. Verwenden Sie Reparaturstatus abrufen für den Fortschritt von Wiederaufbau und Neureplikation innerhalb des Clusters.

Geräteprobleme

Symptome: SMART-Warnungen, Fehler einzelner Laufwerke, ungleichmäßige Leistung über die Knoten hinweg.

  1. Ausführen Geräteliste abrufen und Gerätestatus abrufen um beeinträchtigte oder ausgefallene Geräte zu identifizieren

  2. Prüfen Sie Geräteliste des Knotens abrufen für das vollständige Geräteinventar des betroffenen Knotens

  3. Ausführen Integritätsprüfung des Geräts bei verdächtigen Laufwerken

  4. Kreuzreferenz mit SMART-Daten, die im System-Diagnostics-Bundle erfasst wurden (pro Knoten vom Diagnose-Tooling gesammelt)

Vorbeugende Wartung

Proaktive Überwachung verhindert Überraschungen. Etablieren Sie einen regelmäßigen Rhythmus für diese Prüfungen:

Täglich

  • Cluster-Nutzung und Tier-Kapazität überprüfen - Auf aktive Reparaturen prüfen (sollten im stabilen Zustand null sein) - Sicherstellen, dass keine speicherbezogenen Warnungen im Dashboard vorhanden sind

Wöchentlich

  • Cluster-Raten ausführen, um Leistungs-Baselines festzulegen - Top-Nutzungsraten auf Wachstumstrends prüfen - Cache-Trefferquoten prüfen und bei Bedarf optimieren

Monatlich

  • Integritätsprüfungen während Wartungsfenstern planen - Gerätegesundheit und SMART-Daten überprüfen - Kapazitätstrends für die Beschaffungsplanung analysieren

Fibre-Channel-Integration

VergeOS vSAN unterstützt Fibre-Channel-(FC)-LUNs als Speichergeräte innerhalb seiner tierierten Architektur und ermöglicht die Integration in bestehende SAN-Infrastrukturen.

Wichtige Grundsätze

  • FC-LUNs werden genauso behandelt wie physische Festplatten -- VergeOS macht keinen Unterschied, sobald sie einem Tier zugewiesen sind

  • Jeder Knoten muss seine eigenen eindeutigen LUNs erhalten -- dieselbe LUN darf nicht mehreren Knoten präsentiert werden (anders als bei traditionellem Shared-Storage-Clustering)

  • Tier 0 benötigt weiterhin physische NVMe-/SSD-Laufwerke in den Knoten für die Metadatenspeicherung

  • RAID und automatisches Tiering deaktivieren auf dem SAN für von VergeOS verwendete LUNs -- das vSAN übernimmt die Redundanz nativ

  • Aktiv/Passiv-Multipathing mit 7-Sekunden-Failover-Timeout; VergeOS wählt automatisch den optimalen Pfad aus

Wann FC statt physischer Festplatten verwenden

Verge empfiehlt physische Festplatten, die direkt an Knoten angeschlossen sind für die meisten Bereitstellungen. FC-Integration ist geeignet, wenn Sie bereits in SAN investiert haben oder spezifische Compliance-Anforderungen bestehen. Physische Festplatten bieten eine einfachere Konfiguration, bessere Leistung (kein SAN-Overhead), weniger Fehlerquellen und geringere Kosten.

Kernnetzwerk-Bandbreite

vSAN nutzt das Kernnetzwerk für die Datenreplikation. Wenn Ihr FC-SAN 32 Gb unterstützt, Ihr Kernnetzwerk aber 25 Gb hat, wird der Schreibdurchsatz durch das Kernnetzwerk begrenzt. Stellen Sie sicher, dass die Bandbreite des Kernnetzwerks der SAN-Bandbreite entspricht oder sie übertrifft, insbesondere für schreibintensive Arbeitslasten.

NAS-Diagnosen

Jede NAS-Serviceinstanz verfügt über eine eigene Diagnoseoberfläche, getrennt von den vSAN-Diagnosen. NAS-Diagnosen konzentrieren sich auf Dateifreigabeprotokolle, Netzwerkkonnektivität und Authentifizierung.

Zugriff auf NAS-Diagnosen

  1. Navigieren Sie zu NAS → Liste über das obere Menü

  2. Doppelklicken Sie auf den gewünschten NAS-Dienst

  3. Klicken Sie auf Diagnose im linken Menü

  4. Wählen Sie einen Befehl aus dem Diagnoseabfrage Dropdown-Menü und klicken Sie auf Senden →

Wichtige NAS-Diagnosebefehle

Kategorie
Befehle
Zweck

SMB/CIFS

smbstatus, testparm, smbclient -L localhost

Aktive Verbindungen, Konfigurationsvalidierung, Freigabeliste

NFS

exportfs -v, rpcinfo -p, showmount -e

Exportliste, RPC-Dienste, Mount-Überprüfung

Active Directory

wbinfo -t, wbinfo -u, wbinfo -g

Trust-Prüfung, Domänenbenutzer, Domänengruppen

Netzwerk

Ping, Traceroute, ARP-Scan, DNS-Lookup

Konnektivität, Routing, Nachbarerkennung

Leistung

Top-CPU-Nutzung, Top-Netzwerknutzung, TCP-Dump

Ressourcenauslastung und Verkehrsanalyse

Protokollierung

Protokolle (journalctl, Samba-Protokolle)

Fehleranalyse und Ereignisüberwachung

Workflow zur NAS-Gesundheitsüberwachung

  1. Dienststatus -- Dienste und protokollspezifischen Status prüfen (Samba/NFS)

  2. Netzwerkkonnektivität -- Mit Ping und Schnittstellenkonfiguration überprüfen

  3. Authentifizierung -- Benutzer, Gruppen und Winbind testen (für AD-Umgebungen)

  4. Leistung -- Top-CPU-Nutzung und Top-Netzwerknutzung überwachen

  5. Protokolle -- Dienstprotokolle auf Fehler oder Warnungen überprüfen

Häufige NAS-Probleme & Lösungen

Windows: Keine Verbindung zu CIFS-Freigaben möglich

Ursache: Windows 10/11 und Server 2016+ deaktivieren unsichere Gastanmeldungen standardmäßig, wodurch der Zugriff auf Freigaben blockiert wird, die anonymen Zugriff erlauben.

Behebung: Unsichere Gastanmeldungen über Gruppenrichtlinie aktivieren:

  1. Öffnen Sie gpedit.mscComputerkonfiguration → Administrative Vorlagen → Netzwerk → Lanman-Arbeitsstation

  2. Setzen Sie Unsichere Gastanmeldungen aktivieren in Aktiviert

  3. Starten Sie das Windows-Gerät neu

macOS: SMB-Verbindungsfehler

Ursache: Die macOS-Standardeinstellungen können mit der SMB-Protokollversion des Servers in Konflikt stehen oder Apple-spezifische Erweiterungen vermissen lassen.

Behebung (clientseitig): SMB3 erzwingen in /etc/nsmb.conf:

Den SMB-Cache leeren (sudo rm -rf /var/db/samba/* /var/db/smb/*) und neu starten.

Behebung (serverseitig): Apple-/Samba-fruit-Modul-Einstellungen unter hinzufügen NAS → CIFS → Erweiterte Konfigurationsoptionen:

Zugriff verweigert auf CIFS-Freigaben

Ursache: Falsche Benutzer-/Gruppenberechtigungen oder Freigabekonfiguration.

Behebung:

  1. Prüfen Sie, ob der Benutzer in der Benutzerliste des NAS-Dienstes Zugriff hat

  2. Freigabeeinstellungen prüfen: sicherstellen, dass Browseable aktiviert ist und der Benutzer in der Valid Users Liste

  3. Wenn Force User oder Force Group verwendet werden, bestätigen Sie, dass die erzwungene Identität die richtigen Dateisystemberechtigungen hat

Langsame CIFS-Leistung

Ursache: Nicht übereinstimmende SMB-Protokollversion, Netzwerkprobleme oder suboptimale Konfiguration.

Behebung:

  1. Netzwerkstabilität mit den NAS-Diagnosen überprüfen Ping und Traceroute Befehle

  2. Prüfen Sie die SMB-Protokollversion unter NAS → Volumes → Erweiterte Konfigurationsoptionen -- stellen Sie sicher, dass SMB2 oder SMB3 verwendet wird

  3. Überwachen mit Top-Netzwerkauslastung in den NAS-Diagnosen auf Bandbreitensättigung

  4. Kontaktieren Sie den VergeOS-Support für erweiterte Samba-Tuning-Parameter, wenn Standardoptimierungen nicht ausreichen

VMware Bridge

Kommen Sie von VMware? VergeOS stellt dieselben Diagnosedaten über die System → vSAN-Diagnosen UI auf jedem Controller-Knoten bereit -- es ist kein separates Management-Appliance-, Plug-in- oder Skript-Layer erforderlich. NAS-Diagnosen befinden sich in der NAS-Service-VM selbst und nicht in einer zentralisierten Konsole.

Nutanix Bridge

Kommen Sie von Nutanix? VergeOS bietet Ihnen dieselbe Art von Speicherdiagnose- und Integritäts-Scan-Abdeckung über die vSAN-Diagnosen UI auf jedem Controller-Knoten, wobei die Gesundheitsprüfungen des NAS-Dienstes in der NAS-Service-VM selbst und nicht in einer separaten Datei-Services-Konsole ausgeführt werden.

Erste Schritte

vSAN-Diagnosen erkunden

Navigieren Sie zu System → vSAN-Diagnosen, führen Sie Cluster-Nutzung abrufen und Cluster-Raten abrufen aus, um Ihre Ausgangsbasis festzulegen.

NAS-Zustand prüfen

Öffnen Sie die Diagnose-Seite jedes NAS-Dienstes. Führen Sie Samba aus, um aktive Verbindungen zu sehen und NFS aus, um Exporte zu überprüfen. Prüfen Sie Protokolle auf aktuelle Fehler.

Den Diagnoseleitfaden prüfen

Lesen Sie den vollständigen vSAN-Diagnoseleitfaden und NAS-Diagnoseleitfaden in der offiziellen Dokumentation.

Zuletzt aktualisiert

War das hilfreich?