Knotenübersicht
Überblick über die Knotenverwaltung in VergeOS, einschließlich Knotenstatus, Hardwarekonfiguration, Ressourcenmetriken, Laufwerke, NICs, Fabric-Status, laufender Maschinen und Verwaltungsoperationen.
Ein Knoten in VergeOS stellt einen physischen oder virtuellen Server dar, der Rechen-, Speicher- und Netzwerkressourcen zu Ihrer Umgebung beiträgt. Das Nodes-Dashboard bietet umfassende Überwachungs- und Verwaltungsfunktionen für jeden Knoten in Ihrem System.
Wichtige Komponenten
Knotenstatusinformationen
Status: Zeigt den aktuellen Betriebszustand an (Läuft/Offline)
Wird ausgeführt: Gibt an, dass der Knoten aktiv in Betrieb ist
Wartungsmodus: Gibt an, ob sich der Knoten im Wartungszustand befindet
Zuletzt eingeschaltet: Zeitstempel des letzten Starts des Knotens
Ortszeit: Aktuelle Uhrzeit auf dem Knoten
IPMI-Status: Zeigt den Status der Intelligent Platform Management Interface an
IPMI-Netzwerkadresse: Netzwerkadresse für den Remote-Management-Zugriff
Systemversion: Zeigt die aktuelle VergeOS-Version an (OS-Version, vSAN-Version, Appserver-Version, Kernel-Version)
Hardwarekonfiguration
CPU: Prozessormodell und Generation
CPU-Kerne: Anzahl der physischen Prozessorkerne
RAM: Gesamte physische Speicherkapazität
Failover-RAM: Für Failover-Szenarien reservierter Speicher
Overcommit-RAM: Speicher, der für Oversubscription verfügbar ist
Cluster: Der Cluster, zu dem dieser Knoten gehört
PXE-Netzwerk: Für PXE-Boot-Vorgänge verwendetes Netzwerk
Modell: Informationen zur Hardwareplattform
Serie: Produktserienbezeichnung
Asset-Tags und Funktionen
Physisch: Gibt ein physisches Hardware-Asset an
Systemprotokolle erfassen: Status der Systemprotokollierung
LLDP: Status des Link Layer Discovery Protocol
iOMMU- (VT-d)-Unterstützung: Unterstützung für Hardwarevirtualisierung
Neustart erforderlich: Gibt an, ob ein Neustart erforderlich ist
Neuladen des Treibers erforderlich: Gibt an, ob Treiberaktualisierungen ein Neuladen erfordern
Ressourcenmetriken
Das Dashboard bietet Echtzeit- und historische Überwachung über:
CPU-Auslastungsdiagramm: Zeigt die aktuelle, durchschnittliche und maximale CPU-Auslastung mit Visualisierung des historischen Trends
Gesamt-CPU
Kernspitze
Auslastung (Benutzer, System, IO-Wartezeit, VM-Nutzung, IRQ)
Knotenstatistiken
Das Dashboard stellt wichtige Metriken nach Kategorien geordnet bereit:
Physischer RAM: Aktueller Prozentsatz der Speicherauslastung und Kapazität
Virtueller RAM: Zugewiesener virtueller Speicher (typischerweise 0 % bei fehlender Überbelegung)
Temperatur: Aktuelle Knotentemperatur mit visueller Anzeige (grün/gelb/rot basierend auf Schwellenwerten)
Laufende Maschinen: Anzahl der aktiven Workloads auf dem Knoten
Kern-Auslastung: Prozentsatz der genutzten CPU-Kerne
RAM-Auslastung: Speicherverbrauch über laufende Maschinen hinweg
Hardware-Ressourcen
Laufwerke
Zeigt alle an den Knoten angeschlossenen physischen Laufwerke an:
Status: Online/Offline-Anzeige
Namen: Laufwerkskennung (z. B. nvme0n1, nvme1n1)
Modell: Hersteller und Modellnummer
Tier: vSAN-Speicher-Tier-Zuweisung
vSAN-Laufwerks-ID: Eindeutige Kennung innerhalb von vSAN
Firmware: Laufwerks-Firmwareversion
Bus: Hardware-Busverbindung
Nutzung: Kapazitätsauslastung mit visueller Anzeige
Wird repariert: Status des Laufwerks-Neuaufbaus
Lese-/Schreibfehler: Fehlerzähler zur Überwachung des Laufwerkszustands
Netzwerkschnittstellenkarten (NICs)
Umfassende NIC-Informationen und Status:
Status: Betriebszustand (Up/Down)
Fabric-Status: Status der Core-Fabric-Konnektivität (Bestätigt/Nicht bestätigt) mit visueller Anzeige
Das Globus-Symbol kennzeichnet NICs, die mit der Core-Fabric verbunden sind
Der Status „Bestätigt“ bedeutet, dass die NIC ordnungsgemäß in die Netzwerk-Fabric integriert ist
Namen: Schnittstellenkennung (z. B. enp2s0f0, enp8s0)
Modell: Modell des Netzwerkadapters
Hersteller: Hersteller des Netzwerkadapters
Treiber: Verwendeter Netzwerk-Treiber
Port: Physische Portnummer
Geschwindigkeit: Link-Geschwindigkeit (z. B. 10000 Mb/s, 2500 Mb/s)
MAC: Hardware-MAC-Adresse
Netzwerk: Zugeordnetes VergeOS-Netzwerk
RX/TX: Empfangene und gesendete Datenmenge
RX/TX-Rate: Aktuelle Übertragungsraten
Aktionen: Schnellsymbol für NIC-Operationen (Konsole, Diagramme, Konfiguration)
Speichermodule
Zeigt die installierte RAM-Konfiguration an:
Anzahl und Kapazität der Module
Speichertyp und Spezifikationen
LLDP-Nachbarn
Zeigt Informationen des Link Layer Discovery Protocol für verbundene Netzwerkgeräte an:
Informationen zum verbundenen Switch
Port-Zuordnungen
Visualisierung der Netzwerk-Topologie
PCI-Geräte
Listet alle PCI/PCIe-Geräte auf:
Gerätetypen und Modelle
Bus-Zuweisungen
Passthrough-Verfügbarkeit
SR-IOV-NIC-Geräte
Informationen zu virtuellen Funktionen für NICs mit Single Root I/O Virtualization-Unterstützung:
Anzahl virtueller Funktionen
Zuweisungsstatus
NVIDIA-vGPU-GERÄTE
Für virtuelle GPU-Zuweisungen verfügbare GPU-Ressourcen (falls zutreffend):
GPU-Modell und Kapazität
Verfügbare vGPU-Profile
Zuweisungsstatus
USB-Geräte
Angeschlossene USB-Geräte:
Geräteidentifikation
Passthrough-Fähigkeit
Ressourcen
Ressourcenzuweisung und -limits:
Kernzuweisungen
Speicherzuweisungen
Speicherzuweisungen
Aufgaben
Aktive und geplante Aufgaben:
Laufende Vorgänge
Wartende Jobs
Aufgabenverlauf
Laufende Maschinen
Zeigt aktive Workloads mit detailliertem Ressourcenverbrauch an:
Status: Anzeige des laufenden Status
Typ: Workload-Typ (Virtuelle Maschine, vNet-Container)
Namen: Maschinenkennung
CPU-Kerne: Anzahl zugewiesener Kerne
CPU-Auslastung: Aktueller Prozentsatz der Prozessorauslastung
RAM: Zugewiesener Speicher mit Auslastungsprozentsatz und visueller Anzeige
Zuletzt gestartet: Zeitstempel des Starts der Maschine
Zu den gängigen Maschinentypen gehören:
Virtuelle Maschinen (VMs)
vNet-Container (Netzwerkdienste)
Systemdienste (NAS, DMZ, Extern usw.)
Hauptmerkmale
Verwaltungsvorgänge
Verfügbar über das linke Menü:
Stromsteuerung:
Ein-/Ausschalten
Neustart
Strom kappen (erzwungenes Herunterfahren)
Wartungsvorgänge:
Wartungsmodus aktivieren/deaktivieren
Skalieren nach oben (Ressourcen zum Cluster hinzufügen)
Remote-Konsole: Direkter Zugriff auf die Knoten-Konsole zur Fehlerbehebung
Konfiguration:
Knoteneinstellungen bearbeiten
Tags zur Organisation zuweisen
Knoten löschen (wenn angemessen)
Notizen für die Dokumentation hinzufügen
Aktualisieren: Dashboard-Daten aktualisieren
IPMI-Verwaltung: Zugriff auf die Remote-Management-Schnittstelle
Überwachung
Echtzeit-Ressourcenauslastung: Live-Diagramme für CPU, Speicher und Temperatur
Historische Leistungsdaten: Trendanalyse über den Verlauf-Link
Ereignisprotokolle: Umfassende Protokollierung von Knotenereignissen mit:
Ebene: Klassifizierung als Warnung/Info/Fehler
Zeit: Zeitstempel jedes Ereignisses
Quelle: Ursprungs-Komponente (z. B. node1)
Nachricht: Detaillierte Ereignisbeschreibung (z. B. Temperaturwarnungen)
Option „Mehr anzeigen“ für erweiterte Protokollhistorie
Hardwarezustand: Laufwerksfehler, NIC-Status und Komponentenüberwachung
Protokolle und Diagnosen
Der Protokollbereich liefert kritische Systemereignisse:
Temperaturwarnungen: Warnmeldungen für Kerntemperatur-Schwellenwerte
Hardwareereignisse: Statusänderungen von Laufwerken, NIC-Ereignisse
Systemereignisse: Änderungen des Stromzustands, Wechsel des Wartungsmodus
Leistungswarnungen: Warnungen zur Ressourcenauslastung
Zu den üblichen Protokolleinträgen gehören Warnungen zur Kerntemperatur mit spezifischen Schwellenwerten (z. B. „Der Kern hat die Warntemperatur '96 / 95' erreicht“).
Bewährte Vorgehensweisen
Knoten-Gesundheit überwachen: Überprüfen Sie regelmäßig die Gesundheitsmetriken des Knotens, insbesondere Temperatur und Laufwerksstatus
Wartungsmodus: Aktivieren Sie immer den Wartungsmodus, bevor Sie Systemaktualisierungen oder Hardwareänderungen durchführen
Protokolle prüfen: Überprüfen Sie regelmäßig die Protokolle auf mögliche Probleme, insbesondere Temperaturwarnungen und Laufwerksfehler
Lastverteilung: Sorgen Sie für eine ausgewogene Verteilung der Workloads über die Knoten in Ihrem Cluster
Auf dem Laufenden bleiben: Halten Sie Firmware und Systemsoftware über das System-Menü auf dem neuesten Stand
Remote-Console-Zugriff: Verwenden Sie die Fernkonsole-Funktion für direkte Fehlerbehebung, wenn physischer Konsolen- oder SSH-Zugriff erforderlich ist
Überwachung des Fabric-Status: Überwachen Sie den Fabric-Status der Core-NICs, um eine ordnungsgemäße Netzwerkintegration und Redundanz sicherzustellen
Laufwerkszustand: Überwachen Sie Laufwerksfehlerzähler und den Reparaturstatus, um Speicherprobleme proaktiv anzugehen
Temperaturmanagement: Beheben Sie wiederholte Temperaturwarnungen, indem Sie Kühlsysteme und Luftstrom überprüfen
Zuletzt aktualisiert
War das hilfreich?