For the complete documentation index, see llms.txt. This page is also available as Markdown.

Knotenübersicht

Überblick über die Knotenverwaltung in VergeOS, einschließlich Knotenstatus, Hardwarekonfiguration, Ressourcenmetriken, Laufwerke, NICs, Fabric-Status, laufender Maschinen und Verwaltungsoperationen.

Ein Knoten in VergeOS stellt einen physischen oder virtuellen Server dar, der Rechen-, Speicher- und Netzwerkressourcen zu Ihrer Umgebung beiträgt. Das Nodes-Dashboard bietet umfassende Überwachungs- und Verwaltungsfunktionen für jeden Knoten in Ihrem System.

Wichtige Komponenten

Knotenstatusinformationen

  • Status: Zeigt den aktuellen Betriebszustand an (Läuft/Offline)

  • Wird ausgeführt: Gibt an, dass der Knoten aktiv in Betrieb ist

  • Wartungsmodus: Gibt an, ob sich der Knoten im Wartungszustand befindet

  • Zuletzt eingeschaltet: Zeitstempel des letzten Starts des Knotens

  • Ortszeit: Aktuelle Uhrzeit auf dem Knoten

  • IPMI-Status: Zeigt den Status der Intelligent Platform Management Interface an

  • IPMI-Netzwerkadresse: Netzwerkadresse für den Remote-Management-Zugriff

  • Systemversion: Zeigt die aktuelle VergeOS-Version an (OS-Version, vSAN-Version, Appserver-Version, Kernel-Version)

Hardwarekonfiguration

  • CPU: Prozessormodell und Generation

  • CPU-Kerne: Anzahl der physischen Prozessorkerne

  • RAM: Gesamte physische Speicherkapazität

  • Failover-RAM: Für Failover-Szenarien reservierter Speicher

  • Overcommit-RAM: Speicher, der für Oversubscription verfügbar ist

  • Cluster: Der Cluster, zu dem dieser Knoten gehört

  • PXE-Netzwerk: Für PXE-Boot-Vorgänge verwendetes Netzwerk

  • Modell: Informationen zur Hardwareplattform

  • Serie: Produktserienbezeichnung

Asset-Tags und Funktionen

  • Physisch: Gibt ein physisches Hardware-Asset an

  • Systemprotokolle erfassen: Status der Systemprotokollierung

  • LLDP: Status des Link Layer Discovery Protocol

  • iOMMU- (VT-d)-Unterstützung: Unterstützung für Hardwarevirtualisierung

  • Neustart erforderlich: Gibt an, ob ein Neustart erforderlich ist

  • Neuladen des Treibers erforderlich: Gibt an, ob Treiberaktualisierungen ein Neuladen erfordern

Ressourcenmetriken

Das Dashboard bietet Echtzeit- und historische Überwachung über:

  • CPU-Auslastungsdiagramm: Zeigt die aktuelle, durchschnittliche und maximale CPU-Auslastung mit Visualisierung des historischen Trends

    • Gesamt-CPU

    • Kernspitze

    • Auslastung (Benutzer, System, IO-Wartezeit, VM-Nutzung, IRQ)

Knotenstatistiken

Das Dashboard stellt wichtige Metriken nach Kategorien geordnet bereit:

  • Physischer RAM: Aktueller Prozentsatz der Speicherauslastung und Kapazität

  • Virtueller RAM: Zugewiesener virtueller Speicher (typischerweise 0 % bei fehlender Überbelegung)

  • Temperatur: Aktuelle Knotentemperatur mit visueller Anzeige (grün/gelb/rot basierend auf Schwellenwerten)

  • Laufende Maschinen: Anzahl der aktiven Workloads auf dem Knoten

  • Kern-Auslastung: Prozentsatz der genutzten CPU-Kerne

  • RAM-Auslastung: Speicherverbrauch über laufende Maschinen hinweg

Hardware-Ressourcen

Laufwerke

Zeigt alle an den Knoten angeschlossenen physischen Laufwerke an:

  • Status: Online/Offline-Anzeige

  • Namen: Laufwerkskennung (z. B. nvme0n1, nvme1n1)

  • Modell: Hersteller und Modellnummer

  • Tier: vSAN-Speicher-Tier-Zuweisung

  • vSAN-Laufwerks-ID: Eindeutige Kennung innerhalb von vSAN

  • Firmware: Laufwerks-Firmwareversion

  • Bus: Hardware-Busverbindung

  • Nutzung: Kapazitätsauslastung mit visueller Anzeige

  • Wird repariert: Status des Laufwerks-Neuaufbaus

  • Lese-/Schreibfehler: Fehlerzähler zur Überwachung des Laufwerkszustands

Netzwerkschnittstellenkarten (NICs)

Umfassende NIC-Informationen und Status:

  • Status: Betriebszustand (Up/Down)

  • Fabric-Status: Status der Core-Fabric-Konnektivität (Bestätigt/Nicht bestätigt) mit visueller Anzeige

    • Das Globus-Symbol kennzeichnet NICs, die mit der Core-Fabric verbunden sind

    • Der Status „Bestätigt“ bedeutet, dass die NIC ordnungsgemäß in die Netzwerk-Fabric integriert ist

  • Namen: Schnittstellenkennung (z. B. enp2s0f0, enp8s0)

  • Modell: Modell des Netzwerkadapters

  • Hersteller: Hersteller des Netzwerkadapters

  • Treiber: Verwendeter Netzwerk-Treiber

  • Port: Physische Portnummer

  • Geschwindigkeit: Link-Geschwindigkeit (z. B. 10000 Mb/s, 2500 Mb/s)

  • MAC: Hardware-MAC-Adresse

  • Netzwerk: Zugeordnetes VergeOS-Netzwerk

  • RX/TX: Empfangene und gesendete Datenmenge

  • RX/TX-Rate: Aktuelle Übertragungsraten

  • Aktionen: Schnellsymbol für NIC-Operationen (Konsole, Diagramme, Konfiguration)

Speichermodule

Zeigt die installierte RAM-Konfiguration an:

  • Anzahl und Kapazität der Module

  • Speichertyp und Spezifikationen

LLDP-Nachbarn

Zeigt Informationen des Link Layer Discovery Protocol für verbundene Netzwerkgeräte an:

  • Informationen zum verbundenen Switch

  • Port-Zuordnungen

  • Visualisierung der Netzwerk-Topologie

PCI-Geräte

Listet alle PCI/PCIe-Geräte auf:

  • Gerätetypen und Modelle

  • Bus-Zuweisungen

  • Passthrough-Verfügbarkeit

SR-IOV-NIC-Geräte

Informationen zu virtuellen Funktionen für NICs mit Single Root I/O Virtualization-Unterstützung:

  • Anzahl virtueller Funktionen

  • Zuweisungsstatus

NVIDIA-vGPU-GERÄTE

Für virtuelle GPU-Zuweisungen verfügbare GPU-Ressourcen (falls zutreffend):

  • GPU-Modell und Kapazität

  • Verfügbare vGPU-Profile

  • Zuweisungsstatus

USB-Geräte

Angeschlossene USB-Geräte:

  • Geräteidentifikation

  • Passthrough-Fähigkeit

Ressourcen

Ressourcenzuweisung und -limits:

  • Kernzuweisungen

  • Speicherzuweisungen

  • Speicherzuweisungen

Aufgaben

Aktive und geplante Aufgaben:

  • Laufende Vorgänge

  • Wartende Jobs

  • Aufgabenverlauf

Laufende Maschinen

Zeigt aktive Workloads mit detailliertem Ressourcenverbrauch an:

  • Status: Anzeige des laufenden Status

  • Typ: Workload-Typ (Virtuelle Maschine, vNet-Container)

  • Namen: Maschinenkennung

  • CPU-Kerne: Anzahl zugewiesener Kerne

  • CPU-Auslastung: Aktueller Prozentsatz der Prozessorauslastung

  • RAM: Zugewiesener Speicher mit Auslastungsprozentsatz und visueller Anzeige

  • Zuletzt gestartet: Zeitstempel des Starts der Maschine

Zu den gängigen Maschinentypen gehören:

  • Virtuelle Maschinen (VMs)

  • vNet-Container (Netzwerkdienste)

  • Systemdienste (NAS, DMZ, Extern usw.)

Hauptmerkmale

Verwaltungsvorgänge

Verfügbar über das linke Menü:

  • Stromsteuerung:

    • Ein-/Ausschalten

    • Neustart

    • Strom kappen (erzwungenes Herunterfahren)

  • Wartungsvorgänge:

    • Wartungsmodus aktivieren/deaktivieren

    • Skalieren nach oben (Ressourcen zum Cluster hinzufügen)

  • Remote-Konsole: Direkter Zugriff auf die Knoten-Konsole zur Fehlerbehebung

  • Konfiguration:

    • Knoteneinstellungen bearbeiten

    • Tags zur Organisation zuweisen

    • Knoten löschen (wenn angemessen)

    • Notizen für die Dokumentation hinzufügen

  • Aktualisieren: Dashboard-Daten aktualisieren

  • IPMI-Verwaltung: Zugriff auf die Remote-Management-Schnittstelle

Überwachung

  • Echtzeit-Ressourcenauslastung: Live-Diagramme für CPU, Speicher und Temperatur

  • Historische Leistungsdaten: Trendanalyse über den Verlauf-Link

  • Ereignisprotokolle: Umfassende Protokollierung von Knotenereignissen mit:

    • Ebene: Klassifizierung als Warnung/Info/Fehler

    • Zeit: Zeitstempel jedes Ereignisses

    • Quelle: Ursprungs-Komponente (z. B. node1)

    • Nachricht: Detaillierte Ereignisbeschreibung (z. B. Temperaturwarnungen)

    • Option „Mehr anzeigen“ für erweiterte Protokollhistorie

  • Hardwarezustand: Laufwerksfehler, NIC-Status und Komponentenüberwachung

Protokolle und Diagnosen

Der Protokollbereich liefert kritische Systemereignisse:

  • Temperaturwarnungen: Warnmeldungen für Kerntemperatur-Schwellenwerte

  • Hardwareereignisse: Statusänderungen von Laufwerken, NIC-Ereignisse

  • Systemereignisse: Änderungen des Stromzustands, Wechsel des Wartungsmodus

  • Leistungswarnungen: Warnungen zur Ressourcenauslastung

Zu den üblichen Protokolleinträgen gehören Warnungen zur Kerntemperatur mit spezifischen Schwellenwerten (z. B. „Der Kern hat die Warntemperatur '96 / 95' erreicht“).

Bewährte Vorgehensweisen

  • Knoten-Gesundheit überwachen: Überprüfen Sie regelmäßig die Gesundheitsmetriken des Knotens, insbesondere Temperatur und Laufwerksstatus

  • Wartungsmodus: Aktivieren Sie immer den Wartungsmodus, bevor Sie Systemaktualisierungen oder Hardwareänderungen durchführen

  • Protokolle prüfen: Überprüfen Sie regelmäßig die Protokolle auf mögliche Probleme, insbesondere Temperaturwarnungen und Laufwerksfehler

  • Lastverteilung: Sorgen Sie für eine ausgewogene Verteilung der Workloads über die Knoten in Ihrem Cluster

  • Auf dem Laufenden bleiben: Halten Sie Firmware und Systemsoftware über das System-Menü auf dem neuesten Stand

  • Remote-Console-Zugriff: Verwenden Sie die Fernkonsole-Funktion für direkte Fehlerbehebung, wenn physischer Konsolen- oder SSH-Zugriff erforderlich ist

  • Überwachung des Fabric-Status: Überwachen Sie den Fabric-Status der Core-NICs, um eine ordnungsgemäße Netzwerkintegration und Redundanz sicherzustellen

  • Laufwerkszustand: Überwachen Sie Laufwerksfehlerzähler und den Reparaturstatus, um Speicherprobleme proaktiv anzugehen

  • Temperaturmanagement: Beheben Sie wiederholte Temperaturwarnungen, indem Sie Kühlsysteme und Luftstrom überprüfen

Zuletzt aktualisiert

War das hilfreich?