> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/learn-the-platform/de/modul-9-monitoring-und-fehlerbehebung/05-diagnostics-toolkit.md).

# Diagnose-Toolkit

## Vier Diagnosetoolkits in einer Plattform

VergeOS bettet Diagnosetools direkt in jedes große Teilsystem ein. Anstatt per SSH auf einzelne Knoten zuzugreifen oder Tools von Drittanbietern zu installieren, führen Administratoren Diagnosen über die **VergeOS-Benutzeroberfläche** — jeweils auf die untersuchte Komponente zugeschnitten.

```mermaid
graph LR
    subgraph "VergeOS-Diagnostik"
        A["Netzwerk<br/>Diagnostik"] --> E["Einheitliche UI"]
        B["Knoten<br/>Diagnostik"] --> E
        C["vSAN<br/>Diagnostik"] --> E
        D["NAS<br/>Diagnostik"] --> E
    end
    E --> F["Ergebnisse &<br/>CLI-Export"]

    style A fill:#4a90d9,color:#fff
    style B fill:#e67e22,color:#fff
    style C fill:#27ae60,color:#fff
    style D fill:#8e44ad,color:#fff
    style E fill:#2c3e50,color:#fff
    style F fill:#34495e,color:#fff
```

Jede Diagnoseschnittstelle folgt demselben Muster:

1. Navigieren Sie zur Komponente (Netzwerk, Knoten, NAS oder vSAN)
2. Klicken Sie auf **Diagnose** im linken Menü
3. Wählen Sie einen Befehl aus dem **Abfrage** Dropdown
4. Konfigurieren Sie rechts die Parameter
5. Klicken Sie auf **Senden →** auszuführen

{% hint style="success" %}
**Schalter „Befehl anzeigen“**

Aktivieren **„Befehl anzeigen“** bei jeder Diagnose, um den exakt ausgeführten Befehl zu sehen. Dies ist die maßgebliche Methode, um die zugrunde liegende Syntax für Skripting, Automatisierung oder das Nachvollziehen eines Befehls über SSH anzuzeigen.
{% endhint %}

***

## Netzwerkdiagnostik

**Zugriff:** Netzwerke → \[Netzwerk auswählen] → Diagnostik

Netzwerkdiagnosen laufen **pro Netzwerk** — Sie wählen das konkrete Netzwerk aus, das Sie beheben möchten, und alle Befehle werden innerhalb dieses Netzwerk-Kontexts ausgeführt. Das ist entscheidend, weil VergeOS-Netzwerke per Design isoliert sind.

### Konnektivität & Erkennung

| Befehl                  | Zweck                                                   |
| ----------------------- | ------------------------------------------------------- |
| **Ping**                | Einfacher ICMP-Konnektivitätstest                       |
| **Traceroute**          | Den Netzwerkpfad zu einem Ziel verfolgen                |
| **ARP-Scan**            | Aktive Geräte im Netzwerk erkennen                      |
| **ARP-Tabelle**         | Aktuelle IP-zu-MAC-Zuordnungen anzeigen                 |
| **TCP-Verbindungstest** | Prüfen, ob ein bestimmter TCP-Port erreichbar ist       |
| **Welche IP habe ich**  | Die externe IP des Netzwerks prüfen (NAT-Verifizierung) |

### DNS & Namensauflösung

| Befehl          | Zweck                                         |
| --------------- | --------------------------------------------- |
| **DNS-Abfrage** | A-, AAAA-, MX-, NS- und PTR-Einträge abfragen |

### Firewall & Sicherheit

| Befehl                                 | Zweck                                        |
| -------------------------------------- | -------------------------------------------- |
| **Firewall-Regeln anzeigen**           | Das vollständige Firewall-Regelwerk anzeigen |
| **Firewall-Regeln verfolgen/debuggen** | Pro-Regel-Logging für Debugging aktivieren   |
| **NMAP**                               | Port-Scanning und Diensterkennung            |

### Traffic-Analyse

| Befehl                     | Zweck                                   |
| -------------------------- | --------------------------------------- |
| **TCP Dump**               | Paketmitschnitt mit BPF-Filterung       |
| **Top-Netzwerkauslastung** | Bandbreitenverbrauch in Echtzeit        |
| **Top-CPU-Auslastung**     | Prozesse mit dem höchsten CPU-Verbrauch |

### Dienstspezifisch

| Befehl                      | Zweck                                                       |
| --------------------------- | ----------------------------------------------------------- |
| **DHCP freigeben/erneuern** | DHCP-Lease-Aktualisierung erzwingen (DHCP-Client-Netzwerke) |
| **IPsec**                   | IPsec-VPN-Tunnel überwachen und steuern                     |
| **FRRouting BGP/OSPF**      | Status des dynamischen Routing-Protokolls                   |
| **Protokolle**              | Systemprotokolle des Netzwerkcontainers                     |

{% hint style="info" %}
**Mandantenzugriff**

Mandanten haben Zugriff auf ihre eigenen Netzwerkdiagnosen für mandantenspezifische Netzwerke. Diese Tools arbeiten innerhalb des Netzwerkbereichs des Mandanten — sie können keine Netzwerke auf Elternebene sehen.
{% endhint %}

***

## Knotendiagnostik

**Zugriff:** Infrastruktur → Knoten → \[Knoten auswählen] → Diagnostik

Knotendiagnosen bieten **auf Hardware-Ebene** Einblick in einzelne physische Server. Diese Tools interagieren direkt mit dem BMC des Servers, den Laufwerken und den physischen Netzwerkschnittstellen.

### IPMI-/BMC-Tools

Diese Befehle kommunizieren mit dem Baseboard Management Controller des Servers — der Out-of-Band-Verwaltungsschnittstelle (iDRAC bei Dell, iLO bei HPE usw.).

| Befehl                            | Zweck                                     |
| --------------------------------- | ----------------------------------------- |
| **IPMI BMC-Info**                 | BMC-Firmware und -Konfiguration           |
| **IPMI-Chassis-Status**           | Energiezustand, Eindringungserkennung     |
| **IPMI FRU-Info**                 | Identifikation austauschbarer Einheiten   |
| **IPMI LAN-Info**                 | BMC-Netzwerkkonfiguration                 |
| **IPMI MC-Reset**                 | Einen nicht reagierenden BMC zurücksetzen |
| **IPMI-Sensoren**                 | Temperatur-, Spannungs- und Lüfterwerte   |
| **IPMI Sensor Data Repository**   | Vollständiges Sensor-Daten-Repository     |
| **IPMI-Systemereignisprotokolle** | Hardware-Ereignisverlauf (SEL)            |

{% hint style="warning" %}
**IPMI MC-Reset**

Das Zurücksetzen des BMC unterbricht vorübergehend die Out-of-Band-Verwaltung. Das Host-Betriebssystem läuft weiter — betroffen ist nur der Management-Controller.
{% endhint %}

### Laufwerks- und Speicherzustand

| Befehl                       | Zweck                                                                              |
| ---------------------------- | ---------------------------------------------------------------------------------- |
| **S.M.A.R.T.-Informationen** | Gesundheitsattribute des Laufwerks, Abnutzung, Temperatur                          |
| **S.M.A.R.T.-Diagnosetest**  | Kurze, lange oder Übertragungstests ausführen                                      |
| **Blockgeräte anzeigen**     | Alle Blockgeräte auf dem Knoten auflisten                                          |
| **LED-Steuerung (Laufwerk)** | Die Locate-LED des Laufwerks zur physischen Identifikation aktivieren/deaktivieren |
| **RAS-Abfrage**              | Meldungen zu Speicher-ECC-Fehlern                                                  |

### Netzwerk & Fabric

| Befehl                     | Zweck                                              |
| -------------------------- | -------------------------------------------------- |
| **Ethernet-Tool**          | Link-Geschwindigkeit, Duplex, Treiberinformationen |
| **Fabric-Konfiguration**   | Status der Kern-Fabric für diesen Knoten           |
| **Netzwerk-Bonding**       | Zustand der Bond-Schnittstelle und aktiver Slave   |
| **Bridge-Adressen**        | MAC-Adressentabelle des virtuellen Switches        |
| **ARP-Scan / ARP-Tabelle** | Netzwerkerkennung auf Knotenebene                  |
| **Ping / Traceroute**      | Grundlegende Konnektivität aus dem Knoten-Kontext  |

### System

| Befehl                           | Zweck                                                     |
| -------------------------------- | --------------------------------------------------------- |
| **DMI-Tabelle**                  | Vollständiges Hardware-Inventar (CPU, RAM, Seriennummern) |
| **Protokolle**                   | System- und Kernel-Protokolle                             |
| **OpenSSL-Geschwindigkeit**      | Benchmark der kryptografischen CPU-Leistung               |
| **Persistenten Speicher leeren** | Dateisystem-Caches leeren (nur für den Support)           |

{% hint style="info" %}
**Kommen Sie von VMware oder Nutanix?**
{% endhint %}

| Plattform | Wo tiefgehende Hardware-Inspektionen stattfinden                                                                                                                                                       |
| --------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| VMware    | SSH/DCUI zum ESXi-Host für `esxcli`/`vsish`; vCenter stellt einige S.M.A.R.T.-/Sensor-Daten bereit, aber für tiefgehende Arbeiten verlässt man die vSphere-Benutzeroberfläche                          |
| Nutanix   | Prism Element Hardware-Seite + `ncli` vom CVM aus; IPMI/BMC separat für Laufwerks-LED und detaillierte Sensoren aufgerufen                                                                             |
| VergeOS   | Diagnosepanel für einen einzelnen Knoten: IPMI, S.M.A.R.T., Laufwerks-LED-Steuerung, Fabric-Gesundheit, ohne SSH oder separate BMC-Zugangsdaten. „Befehl anzeigen“ zeigt die zugrunde liegende Syntax. |

***

## vSAN-Diagnosen

**Zugriff:** System → vSAN-Diagnosen

vSAN-Diagnosen arbeiten auf **Systemebene**und bieten tiefe Einblicke in die verteilte Speicher-Engine.

{% hint style="warning" %}
**Nur auf Root-/Elternebene**

vSAN-Diagnosen sind nur auf Root-/Elternebene verfügbar. **Mandanten haben keinen Zugriff** auf vSAN-Diagnosetools — sie interagieren mit dem Speicher über ihre zugewiesenen virtuellen Festplatten.
{% endhint %}

### Wichtige vSAN-Diagnosebefehle

| Befehl                                    | Zweck                                                      |
| ----------------------------------------- | ---------------------------------------------------------- |
| **Tier-Status abrufen**                   | Gesundheit, Redundanz und Kapazität pro Ebene              |
| **Cluster-Raten abrufen**                 | Lese-/Schreibdurchsatz im gesamten Cluster                 |
| **Cluster-Nutzung abrufen**               | Allgemeine Statistiken zur Speichernutzung                 |
| **Geräteliste abrufen**                   | Alle Speichergeräte im vSAN-Pool                           |
| **Gerätestatus abrufen**                  | Zustand einzelner Geräte und Fehlerzähler                  |
| **Gerätenutzung abrufen**                 | Kapazitäts- und I/O-Metriken pro Gerät                     |
| **Reparaturstatus abrufen**               | Aktueller Fortschritt von Wiederaufbau-/Reparaturvorgängen |
| **Journalstatus abrufen**                 | Gesundheit des Write-Ahead-Journals                        |
| **Status der Integritätsprüfung abrufen** | Fortschritt der Datenintegritätsprüfung                    |
| **Cache-Info abrufen**                    | Cache-Treffer-/Fehlverhältnisse und Speichernutzung        |
| **Dateistatus abrufen**                   | Replikation und Integrität für eine bestimmte Datei        |
| **Top-Nutzungsraten abrufen**             | Top-Speicherverbraucher identifizieren                     |
| **Laufende Konfiguration abrufen**        | Aktuelle vSAN-Konfigurationsparameter                      |
| **Sync-Liste abrufen**                    | Aktive Synchronisierungsvorgänge                           |
| **Knotenliste abrufen**                   | Alle am vSAN teilnehmenden Knoten                          |
| **Integritätsprüfung**                    | Eine vollständige Integritätsprüfung starten               |
| **Festplattennutzung zusammenfassen**     | Zusammenfassung der Festplattennutzung im gesamten Cluster |

### vSAN-Gesundheitsprüfungs-Workflow

Ein strukturierter Ansatz zur Untersuchung von Speicherproblemen:

```mermaid
flowchart TD
    A["Status der Ebene prüfen"] --> B{"Alle Ebenen<br/>working = true?"}
    B -->|Ja| C["Cluster-Raten prüfen"]
    B -->|Nein| D["Reparaturstatus prüfen"]
    D --> E["Gerätestatus prüfen<br/>bei ausgefallenen Laufwerken"]
    C --> F{"Leistung<br/>akzeptabel?"}
    F -->|Ja| G["System gesund"]
    F -->|Nein| H["Cache-Info prüfen"]
    H --> I["Top-Nutzungsraten prüfen"]
    I --> J["Engpass identifizieren"]
    E --> K["S.M.A.R.T.-Daten prüfen<br/>über Knotendiagnostik"]

    style A fill:#27ae60,color:#fff
    style G fill:#27ae60,color:#fff
    style D fill:#e74c3c,color:#fff
    style E fill:#e74c3c,color:#fff
```

### Wichtige zu überwachende Indikatoren

* **`working = false`** bei einer beliebigen Ebene → Kritisch — Ebene ist nicht betriebsbereit
* **`redundant = false`** → Degradierter Zustand, keine Fehlertoleranz
* **`bad_drives > 0`** → Laufwerksfehler erkannt, automatische Reparatur läuft
* **Reparaturstatus überall null** → Keine aktiven Reparaturen (gesunder Zustand)
* **Schreibdrosselung aktiv** → Speicherkapazität nähert sich den Grenzen (>91 % löst Drosselung aus)

### Schwellenwerte für die Drosselung des Speicherplatzes

| Auslastung | Verhalten                                                        |
| ---------- | ---------------------------------------------------------------- |
| **< 91%**  | Normalbetrieb, keine Drosselung                                  |
| **91–95%** | Drosselung bei wenig Speicher beginnt (10 ms zusätzliche Latenz) |
| **96%+**   | Kritische Drosselung (50 ms zusätzliche Latenz)                  |
| **> 96%**  | Starke Leistungsverschlechterung                                 |

***

## NAS-Diagnosen

**Zugriff:** NAS → \[NAS-Dienst auswählen] → Diagnostik

NAS-Diagnosen sind **pro NAS-Dienst** — jede NAS-Instanz hat ihre eigene Diagnoseschnittstelle. Diese Tools konzentrieren sich auf Dateifreigabeprotokolle (SMB/CIFS, NFS) und Authentifizierung.

### Dateifreigabe & Authentifizierung

| Befehl      | Zweck                                                                                                            |
| ----------- | ---------------------------------------------------------------------------------------------------------------- |
| **Samba**   | SMB/CIFS-Dienststatus — aktive Verbindungen und gesperrte Dateien, Konfigurationsprüfung und Freigabenauflistung |
| **NFS**     | NFS-Dienststatus — aktuelle Exporte, RPC-Registrierung und Sichtbarkeit von Client-Mounts                        |
| **Winbind** | Active-Directory-Prüfungen — Vertrauensbeziehung zur Domäne, Domänenbenutzer und Domänengruppen                  |

### Standard-Netzwerktools

NAS-Diagnosen enthalten auch die Standard-Konnektivitätstools: **Ping**, **Traceroute**, **ARP-Scan/Tabelle**, **TCP Dump**, **TCP-Verbindungstest**, **DNS-Abfrage**, **NTP-Abfrage**, **Top-CPU-Auslastung**, **Top-Netzwerkauslastung**, und **Protokolle**.

### Benutzer- und Gruppen-Diagnostik

| Befehl            | Zweck                                          |
| ----------------- | ---------------------------------------------- |
| **Benutzer**      | Systembenutzerkonten                           |
| **Gruppen**       | Systemgruppen und Mitgliedschaften             |
| **Datum/Uhrzeit** | Zeitsynchronisation (kritisch für Kerberos/AD) |
| **Dienste**       | Alle laufenden Dienste                         |

***

## Troubleshooting-Workflow nach Best Practice

Wenn Sie ein Problem untersuchen, folgen Sie einem strukturierten Eskalationspfad von komponentenspezifischer Diagnostik bis zur systemweiten Analyse:

```mermaid
flowchart TD
    A["1. Umfang festlegen"] --> B["Welche Komponente ist betroffen?<br/>Netzwerk? Speicher? Hardware? NAS?"]
    B --> C["2. Komponentendiagnostik"]
    C --> D["Verwenden Sie das passende Toolkit:<br/>Netzwerk → Netzwerk-Diagnostik<br/>Speicher → vSAN-Diagnostik<br/>Hardware → Knoten-Diagnostik<br/>Dateifreigaben → NAS-Diagnostik"]
    D --> E{"Problem<br/>behoben?"}
    E -->|Ja| F["Ergebnisse dokumentieren"]
    E -->|Nein| G["3. Systemdiagnostik"]
    G --> H["System → System-Diagnostik<br/>Erstellt ein vollständiges Diagnosepaket"]
    H --> I{"Problem<br/>behoben?"}
    I -->|Ja| F
    I -->|Nein| J["4. An den Support eskalieren"]
    J --> K["Diagnosepaket anhängen<br/>Zeitverlauf & Symptome beifügen"]

    style A fill:#3498db,color:#fff
    style C fill:#2ecc71,color:#fff
    style G fill:#f39c12,color:#fff
    style J fill:#e74c3c,color:#fff
```

### Workflow-Richtlinien

1. **Einfach anfangen** — Vor dem Paketmitschnitt pingen. Den Ebenenstatus vor Integritätsprüfungen prüfen.
2. **Den Umfang korrekt festlegen** — Wählen Sie vor dem Ausführen von Diagnosen das richtige Netzwerk, den richtigen Knoten oder den richtigen NAS-Dienst aus. Das Ausführen von Befehlen im falschen Kontext liefert irreführende Ergebnisse.
3. **Währenddessen dokumentieren** — Verwenden Sie „Befehl anzeigen“, um exakte Befehle zu erfassen. Kopieren Sie die Ausgabe, bevor Sie mit dem nächsten Test fortfahren.
4. **Auswirkungen auf die Leistung berücksichtigen** — TCP Dump, NMAP-Scans und Integritätsprüfungen können die Produktionsleistung beeinträchtigen. Planen Sie intensive Diagnosen in Wartungsfenstern ein.
5. **Protokolle zuletzt prüfen** — Protokolle liefern Kontext, können aber überwältigend sein. Verwenden Sie zuerst gezielte Diagnosen und gleichen Sie sie anschließend mit den Protokolleinträgen ab.

### Systemdiagnosen-Bundle

Für Probleme, die mehrere Komponenten betreffen oder eine Eskalation an den Support erfordern, kann VergeOS ein **vollständiges Diagnosepaket**:

* **Zugriff:** System → Systemdiagnosen
* **Ausgabe:** `[SYSTEMNAME]_diags_[YYYYMMDD]_[HHMMSS].tar.gz`
* **Inhalt:** vSAN-Statusdateien, S.M.A.R.T.-Berichte, Netzwerkkonfiguration, IPMI-Daten, Systemprotokolle und Kernel-Protokolle — pro Knoten organisiert
* **Paketablage:** Gespeichert als ein `Datei` Eintrag in vSAN; das Paket bleibt bestehen, bis Sie es löschen

{% hint style="info" %}
**UI-Protokollaufbewahrung vs. Paketaufbewahrung**

Das Diagnosepaket selbst läuft nicht automatisch ab. Zusätzlich bewahrt VergeOS aktive UI- **Systemprotokolle 45 Tage lang** vor dem automatischen Löschen auf — konfigurieren Sie ein Remote-Syslog-Forwarding, wenn Sie einen längeren Protokollverlauf benötigen.
{% endhint %}

{% hint style="success" %}
**Vor der Eskalation**

Erstellen Sie immer ein aktuelles System-Diagnosepaket, bevor Sie den Support kontaktieren. Das liefert einen vollständigen Point-in-Time-Snapshot, den Supporttechniker analysieren können, ohne Live-Systemzugriff zu benötigen.
{% endhint %}

***

## Schnellreferenz: Welches Toolkit verwenden

### Netzwerkdiagnostik

**Verwenden bei:** VM kann nicht ins Internet, DNS wird nicht aufgelöst, Firewall blockiert Traffic, DHCP vergibt keine IPs, VPN-Tunnel ausgefallen

**Zugriff:** Netzwerke → \[Netzwerk] → Diagnostik

### Knotendiagnostik

**Verwenden bei:** Hardwarewarnungen, Laufwerksausfälle, Temperaturwarnungen, NIC-Link-Probleme, BMC reagiert nicht, Fabric-Konnektivitätsprobleme

**Zugriff:** Infrastruktur → Knoten → \[Knoten] → Diagnostik

### vSAN-Diagnosen

**Verwenden bei:** Speicherleistung verschlechtert, Ebene ungesund, Kapazitätswarnungen, Reparatur hängt, Bedenken hinsichtlich der Datenintegrität

**Zugriff:** System → vSAN-Diagnosen

### NAS-Diagnosen

**Verwenden bei:** SMB-Freigaben nicht zugänglich, NFS-Mounts schlagen fehl, AD-Authentifizierung defekt, Dateiberechtigung verweigert, langsame CIFS-Leistung

**Zugriff:** NAS → \[NAS-Dienst] → Diagnostik


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/learn-the-platform/de/modul-9-monitoring-und-fehlerbehebung/05-diagnostics-toolkit.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
