NVIDIA vGPU-Konfiguration
Schritt-für-Schritt-Anleitung zur Konfiguration von NVIDIA vGPU in VergeOS, einschließlich herkömmlicher vGPU-Profile, MIG-Partitionierung, heterogener Profile, Einrichtung von Ressourcengruppen und Freigabe an Tenants.
VergeOS ermöglicht die nahtlose Nutzung der vGPU-Plattform von NVIDIA, um virtualisierte GPU-Geräte zwischen Mandanten und VMs zuzuweisen.
Die NVIDIA-vGPU-Funktionalität erfordert die kommerzielle vGPU-Lizenzierung von NVIDIA. Dies gilt sowohl für herkömmliche vGPU- als auch für MIG-gestützte vGPU-Konfigurationen.
Gesamtablauf
Dies sind die wichtigsten Schritte für die NVIDIA-vGPU-Konfiguration in VergeOS:
Treiber hochladen Laden Sie den mitgelieferten NVIDIA-Treiber in die VergeOS-Umgebung hoch.
Ressourcengruppe erstellen Generieren Sie eine Ressourcengruppe auf Basis ausgewählter physischer GPU-Geräte und wählen Sie dabei ein MIG- oder herkömmliches vGPU-Profil. Dadurch wird ein Pool zuweisbarer vGPU-Geräte erstellt. Pro physischem Gerät können mehrere Ressourcengruppen erstellt werden, um eine Mischung verschiedener vGPU-Typen für unterschiedliche Anwendungsfälle bereitzustellen.
Treiber laden Jeder Knoten sollte in den Wartungsmodus versetzt werden, um den NVIDIA-Treiber zu laden. (Ein Neustart des Knotens kann erforderlich sein, wenn IOMMU noch nicht aktiviert wurde und/oder der Treiber zum ersten Mal geladen wird.)
Geräte einzelnen VMs hinzufügen Fügen Sie einer VM ein Gerät hinzu und wählen Sie dabei die erstellte Ressourcengruppe aus. Dadurch kann die VM auf den Pool verfügbarer virtueller GPU-Geräte innerhalb der Ressourcengruppe zugreifen.
An Mandanten freigeben Geben Sie Geräte an einzelne Mandanten frei, sodass diese die vGPU-Geräte zu ihren eigenen VMs hinzufügen können.
Die folgenden Abschnitte bieten schrittweise Anleitungen zum Aktivieren und Zuweisen von NVIDIA-vGPU-Ressourcen in VergeOS.
Voraussetzungen
Bevor Sie beginnen, stellen Sie sicher, dass Folgendes vorhanden ist:
NVIDIA-vGPU-fähige GPU in einem oder mehreren VergeOS-Knoten installiert (siehe Von NVIDIA unterstützte GPUs )
IOMMU / VT-d / SR-IOV aktiviert im Host-BIOS — falls noch nicht aktiviert, planen Sie während dieses Vorgangs einen Neustart des Knotens ein (befolgen Sie die ordnungsgemäßen Wartungsmodus Verfahren).
NVIDIA-vGPU-Softwarelizenz — Zugriff auf das NVIDIA-Lizenzierungsportal zum Beziehen von Treibern
VergeOS-Adminzugriff auf den Ressourcen-Manager und die Knotenkonfiguration
Vertrautheit mit Risiken und Vorsichtsmaßnahmen beim PCI-Passthrough
Host-Installation/Konfiguration
Besorgen Sie sich den passenden NVIDIA-Linux-KVM-Treiber für Ihre GPU-Hardware. NVIDIA-vGPU-Treiber können über Ihr NVIDIA-Lizenzierungsportal heruntergeladen werden oder durch Registrierung für eine kostenlose NVIDIA-Testversion: https://nvidia.com/en-us/data-center/resources/vgpu-evaluation.
VergeOS unterstützt NVIDIA-Treiber mit Bundle-Version. Eine Liste der derzeit unterstützten NVIDIA-Treiber finden Sie unter Ressourcen-Manager > Gruppen > Neu. Setzen Sie Typ=NVIDIA vGPU und klicken Sie auf die Schaltfläche, um kompatible Treiber von Drittanbietern anzuzeigen. In der Regel sollten Sie den neuesten Treiber aus dieser Liste verwenden, der mit Ihrer NVIDIA-Hardware kompatibel ist.
Laden Sie den NVIDIA-Bundle-Treiber in das VergeOS-vSAN hoch. Siehe Hochladen in das vSAN (Dateien) für Anweisungen zum Hochladen.
Navigieren Sie zum Dashboard des Ressourcenmanagers (Infrastruktur > Ressourcen aus dem oberen Menü) -ODER- Navigieren Sie zu einem spezifischer Knoten wo die NVIDIA-Hardware installiert ist (Infrastruktur > Knoten).
Klicken Sie auf die PCI-GERÄTE Karte im Dashboard.
Wählen Sie die gewünschten physischen NVIDIA-Geräte aus. Um die gewünschten NVIDIA-Karten leicht zu finden, verwenden Sie die Suchleiste, um nach Name ("nvidia") oder Typ: Display-Controller zu filtern.
Klicken Sie Ressource erstellen im linken Menü.
Eine vorhandene vGPU-Ressourcengruppe auswählen -ODER- wählen Sie --Neue Gruppe-- aus, um das Gerät zuzuordnen.
Felder der Ressourcengruppe:
Namen: Bezeichnung zur Identifizierung der Ressourcengruppe (d. h. des Gerätepools); verwenden Sie einen aussagekräftigen Namen, damit Benutzer den Typ der verfügbaren virtuellen Geräte in dieser Gruppe leicht erkennen können.
Typ: sollte auf NVIDIA vGPU (Dieses Feld wird automatisch gesetzt, wenn die Ressourcengruppe auf Grundlage eines NVIDIA-Geräts initialisiert wurde.)
Beschreibung: optionales Feld für zusätzliche administrative Hinweise zur Ressourcengruppe
Klasse: wählen Sie vGPU. Dieses Feld wird nur verwendet, um der Ressourcengruppe ein zugehöriges Dashboard-Symbol zuzuweisen, und hat keinen Einfluss auf die Funktionalität
NVIDIA-vGPU-Profil: legen Sie hier den vGPU-Typ fest, den diese Ressourcengruppe erstellen soll
Der Treiber Dropdown-Liste enthält alle NVIDIA-vGPU-Treiber (.zip), die im Dateien Abschnitt gefunden wurden. Der passende Treiber muss vor der Auswahl in das vSAN hochgeladen werden (Schritte 1–2 oben). Wählen Sie den passenden Treiber aus.
Klicken Sie Senden um die Ressourcengruppe zu speichern. Nachdem die Ressourcengruppe ausgewählt oder eine neue erstellt wurde, ein Erfolgsmeldung angezeigt werden, die darauf hinweist, dass Ressourceregeln für das/die Gerät(e) erstellt wurden.
Wenn ein Treiber noch nicht zuvor geladen wurde oder IOMMU noch nicht aktiviert ist, starten Sie die zugehörigen Knoten neu in Wartungsmodus bevor Sie fortfahren.
Nachdem die Knoten neu gestartet wurden, navigieren Sie zu der gerade erstellten NVIDIA-vGPU-Ressourcengruppe (Infrastruktur > Ressourcen > Gruppen > Doppelklick auf die Gruppe).
Klicken Sie Bearbeiten im linken Menü.
Wählen Sie NVIDIA-vGPU-Profil: Traditionell oder MIG (die Tabs unten enthalten die entsprechenden Anweisungen):
NVIDIA-vGPU-Profil: wählen Sie das gewünschte herkömmliche Profil aus.
Gesamtzahl der vGPU-Instanzen: Anzahl der virtuellen Instanzen, die mit dem angegebenen Profil erstellt werden sollen.
Scheduler-Richtlinie, Frequenz, Mittelungsfaktor, Zeitscheibenlänge (ms), Striktes Round Robin: NVIDIA-spezifische Einstellungen — lesen Sie die NVIDIA-Dokumentation für spezifisches Performance-Tuning.
Treiber: aus dem vorherigen Schritt vorausgefüllt.
NVIDIA-vGPU-Profil: wählen Sie das gewünschte MIG-Profil aus.
MIG-GPU-Instanzen: (das Maximum ist in der Beschreibung angegeben) Anzahl der zu erstellenden MIG-Instanzen.
Gesamtzahl der vGPU-Instanzen: Standard=0 (Maximum) - diese Einstellung bestimmt die Anzahl der zuweisbaren virtuellen GPU-Instanzen pro MIG-Partition.
Belassen Sie diesen Wert bei 0, um automatisch die maximale Anzahl virtueller GPUs für das ausgewählte MIG-Profil zu erstellen.
Setzen Sie den Wert auf 1, um eine einzelne virtuelle GPU unter Verwendung des gesamten MIG-Slices zu erstellen.
Wenn ein anderer Wert als 0 oder 1 gesetzt wird, bleibt innerhalb des MIG-Slices ungenutzte Kapazität zurück.
Treiber: aus dem vorherigen Schritt vorausgefüllt.
Gasttreiber-ISO
Die folgenden Gasttreiber-Einstellungen gelten sowohl für traditionelle als auch für MIG-vGPU-Konfigurationen.
Treiber-ISO: Verwenden Sie die Gasttreiber-ISO erstellen Option, um automatisch ein Gasttreiber-Installationsprogramm für Ihre VMs zu erstellen. Wenn Sie bereits Gasttreiber erstellt haben, wählen Sie im nächsten Schritt das ISO aus.
Der Treiber-ISO Datei gibt eine ISO-Datei an, die an konsumierende VMs angehängt werden kann und eine bequeme Möglichkeit bietet, auf Client-Treiber zuzugreifen, um sie im Gastbetriebssystem zu installieren. (Wählen Sie die Gasttreiber anhängen Option beim Anhängen des Geräts an eine VM oder einen Mandanten.)
Treiber neu laden
Wenn die Ressourcengruppenkonfiguration abgeschlossen und gesendet wurde, versetzen Sie den Knoten in Wartungsmodus und klicken Sie auf Treiber neu laden.
Überwachen Sie die Protokolle des Knoten-Dashboards (am unteren Seitenrand), um zu überprüfen, dass der Treiber erfolgreich installiert wurde bevor Sie den Wartungsmodus deaktivieren.
Das Dashboard der Ressourcengruppe enthält die Ressourceregeln, die basierend auf den ausgewählten NVIDIA-Geräten automatisch generiert wurden. Sie können auf eine einzelne Regel klicken, um Konfigurationsdetails anzuzeigen. Eine systemseitig erstellte Regel kann bei Bedarf geändert werden. Zum Beispiel kann die Knoten Filter zu -- Keine -- so geändert werden, dass passende Geräte von allen Knoten eingeschlossen werden; der Slot Filter kann entfernt oder angepasst werden, um Geräte aufzunehmen, die sich auf unterschiedlichen Slots innerhalb desselben Knotens oder über verschiedene Knoten hinweg befinden können. Informationen zu Ressourceregeln sind verfügbar unter: Übersicht über das Geräte-Passthrough - Ressourceregeln
VM/Gast-Konfiguration
Navigieren Sie zum VM-Dashboard (über das obere Menü: Virtuelle Maschinen > Liste > Doppelklick auf die gewünschte VM in der Liste)
Klicken Sie Geräte im linken Menü.
Klicken Sie Neu im linken Menü.
Sie können Geräte auch über den Ressourcen-Manager an eine VM anhängen; diese Methode ermöglicht das gleichzeitige Hinzufügen mehrerer Geräte zur VM. Im Dashboard der Ressourcengruppe > Doppelklick auf die gewünschte vGPU-Gruppe > Maschinen-Geräte anzeigen > Neu; wählen Sie die VM aus der Dropdown-Liste Maschine aus.
Felder des Geräteeintragsformulars
Namen: einen Namen angeben um den Typ der vGPU/des Profils zu identifizieren -ODER- leer lassen, damit das System automatisch einen Namen für die Instanz generiert.
Typ: wählen Sie NVIDIA vGPU.
Beschreibung (optional): Hier kann zusätzlicher Text für administrative Zwecke eingegeben werden.
Ressourcengruppe: wählen Sie die passende NVIDIA-vGPU-Ressourcengruppe aus der Dropdown-Liste aus. (Die Liste der Ressourcengruppen zeigt die Anzahl der aktuell verfügbaren Geräte in der Gruppe an.)
Anzahl: geben Sie die Anzahl der vGPU-Geräte an, die an die VM angehängt werden sollen. (Diese Option ist nur verfügbar, wenn auf den Geräteeintrag über den Ressourcen-Manager zugegriffen wird.)
Gasttreiber anhängen: wenn für die Ressourcengruppe eine Gasttreiber-ISO angegeben wurde, können Sie diese Option aktivieren, um automatisch ein CD-ROM-Laufwerk mit NVIDIA-Gasttreibern an die VM anzuhängen.
Bildratenlimit: um eine Obergrenze für Bilder pro Sekunde festzulegen. Empfohlene Aktualisierungsrateneinstellungen hängen von Ihrem spezifischen Workload ab. Niedrigere Aktualisierungsraten verringern unnötigen Overhead auf der vGPU. Wenn sie ausschließlich für Compute-Workloads (wie ML/Inference) und nicht für Grafik-/Anzeigezwecke verwendet wird, kann das Bildratenlimit auf 0 gesetzt werden.
VNC der Konsole deaktivieren: diese Option kann verwendet werden, wenn die vGPU für das primäre Display verwendet werden soll, z. B. Zugriff ausschließlich per RDP.
Erweiterte NVIDIA-Einstellungen; lesen Sie die NVIDIA-Dokumentation zu den folgenden Optionen:
Unified Memory aktivieren
NVIDIA CUDA Toolkit-Debugger aktivieren
NVIDIA CUDA Toolkit-Profile aktivieren
Wenn die Felder ausgefüllt sind, klicken Sie auf Senden um das Hinzufügen des neuen Geräts abzuschließen.
Die VM benötigt einen Neustart um das Gerät anzuhängen. Klicken Sie im VM-Dashboard auf den Neustart Link in der Nachricht, die oben im Dashboard angezeigt wird, oder klicken Sie auf Neustart im linken Menü.
Erforderliche NVIDIA-Gasttreiber installieren; erforderliche Treiber variieren je nach spezifischem GPU-Modell und Gast-OS-Version. Wenn die Option zum Anhängen von Gasttreibern ausgewählt wurde, steht ein CD-ROM-Laufwerk mit den erforderlichen NVIDIA-Treibern zur Installation zur Verfügung.
Lesen Sie die NVIDIA-Dokumentation zu den Anforderungen/Anweisungen für die Lizenzierung von Client-vGPU.
Die NVIDIA-Client-Lizenzierung kann das Generieren eines Client-Konfigurations-Tokens auf dem NVIDIA-Lizenzierungsserver umfassen, das in den VM-Gast heruntergeladen werden muss, gefolgt von einem VM-Neustart.
Überprüfen Sie, ob die vGPU erkannt wird — sobald die Gasttreiber installiert und die VM neu gestartet wurde, führen Sie
nvidia-smiin der VM aus, um zu bestätigen, dass die virtuelle GPU erkannt wird und funktioniert.
Eine NVIDIA-vGPU an einen Mandanten freigeben
NVIDIA-vGPU-Geräte können an einen Mandanten übergeben werden, damit dieser sie an seine eigenen VMs weiterreichen kann. Wenn Sie Geräte an einen Mandanten durchreichen, wird innerhalb des Mandanten eine neue Ressourcengruppe erstellt.
Navigieren Sie zum gewünschten Mandanten-Dashboard (über das obere Menü: Tenants > Liste > doppelklicken Sie auf den Tenant in der Liste.)
Klicken Sie Knoten im linken Menü.
Doppelklicken Sie auf einen der Tenant-Knoten.
Klicken Sie Geräte im linken Menü.
Klicken Sie Neu im linken Menü.
Siehe Felder des Geräteeintragsformulars oben.
Wenn die Felder ausgefüllt sind, klicken Sie auf Senden um das Hinzufügen des neuen Geräts abzuschließen.
Das Gerät steht nun für die Zuordnung zu Mandanten-VMs zur Verfügung. Befolgen Sie die VM/Gast-Konfiguration Anweisungen oben.
Tipps zur Fehlerbehebung
Treiber neu laden: Jede Änderung an einer Ressourcengruppe erfordert ein Neuladen des Treibers. Folgen Sie den Neuladeaufforderungen oben im Knoten-Dashboard, um den Knoten in Wartungsmodus zu versetzen und die Treiber neu zu laden. Überwachen Sie die Knotenprotokolle, um zu bestätigen, dass der Treiber erfolgreich geladen wurde, bevor Sie den Wartungsmodus deaktivieren. Wiederholen Sie das Neuladen des Treibers für jeden betroffenen Knoten.
NVIDIA SMI (System Management Interface): Dies ist ein leistungsstarkes NVIDIA-Tool zur Fehlerbehebung bei Konfigurationen, das über die VergeOS-Benutzeroberfläche zugänglich ist. Zugriff auf Knotendiagnose, wählen Sie Abfrage: NVIDIA SMI und den gewünschten Befehl, um zusammenfassende oder detaillierte Abfrageinformationen zu Ihren konfigurierten NVIDIA-vGPU-Geräten bereitzustellen.
Zuletzt aktualisiert
War das hilfreich?
