For the complete documentation index, see llms.txt. This page is also available as Markdown.

NVIDIA vGPU 配置

在 VergeOS 中配置 NVIDIA vGPU 的分步指南,包括传统 vGPU 配置文件、MIG 分区、异构配置文件、资源组设置和租户共享。

VergeOS 允许无缝利用 NVIDIA 的 vGPU 平台,在租户和虚拟机之间分配虚拟化 GPU 设备。

26.1.3 新增

VergeOS 现已包含扩展的 NVIDIA 功能支持,可在不同工作负载之间分配 GPU 设备时提供更高的灵活性

  • 异构 vGPU 配置文件 - 在同一设备中使用多个传统 vGPU 配置文件。需要 NVIDIA 驱动版本 17.2 或更高版本,并且设备支持。

  • MIG 配置文件 - 单个 GPU 可划分为最多七个硬件隔离实例,以保证多个同时运行的工作负载获得服务。需要设备支持;建议使用最新的 NVIDIA 数据中心驱动。


整体工作流程

以下是配置 VergeOS NVIDIA vGPU 所需的高级步骤:

  • 上传驱动程序 将捆绑的 NVIDIA 驱动程序上传到 VergeOS 环境。

  • 创建资源组 基于所选物理 GPU 设备生成资源组,并选择 MIG 或传统 vGPU 配置文件。这将创建一个可分配的 vGPU 设备池。每个物理设备可创建多个资源组,以便为不同用例提供不同 vGPU 类型的组合。

  • 加载驱动程序 应将每个节点置于维护模式以加载 NVIDIA 驱动程序。(如果尚未启用 IOMMU 和/或是首次加载驱动程序,则可能需要重启节点。)

  • 向单个虚拟机添加设备 向虚拟机添加设备,并选择已创建的资源组。这样虚拟机就可以从该资源组中可用的虚拟 GPU 设备池中获取设备。

  • 共享给租户 将设备共享给单个租户,使其能够将 vGPU 设备添加到自己的虚拟机中。


以下部分提供了在 VergeOS 中启用并分配 NVIDIA vGPU 资源的分步说明。

前提条件

开始之前,请确保具备以下条件:

  • 支持 NVIDIA vGPU 的 GPU 已安装在一个或多个 VergeOS 节点中(请参见 NVIDIA 支持的 GPU )

  • 已在主机 BIOS 中启用 IOMMU / VT-d / SR-IOV ——如果尚未启用,请计划在此过程中重启节点(请遵循正确的 维护模式 操作流程)。

  • NVIDIA vGPU 软件许可 ——可访问 NVIDIA 许可门户 以获取驱动程序

  • VergeOS 管理员访问权限 资源管理器和节点配置

  • 熟悉 PCI 直通风险和注意事项

主机安装/配置

  1. 为你的 GPU 硬件获取合适的 NVIDIA Linux-KVM 驱动程序。NVIDIA vGPU 驱动程序可从你的 NVIDIA 许可门户下载,或者通过注册 NVIDIA 免费评估获取: https://nvidia.com/en-us/data-center/resources/vgpu-evaluation.

  2. 将 NVIDIA 捆绑驱动程序上传到 VergeOS vSAN。请参见 上传到 vSAN(文件) 以了解上传说明。

    以下说明通过为每个所选设备自动创建所需的资源规则并将设备附加到资源组,从而将所选 vGPU 设备配置为虚拟功能直通。这将创建一个可分配给租户和虚拟机的虚拟功能设备池,以供其使用。有关资源组和资源规则的更多信息,请参见: 设备直通 - 概述

  3. 导航到 资源管理器仪表板 (基础架构 > 资源 (从顶部菜单中) —或— 导航到 特定节点 NVIDIA 硬件安装的位置(基础架构 > 节点).

  4. 单击 PCI 设备 仪表板中的卡片。

  5. 选择所需的 NVIDIA 物理设备。 要更轻松地定位所需的 NVIDIA 卡,请使用搜索栏按名称(“nvidia”)或类型:显示控制器进行筛选。

  6. 单击 创建资源 左侧菜单中的。

  7. 选择现有的 vGPU 资源组 —或— 选择 --新建组-- 来附加该设备。


资源组字段:

  • 名称:用于识别资源组(即设备池)的标签;请使用具有描述性的名称,以便用户能够轻松识别该组中可用的虚拟设备类型。

  • 类型:应设置为 NVIDIA vGPU (如果资源组是基于 NVIDIA 设备启动的,则该字段会自动设置。)

  • 描述:可选字段,用于提供有关资源组的更多管理说明

  • 类别:选择 vGPU。此字段仅用于为资源组应用关联的仪表板图标,不影响功能

  • NVIDIA vGPU 配置文件:将其设置为你希望此资源组创建的 vGPU 类型

  • 驱动程序 下拉列表将包含在 文件 部分中找到的所有 NVIDIA vGPU 驱动程序(.zip)。在可选中之前,需要先将相应驱动程序上传到 vSAN(见上方步骤 1-2)。选择合适的驱动程序。

  • 单击 提交 以保存资源组。资源组被选定或新建后, 成功 消息应会出现,表明已为设备创建资源规则。

  • 如果之前未加载过驱动程序或 IOMMU 尚未启用, 重启相关节点维护模式 继续之前。

  • 节点重启后,导航到刚刚创建的 NVIDIA vGPU 资源组(基础设施 > 资源 > 组 > 双击该组)。

  • 单击 编辑 左侧菜单中的。

  • 选择 NVIDIA vGPU 配置文件:传统或 MIG(下方选项卡提供相关说明):

  • NVIDIA vGPU 配置文件:选择所需的传统配置文件。

  • vGPU 实例总数:使用给定配置文件创建的虚拟实例数量。

  • 调度策略, 频率, 平均因子, 时间片长度(毫秒), 严格轮询:NVIDIA 特定设置——请查阅 NVIDIA 文档以获取具体的性能调优信息。

  • 驱动程序:已从上一步预填充。

灵活配置文件配置

从 26.1.3 版本开始,VergeOS 支持异构 vGPU 配置文件。这提供了更高的灵活性,允许物理设备同时托管不同类型和大小的配置文件组合(需要 NVIDIA 驱动版本 17.2 或更高版本,并且设备支持)。

  • NVIDIA 只允许混合使用具有相同架构且属于同一兼容组的 vGPU 配置文件——请查阅 NVIDIA 文档了解更多信息。

  • 组合后的配置文件必须适合 GPU 的总帧缓冲区(可用 VRAM)。

  • MIG 和传统配置文件 不能 在同一物理设备上混用。

  • NVIDIA SMI 查询可提供与已为某个设备配置的 vGPU 配置文件兼容的信息。请参见 故障排除提示 了解更多信息。

示例:使用异构配置文件

  • 物理设备:NVIDIA L40S 提供 48 GB 的帧缓冲内存

  • 多种配置文件类型 已为该设备实现:

    • L40S-24C: 一个使用 24 GB 的计算优化型 vGPU 实例

    • L40S-12Q: 一个使用 12 GB 的图形优化型 vGPU 实例

    • L40S-4C: 三个轻量级计算 vGPU 实例,每个使用 4 GB(总计 12 GB)

    • 每种配置文件类型都会创建一个单独的资源组(设备池)。

    • 这些异构配置文件共同分配了整个帧缓冲区,同时 支持多种工作负载类型 (计算、图形、推理工作负载)在同一物理 GPU 上运行。

  • 剩余容量:此配置使用了 整个 48 GB 帧缓冲区,留下 没有剩余容量 用于额外的 vGPU 配置文件。

  • NVIDIA vGPU 配置文件:选择所需的 MIG 配置文件。

单个设备使用多个配置文件

  • 组合后的配置文件必须适合 GPU 的总帧缓冲区(可用 VRAM)。

  • MIG 和传统配置文件不能在同一物理设备上混用。

  • MIG GPU 实例: (最大值已在说明中列出)要创建的 MIG 实例数量。

  • vGPU 实例总数:默认=0(最大值)——此设置决定每个 MIG 分区可分配的虚拟 GPU 实例数量。

    • 将此值保持为 0,可自动为所选 MIG 配置文件创建最大数量的虚拟 GPU。

    • 将该值设为 1,可创建一个使用整个 MIG 切片的单个虚拟 GPU。

    • 将值设置为 0 或 1 以外的其他值,会导致 MIG 切片内部存在未使用的容量。

  • 驱动程序:已从上一步预填充。

示例:将 MIG 实例进一步划分为虚拟实例

  • 物理设备:RTX Pro 6000 Blackwell DC 提供 96 GB 的帧缓冲内存

MIG-vGPU

  • 已添加 MIG 配置文件:选择该配置文件 NVIDIA RTX Pro 6000 Blackwell DC‑2‑12Q‑MIG (2g.48gb+gfx) 并指定 MIG GPU 实例:1 会创建一个具有 48 GB 专用帧缓冲的 MIG 切片。该 MIG 切片支持 四个 vGPU 实例,每个使用 12 GB (“12Q” 配置文件)

  • 剩余容量:分配该 48 GB MIG 切片后, 48 GB 帧缓冲 仍可用于其他 MIG 配置文件

  • 可以创建一个或多个额外的资源组,以使用不同的 MIG 配置文件类型利用剩余容量。

来宾驱动 ISO

以下来宾驱动设置适用于传统和 MIG vGPU 配置。

  • 驱动 ISO:使用 创建来宾驱动 ISO 选项可自动为你的虚拟机创建来宾驱动安装程序。如果你已经创建了来宾驱动,请在下一步中选择该 ISO。

  • 驱动 ISO 文件指定一个可附加到使用中的虚拟机的 ISO 文件,为在来宾操作系统中安装客户端驱动程序提供了便捷方式。(附加设备到虚拟机或租户时选择 附加来宾驱动程序 选项。)

如果你选择了 创建来宾驱动 ISO 选项,请将驱动 ISO 字段保持为 -- 无 --;系统将自动创建 ISO 文件(基于所选捆绑驱动程序),用于向虚拟机安装客户端驱动程序。


重新加载驱动程序

  • 当资源组配置完成并提交后,将节点置于 维护模式 并点击 重新加载驱动程序.

  • 监控节点仪表板日志(页面底部),以 确认驱动程序已成功安装 ,然后再禁用维护模式。

虚拟机/客户配置

  1. 导航到虚拟机仪表板(从顶部菜单:虚拟机 > 列表 > 双击列表中所需的虚拟机)

  2. 单击 设备 左侧菜单中的。

  3. 单击 新建 左侧菜单中的。

设备条目表单字段

  • 名称: 提供一个名称 以标识 vGPU/配置文件的类型 —或— 留空以允许系统自动为该实例生成名称。

  • 类型:选择 NVIDIA vGPU.

  • 描述 (可选):可在此处输入额外文本用于管理目的。

  • 资源组:从下拉列表中选择合适的 NVIDIA vGPU 资源组。(资源组列表将显示该组中当前可用的设备数量。)

  • 数量:指明要附加到虚拟机的 vGPU 设备数量。(此选项仅在通过资源管理器访问设备条目时可用。)

  • 附加来宾驱动程序:如果为资源组指定了来宾驱动 ISO,则可以选中此选项,以自动向虚拟机附加一个加载了 NVIDIA 来宾驱动程序的 CD-ROM 驱动器。

  • 帧率限制:用于限制每秒帧数。建议的刷新率设置取决于你的具体工作负载。较低的刷新率可减少 vGPU 上不必要的开销。如果它仅用于计算工作负载(如 ML/推理),而不用于任何图形/显示用途,则帧率限制可设置为 0。

  • 禁用控制台 VNC:当 vGPU 用作主显示时可使用此选项,例如仅通过 RDP 访问。

  • 高级 NVIDIA 设置;有关以下选项的信息请参阅 NVIDIA 文档:

    • 启用统一内存

    • 启用 NVIDIA CUDA 工具包调试器

    • 启用 NVIDIA CUDA 工具包分析器

  1. 填写完字段后,单击 提交 以完成添加新设备。

  2. 该虚拟机将需要 重启 才能附加该设备。在虚拟机仪表板中,单击顶部出现消息中的 重启 链接,或单击 重启 左侧菜单中的。

  3. 安装所需的 NVIDIA 来宾驱动程序;所需驱动程序会因具体 GPU 型号和来宾操作系统版本而异。如果选择了附加来宾驱动程序的选项,将会提供一个包含安装所需 NVIDIA 驱动程序的 CD-ROM 驱动器。

  4. 请查阅 NVIDIA 文档,了解客户端 vGPU 许可要求/说明。

  5. 验证是否检测到 vGPU — 一旦安装来宾驱动程序并重启虚拟机,请运行 nvidia-smi 在虚拟机内部确认虚拟 GPU 已被识别并正常运行。

将 NVIDIA vGPU 共享给租户

NVIDIA vGPU 设备可以传递给租户,再由租户传递给其自己的虚拟机。当你将设备直通给租户时,会在租户内部创建一个新的资源组。

共享给租户的设备是厚置备的(即租户随后拥有这些设备,因此即使未使用,也不能分配给其他虚拟机或租户。)

  1. 导航到所需的 租户仪表板 (从顶部菜单:租户 > 列表 > 在列表中双击该租户。)

  2. 单击 节点 左侧菜单中的。

  3. 双击其中一个租户节点.

  4. 单击 设备 左侧菜单中的。

  5. 单击 新建 左侧菜单中的。

  6. 请参考 设备条目表单字段 上文。

  7. 填写完字段后,单击 提交 以完成添加新设备。

  8. 该设备现在可用于附加到租户的虚拟机。请遵循 虚拟机/客户配置 上方说明。

故障排除提示

  • 重新加载驱动程序:对资源组的任何更改都需要重新加载驱动程序。请按照节点仪表板顶部的重新加载提示,将节点置于 维护模式 并重新加载驱动程序。请监控节点日志,确认驱动程序已成功加载后再禁用维护模式。对每个适用节点重复执行驱动程序重新加载。

  • NVIDIA SMI(系统管理接口):这是一个功能强大的 NVIDIA 工具,可用于从 VergeOS UI 访问配置排障。访问 节点诊断,选择 查询: NVIDIA SMI 和所需命令,以提供有关已配置 NVIDIA vGPU 设备的摘要或详细查询信息。

最后更新于

这有帮助吗?