Cấu hình NVIDIA vGPU
Hướng dẫn từng bước để cấu hình NVIDIA vGPU trong VergeOS, bao gồm các profile vGPU truyền thống, phân vùng MIG, profile dị thể, thiết lập nhóm tài nguyên và chia sẻ cho tenant.
VergeOS cho phép sử dụng liền mạch nền tảng vGPU của NVIDIA để gán các thiết bị GPU ảo hóa giữa các tenant và VM.
Chức năng vGPU của NVIDIA yêu cầu giấy phép vGPU thương mại của NVIDIA. Điều này áp dụng cho cả cấu hình vGPU truyền thống và vGPU dựa trên MIG.
Quy trình tổng thể
Đây là các bước tổng quan cần thiết để cấu hình NVIDIA vGPU trong VergeOS:
Tải lên Driver Tải driver NVIDIA đi kèm lên môi trường VergeOS.
Tạo nhóm tài nguyên Tạo một nhóm tài nguyên dựa trên (các) thiết bị GPU vật lý đã chọn, chọn profile MIG hoặc vGPU truyền thống. Việc này tạo ra một vùng các thiết bị vGPU có thể gán được. Có thể tạo nhiều nhóm tài nguyên cho mỗi thiết bị vật lý để cung cấp sự kết hợp các loại vGPU khác nhau cho các trường hợp sử dụng khác nhau.
Tải driver Mỗi node nên được đặt vào chế độ bảo trì để tải driver NVIDIA. (Có thể cần khởi động lại node nếu IOMMU chưa được bật và/hoặc khi tải driver lần đầu.)
Thêm thiết bị vào từng VM Thêm thiết bị vào VM, chọn nhóm tài nguyên đã tạo. Điều này cho phép VM lấy từ vùng các thiết bị GPU ảo có sẵn trong nhóm tài nguyên.
Chia sẻ cho tenant Chia sẻ thiết bị cho từng tenant, cho phép họ thêm các thiết bị vGPU vào các VM của riêng mình.
Các phần sau cung cấp hướng dẫn từng bước để bật và gán tài nguyên NVIDIA vGPU trong VergeOS.
Điều kiện tiên quyết
Trước khi bắt đầu, hãy đảm bảo các điều sau đã sẵn sàng:
GPU hỗ trợ NVIDIA vGPU được cài đặt trong một hoặc nhiều node VergeOS (xem GPU được NVIDIA hỗ trợ )
IOMMU / VT-d / SR-IOV đã bật trong BIOS của máy chủ — nếu chưa bật, hãy lên kế hoạch khởi động lại node trong quá trình này (thực hiện đúng các Chế độ Bảo trì quy trình).
Giấy phép phần mềm NVIDIA vGPU — truy cập cổng cấp phép NVIDIA để lấy driver
Quyền quản trị VergeOS đối với Resource Manager và cấu hình node
Sự quen thuộc với Rủi ro và biện pháp phòng ngừa khi chuyển qua PCI
Cài đặt/Cấu hình máy chủ
Hãy lấy driver NVIDIA Linux-KVM phù hợp cho phần cứng GPU của bạn. Driver vGPU của NVIDIA có thể được tải xuống từ cổng cấp phép NVIDIA của bạn hoặc bằng cách đăng ký dùng thử miễn phí NVIDIA: https://nvidia.com/en-us/data-center/resources/vgpu-evaluation.
VergeOS hỗ trợ driver NVIDIA dạng bundle. Để xem danh sách các driver NVIDIA hiện được hỗ trợ, hãy vào Resource Manager > Groups > New. Đặt Type=NVIDIA vGPU và nhấp nút để xem các driver bên thứ ba tương thích. Thông thường, bạn sẽ muốn dùng driver mới nhất trong danh sách này tương thích với phần cứng NVIDIA của bạn.
Tải driver bundle NVIDIA lên VergeOS vSAN. Xem Tải lên vSAN (Files) để biết hướng dẫn tải lên.
Đi tới Bảng điều khiển Trình quản lý tài nguyên (Cơ sở hạ tầng > Tài nguyên từ menu trên cùng) -HOẶC- Điều hướng đến một nút cụ thể nơi phần cứng NVIDIA được cài đặt (Cơ sở hạ tầng > Các nút).
Nhấp vào THIẾT BỊ PCI thẻ trên bảng điều khiển.
Chọn (các) thiết bị vật lý NVIDIA mong muốn. Để dễ tìm (các) thẻ NVIDIA mong muốn, hãy dùng thanh tìm kiếm để lọc theo tên ("nvidia") hoặc Type: Display controller.
Nhấp vào Tạo tài nguyên ở menu bên trái.
Chọn một nhóm tài nguyên vGPU hiện có -HOẶC- chọn --New Group-- để gắn thiết bị.
Các trường của nhóm tài nguyên:
Tên: nhãn dùng để xác định nhóm tài nguyên (tức là vùng thiết bị); hãy dùng tên mô tả để người dùng dễ nhận biết loại thiết bị ảo nào sẽ có trong nhóm này.
Loại: nên được đặt thành NVIDIA vGPU (Trường này sẽ tự động được đặt nếu nhóm tài nguyên được khởi tạo dựa trên thiết bị NVIDIA.)
Mô tả: trường tùy chọn để cung cấp thêm văn bản quản trị về nhóm tài nguyên
Lớp: chọn vGPU. Trường này chỉ được dùng để áp dụng biểu tượng bảng điều khiển tương ứng cho nhóm tài nguyên, và không ảnh hưởng đến chức năng
Profile vGPU NVIDIA: đặt trường này thành loại vGPU mà bạn muốn nhóm tài nguyên này tạo ra
Tên Trình điều khiển danh sách thả xuống sẽ chứa tất cả các driver NVIDIA vGPU (.zip) được tìm thấy trong phần Tệp section. Driver phù hợp cần được tải lên vSAN trước khi có thể chọn (Bước 1-2 ở trên). Chọn driver phù hợp.
Nhấp vào Gửi để lưu nhóm tài nguyên. Sau khi nhóm tài nguyên được chọn hoặc một nhóm mới được tạo, một Thành công thông báo sẽ xuất hiện cho biết các quy tắc tài nguyên đã được tạo cho thiết bị (các thiết bị).
Nếu trước đó chưa tải driver hoặc IOMMU chưa được bật, khởi động lại (các) node liên quan trong Chế độ Bảo trì trước khi tiếp tục.
Sau khi (các) node đã khởi động lại, hãy điều hướng đến nhóm tài nguyên NVIDIA vGPU vừa tạo (Infrastructure > Resources > Groups > nhấp đúp vào nhóm).
Nhấp vào Chỉnh sửa ở menu bên trái.
Chọn Profile vGPU NVIDIA: Truyền thống hoặc MIG (các tab bên dưới cung cấp hướng dẫn liên quan):
Profile vGPU NVIDIA: chọn profile truyền thống mong muốn.
Tổng số phiên bản vGPU: số lượng phiên bản ảo cần tạo với profile đã cho.
Chính sách lập lịch, Tần số, Hệ số trung bình, Độ dài lát thời gian (ms), Round Robin nghiêm ngặt: các cài đặt cụ thể của NVIDIA — hãy tham khảo tài liệu NVIDIA để biết tinh chỉnh hiệu năng cụ thể.
Trình điều khiển: được điền sẵn từ bước trước.
Profile vGPU NVIDIA: chọn profile MIG mong muốn.
Các instance GPU MIG: (mức tối đa được liệt kê trong mô tả) số instance MIG cần tạo.
Tổng số phiên bản vGPU: mặc định=0 (tối đa) - cài đặt này xác định số lượng instance GPU ảo có thể gán trên mỗi phân vùng MIG.
Giữ giá trị này ở 0 để tự động tạo số lượng GPU ảo tối đa cho profile MIG đã chọn.
Đặt giá trị thành 1 để tạo một GPU ảo duy nhất sử dụng toàn bộ lát MIG.
Đặt giá trị khác 0 hoặc 1 sẽ dẫn đến dung lượng không sử dụng bên trong lát MIG.
Trình điều khiển: được điền sẵn từ bước trước.
ISO driver khách
Các cài đặt driver khách sau đây áp dụng cho cả cấu hình vGPU Truyền thống và MIG.
ISO driver: Sử dụng tùy chọn Tạo ISO driver khách để tự động tạo trình cài đặt driver khách cho VM của bạn. Nếu bạn đã tạo driver khách rồi, hãy chọn ISO ở bước tiếp theo.
Tên ISO driver tệp chỉ định một tệp ISO có thể được gắn vào các VM sử dụng, cung cấp một cách thuận tiện để truy cập các client driver để cài đặt trong hệ điều hành khách. (Chọn tùy chọn Gắn driver khách khi gắn thiết bị vào VM hoặc tenant.)
Tải lại driver
Khi cấu hình nhóm tài nguyên hoàn tất và đã được gửi, hãy đặt node vào Chế độ Bảo trì và nhấp vào Tải lại driver.
Theo dõi nhật ký Node Dashboard (phần cuối trang) để xác minh driver đã được cài đặt thành công trước khi tắt chế độ bảo trì.
Bảng điều khiển nhóm tài nguyên chứa các quy tắc tài nguyên đã được tự động tạo dựa trên các thiết bị NVIDIA bạn đã chọn. Bạn có thể nhấp vào một quy tắc riêng lẻ để xem chi tiết cấu hình. Một quy tắc do hệ thống tạo ra có thể được sửa đổi khi cần. Ví dụ, Node bộ lọc có thể được thay đổi thành -- Không có -- để bao gồm các thiết bị khớp từ tất cả các node; slot bộ lọc có thể được gỡ bỏ hoặc sửa đổi để phù hợp với các thiết bị có thể nằm ở các slot khác nhau trong cùng một node hoặc trên các node khác nhau. Thông tin về quy tắc tài nguyên có tại: Tổng quan truyền qua thiết bị - Quy tắc tài nguyên
Cấu hình VM/khách
Đi đến bảng điều khiển VM (từ menu trên cùng: Virtual Machines > List > nhấp đúp vào VM mong muốn trong danh sách)
Nhấp vào Thiết bị ở menu bên trái.
Nhấp vào Mới ở menu bên trái.
Bạn cũng có thể gắn thiết bị vào VM thông qua Resource Manager; phương pháp này cho phép thêm nhiều thiết bị vào VM cùng lúc. Từ bảng điều khiển Resource Group > nhấp đúp vào nhóm vGPU mong muốn > View Machine Devices > New; chọn VM từ danh sách thả xuống Machine.
Các trường của biểu mẫu nhập thiết bị
Tên: cung cấp một tên để xác định loại vGPU/profile -HOẶC- để trống để hệ thống tự động tạo tên cho instance.
Loại: chọn NVIDIA vGPU.
Mô tả (tùy chọn): có thể nhập thêm văn bản tại đây cho mục đích quản trị.
Nhóm tài nguyên: chọn nhóm tài nguyên NVIDIA vGPU phù hợp từ danh sách thả xuống. (Danh sách nhóm tài nguyên sẽ hiển thị số lượng thiết bị trong nhóm hiện đang khả dụng.)
Số lượng: cho biết số lượng thiết bị vGPU cần gắn vào VM. (Tùy chọn này chỉ khả dụng khi truy cập nhập thiết bị qua Resource Manager.)
Gắn driver khách: nếu ISO driver khách đã được chỉ định cho nhóm tài nguyên, bạn có thể chọn tùy chọn này để tự động gắn một ổ CD-ROM, được nạp driver khách NVIDIA, vào VM.
Giới hạn tốc độ khung hình: để đặt mức trần cho số khung hình mỗi giây. Các cài đặt tốc độ làm mới được khuyến nghị phụ thuộc vào khối lượng công việc cụ thể của bạn. Tốc độ làm mới thấp hơn sẽ giảm chi phí không cần thiết trên vGPU. Nếu chỉ dùng cho khối lượng công việc tính toán (như ML/suy luận), và không dùng cho bất kỳ mục đích đồ họa/hiển thị nào, giới hạn tốc độ khung hình có thể đặt thành 0.
Tắt VNC Console: tùy chọn này có thể được dùng khi vGPU sẽ được dùng làm màn hình chính, ví dụ chỉ truy cập qua RDP.
Các cài đặt NVIDIA nâng cao; tham khảo tài liệu NVIDIA để biết thông tin về các tùy chọn sau:
Bật Bộ nhớ hợp nhất
Bật trình gỡ lỗi NVIDIA CUDA Toolkit
Bật profile NVIDIA CUDA Toolkit
Khi các trường đã hoàn tất, nhấp vào Gửi để hoàn tất việc thêm thiết bị mới.
VM sẽ cần khởi động lại để gắn thiết bị. Từ bảng điều khiển VM, nhấp vào Khởi động lại liên kết trên thông báo xuất hiện ở đầu bảng điều khiển, hoặc nhấp vào Khởi động lại ở menu bên trái.
Cài đặt (các) driver khách NVIDIA cần thiết; driver cần thiết sẽ khác nhau tùy theo mẫu GPU cụ thể và phiên bản hệ điều hành khách. Nếu đã chọn tùy chọn gắn driver khách, một ổ CD-ROM sẽ khả dụng chứa các driver NVIDIA cần thiết để cài đặt.
Tham khảo tài liệu NVIDIA về yêu cầu/hướng dẫn cấp phép vGPU cho client.
Việc cấp phép client NVIDIA có thể bao gồm việc tạo một client config token trên máy chủ cấp phép NVIDIA, token này cần được tải xuống máy ảo khách, sau đó khởi động lại VM.
Xác minh vGPU được phát hiện — sau khi driver khách được cài đặt và VM được khởi động lại, hãy chạy
nvidia-smibên trong VM để xác nhận GPU ảo đã được nhận diện và hoạt động.
Chia sẻ một NVIDIA vGPU cho Tenant
Các thiết bị NVIDIA vGPU có thể được chuyển cho tenant để tenant chuyển tiếp vào các VM của riêng họ. Khi bạn chuyển passthrough thiết bị cho tenant, một nhóm tài nguyên mới sẽ được tạo bên trong tenant.
Điều hướng đến bảng điều khiển tenant (từ menu trên cùng: Tenants > List > nhấp đúp vào tenant trong danh sách.)
Nhấp vào Các nút ở menu bên trái.
Nhấp đúp vào một trong các nút tenant.
Nhấp vào Thiết bị ở menu bên trái.
Nhấp vào Mới ở menu bên trái.
Tham chiếu Các trường của biểu mẫu nhập thiết bị ở trên.
Khi các trường đã hoàn tất, nhấp vào Gửi để hoàn tất việc thêm thiết bị mới.
Thiết bị giờ đây sẽ khả dụng để gắn vào các VM của tenant. Hãy làm theo Cấu hình VM/khách hướng dẫn ở trên.
Mẹo khắc phục sự cố
Tải lại driver: Bất kỳ thay đổi nào đối với nhóm tài nguyên đều yêu cầu tải lại driver. Làm theo các lời nhắc tải lại ở đầu bảng điều khiển node để đặt node vào Chế độ Bảo trì và tải lại driver. Theo dõi nhật ký node để xác minh driver đã tải thành công trước khi tắt chế độ bảo trì. Lặp lại việc tải lại driver cho từng node áp dụng.
NVIDIA SMI (System Management Interface): Đây là một công cụ NVIDIA mạnh mẽ để khắc phục sự cố cấu hình, có thể truy cập từ giao diện VergeOS. Truy cập Chẩn đoán nút, chọn Truy vấn: NVIDIA SMI và lệnh mong muốn để cung cấp thông tin truy vấn tóm tắt hoặc chi tiết về các thiết bị NVIDIA vGPU bạn đã cấu hình.
Cập nhật lần cuối
Nội dung này có hữu ích không?
