Giám sát & khắc phục sự cố lưu trữ
Làm chủ chẩn đoán vSAN, tích hợp Fibre Channel, khắc phục sự cố NAS và các chiến lược bảo trì phòng ngừa trong VergeOS.
Tại sao Giám sát Lưu trữ lại Quan trọng
Lưu trữ là nền tảng của mọi workload trong VergeOS. Một ổ đĩa suy giảm, một tier đầy, hoặc một lỗi toàn vẹn không được phát hiện có thể kéo theo các vấn đề về hiệu năng VM, snapshot thất bại và khiếu nại từ tenant. VergeOS cung cấp các công cụ chẩn đoán tích hợp ở hai cấp độ -- chẩn đoán vSAN cho bộ máy lưu trữ khối phân tán ở mức block, và chẩn đoán NAS cho từng phiên dịch vụ chia sẻ tệp -- để bạn có thể phát hiện, chẩn đoán và xử lý sự cố trước khi chúng ảnh hưởng đến môi trường sản xuất.
Chẩn đoán vSAN
Giao diện Chẩn đoán vSAN cung cấp quyền truy cập thời gian thực vào trạng thái nội bộ của bộ máy lưu trữ VergeFS. Mỗi chẩn đoán được chạy từ Query menu thả xuống trong giao diện Chẩn đoán vSAN.
Truy cập Chẩn đoán vSAN
Đi tới System → Chẩn đoán vSAN từ menu trên cùng
Ngoài ra: từ Bảng điều khiển Chính, nhấp vào vSAN Tiers ô đếm → Chẩn đoán vSAN trong menu bên trái
Chọn một lệnh từ Query menu thả xuống, cấu hình các tham số ở bên phải, rồi nhấp Send →
Chỉ cấp Root
Chẩn đoán vSAN chỉ có ở cấp root/cha. Tenant không có quyền truy cập vào các công cụ chẩn đoán vSAN -- họ phải yêu cầu chẩn đoán thông qua nhà cung cấp.
Tham chiếu Lệnh Chẩn đoán
Các chẩn đoán sau có sẵn từ Query menu thả xuống trong giao diện Chẩn đoán vSAN, được nhóm theo khu vực tập trung.
Cụm & Hiệu năng
Lấy Tốc độ Cụm
Các chỉ số thông lượng và IOPS trên toàn cụm
Lấy Mức sử dụng Cụm
Mức sử dụng lưu trữ và dung lượng tổng thể
Lấy Tốc độ Mức sử dụng Cao nhất
Xác định các đối tượng tiêu thụ I/O lưu trữ nhiều nhất
Lấy Mức sử dụng
Thống kê mức sử dụng vSAN toàn diện
Lấy Thông tin Cache
Tỷ lệ hit/miss của cache và mức sử dụng bộ nhớ
Lấy Read Ahead
Cấu hình và thống kê bộ nhớ đệm đọc trước
Lấy Master Hiện tại
Xác định nút master vSAN hiện tại
Thiết bị & Nút
Lấy danh sách thiết bị
Tất cả thiết bị lưu trữ trong vSAN
Lấy Trạng thái Thiết bị
Tình trạng và trạng thái của một thiết bị cụ thể
Lấy Mức sử dụng Thiết bị
Dữ liệu mức sử dụng và hao mòn theo từng thiết bị
Lấy Danh sách Nút
Tất cả các nút tham gia vào vSAN
Lấy Thông tin Nút
Thông tin chi tiết cho một nút cụ thể
Lấy Danh sách Thiết bị của Nút
Các thiết bị được gắn vào một nút cụ thể
Tier & Volume
Lấy Trạng thái Tier
Tình trạng và dung lượng theo từng storage tier
Lấy Bản đồ Thiết bị của Tier
Cách các thiết bị được ánh xạ qua các tier
Lấy Bản đồ Nút của Tier
Cách các tier phân bố trên các nút
Lấy Mức sử dụng Volume
Mức tiêu thụ lưu trữ theo từng volume
Tổng hợp Mức sử dụng Đĩa
Tổng quan mức sử dụng đĩa trên toàn cụm
Toàn vẹn & Sửa chữa
Kiểm tra Toàn vẹn
Bắt đầu kiểm tra toàn vẹn đầy đủ
Kiểm tra Toàn vẹn Thiết bị
Kiểm tra toàn vẹn trên một thiết bị cụ thể
Lấy Trạng thái Kiểm tra Toàn vẹn
Tiến trình/kết quả của các kiểm tra toàn vẹn
Lấy Trạng thái Sửa chữa
Các thao tác sửa chữa và tái tạo đang hoạt động
Lấy Danh sách Đồng bộ
Các kết nối đồng bộ site (replication) đang hoạt động
Hệ thống Tệp & Cấu hình
Tìm Inode
Xác định vị trí một inode cụ thể để phân tích
Lấy Đường dẫn từ Inode
Giải mã số inode thành đường dẫn
Lấy Trạng thái Tệp
Tình trạng sao chép và toàn vẹn của một tệp
Lấy Thông tin FUSE
Chi tiết gắn kết và thao tác FUSE
Lấy Trạng thái Journal
Trạng thái journal ghi trước
Lấy Cấu hình Đang chạy
Cấu hình vSAN hiện đang chạy
Lấy Khách hàng
Các kết nối client vSAN đang hoạt động
Quy trình Giám sát Sức khỏe
Hãy làm theo cách tiếp cận có hệ thống này khi điều tra tình trạng lưu trữ -- bắt đầu từ phạm vi rộng rồi đi sâu xuống các thành phần cụ thể.
Quy trình Từng Bước
Tổng quan Hệ thống -- Chạy
Lấy Mức sử dụng CụmvàLấy Tốc độ Cụmđể hiểu tình trạng tổng thể, dung lượng và thông lượngPhân tích Hiệu năng -- Kiểm tra
Lấy Tốc độ Mức sử dụng Cao nhấtđể tìm các volume nóng, sau đóLấy Thông tin Cacheđể xem tỷ lệ hit của cacheĐánh giá Sức khỏe -- Xác minh
Lấy Trạng thái Sửa chữahiển thị toàn số 0 (không có sửa chữa đang hoạt động) vàLấy Trạng thái Kiểm tra Toàn vẹnđể xem kết quả gần đâyLập kế hoạch Dung lượng -- Dùng
Tổng hợp Mức sử dụng Đĩacho góc nhìn toàn cụm vàLấy Trạng thái Tiercho dung lượng theo từng tierKhắc phục Sự cố Có mục tiêu -- Đi sâu vào các thiết bị cụ thể (
Lấy Trạng thái Thiết bị) hoặc các nút (Lấy Thông tin Nút) dựa trên kết quả phát hiện
Các Mẫu Khắc phục Sự cố
Sự cố Hiệu năng
Triệu chứng: Độ trễ VM cao, thao tác snapshot chậm, tenant phàn nàn về tốc độ đĩa.
Chọn Lấy Tốc độ Cụm cho thông lượng tổng hợp -- tốc độ có thấp hơn mức cơ sở không?
Xem lại Lấy Thông tin Cache -- tỷ lệ hit thấp cho thấy tập làm việc vượt quá cache sẵn có
Kiểm tra Lấy Tốc độ Mức sử dụng Cao nhất để xác định volume nào đang tiêu thụ I/O nhiều nhất
Chọn Lấy Mức sử dụng Thiết bị trên từng ổ đĩa để phát hiện phân bố tải không đều
Xác minh Lấy Trạng thái Journal -- journal bị backlog cho thấy áp lực ghi kéo dài
Sự cố Dung lượng
Triệu chứng: cảnh báo "thiếu dung lượng", không thể tạo snapshot, ghi chậm do bị giới hạn.
Chạy Lấy Mức sử dụng Cụm và Tổng hợp Mức sử dụng Đĩa để phân tích dung lượng tổng thể
Chọn Lấy Trạng thái Tier để xem dung lượng theo từng tier -- chỉ cần một tier đầy cũng có thể gây sự cố dù các tier khác còn trống
Sử dụng Lấy Mức sử dụng Volume trên các volume lớn nhất để xác định ứng viên tăng trưởng
Xem lại chính sách lưu giữ snapshot -- các snapshot cũ tham chiếu đến các block đã thay đổi sẽ tiêu tốn đáng kể dung lượng
Lo ngại về Tính toàn vẹn Dữ liệu
Triệu chứng: Cảnh báo checksum trong log, nghi ngờ hỏng dữ liệu sau các sự kiện phần cứng.
Chọn Lấy Trạng thái Kiểm tra Toàn vẹn cho kết quả kiểm tra toàn vẹn gần đây
Xem lại Lấy Trạng thái Sửa chữa cho bất kỳ quá trình tái tạo dữ liệu nào đang hoạt động
Sử dụng Lấy Trạng thái Tệp trên các tệp cụ thể để xác minh trạng thái sao chép của chúng
Nếu cần, hãy chạy Kiểm tra Toàn vẹn để khởi động quét toàn bộ (lên lịch trong cửa sổ bảo trì)
Tác động của Kiểm tra Toàn vẹn
Các kiểm tra toàn vẹn đầy đủ có thể ảnh hưởng đáng kể đến hiệu năng hệ thống. Luôn lên lịch chúng trong cửa sổ bảo trì và giám sát tải hệ thống trong khi thực thi.
Sự cố Sức khỏe Cụm
Triệu chứng: Cảnh báo nút ngoại tuyến, failover master không mong đợi, lo ngại split-brain.
Xác minh Lấy Master Hiện tại để xác nhận nút nào đang dẫn dắt vSAN
Chọn Lấy Danh sách Nút và Lấy Thông tin Nút cho trạng thái của từng nút
Xem lại Lấy Trạng thái Sửa chữa cho tái sao chép block đang hoạt động, cho thấy một nút đã bị ngắt kết nối tạm thời
Kiểm tra Lấy Khách hàng cho các mẫu kết nối không mong đợi
Sự cố Thiết bị
Triệu chứng: Cảnh báo SMART, lỗi của từng ổ đĩa, hiệu năng không đồng đều giữa các nút.
Chạy Lấy danh sách thiết bị và Lấy Trạng thái Thiết bị để xác định các thiết bị bị suy giảm hoặc đã lỗi
Chọn Lấy Danh sách Thiết bị của Nút cho toàn bộ tồn kho thiết bị của nút bị ảnh hưởng
Chạy Kiểm tra Toàn vẹn Thiết bị trên các ổ đĩa nghi ngờ
Đối chiếu với dữ liệu SMART được ghi lại trong bộ System Diagnostics (được công cụ chẩn đoán thu thập theo từng nút)
Bảo trì Phòng ngừa
Giám sát chủ động giúp ngăn ngừa bất ngờ. Thiết lập nhịp kiểm tra định kỳ cho các mục sau:
Hàng ngày
Xem mức sử dụng cụm và dung lượng tier - Kiểm tra các sửa chữa đang hoạt động (trạng thái ổn định nên là 0) - Xác minh không có cảnh báo liên quan đến lưu trữ trên bảng điều khiển
Hàng tuần
Chạy tốc độ cụm để thiết lập đường cơ sở hiệu năng - Xem tốc độ mức sử dụng cao nhất để phát hiện xu hướng tăng trưởng - Kiểm tra tỷ lệ hit của cache và tinh chỉnh nếu cần
Hàng tháng
Lên lịch kiểm tra toàn vẹn trong các cửa sổ bảo trì - Xem sức khỏe thiết bị và dữ liệu SMART - Phân tích xu hướng dung lượng để lập kế hoạch mua sắm
Tích hợp Fibre Channel
VergeOS vSAN hỗ trợ LUN Fibre Channel (FC) như các thiết bị lưu trữ trong kiến trúc phân tầng của nó, cho phép tích hợp với hạ tầng SAN hiện có.
Nguyên tắc Chính
Các LUN FC được xử lý giống hệt như đĩa vật lý -- VergeOS không phân biệt sau khi chúng được gán vào một tier
Mỗi nút phải nhận các LUN riêng duy nhất -- không đưa cùng một LUN cho nhiều nút (khác với clustering dùng lưu trữ chia sẻ truyền thống)
Tier 0 vẫn yêu cầu các ổ NVMe/SSD vật lý trong các nút để lưu trữ metadata
Tắt RAID và tự động phân tầng trên SAN cho các LUN được dùng bởi VergeOS -- vSAN tự xử lý tính dự phòng một cách nguyên bản
Multipath active/passive với thời gian chờ failover 7 giây; VergeOS tự động chọn đường dẫn tối ưu
Khi nào nên dùng FC so với Đĩa Vật lý
Verge khuyến nghị đĩa vật lý gắn trực tiếp vào các nút cho hầu hết các triển khai. Tích hợp FC phù hợp khi bạn đã có đầu tư SAN sẵn có hoặc có yêu cầu tuân thủ cụ thể. Đĩa vật lý cung cấp cấu hình đơn giản hơn, hiệu năng tốt hơn (không có chi phí SAN), ít điểm lỗi hơn và chi phí thấp hơn.
Chẩn đoán NAS
Mỗi phiên dịch vụ NAS có giao diện chẩn đoán riêng, tách biệt với chẩn đoán vSAN. Chẩn đoán NAS tập trung vào các giao thức chia sẻ tệp, kết nối mạng và xác thực.
Truy cập Chẩn đoán NAS
Đi tới NAS → Danh sách từ menu trên cùng
Nhấp đúp vào dịch vụ NAS mong muốn
Nhấp Chẩn đoán trong menu bên trái
Chọn một lệnh từ Query Chẩn đoán menu thả xuống và nhấp Send →
Các Lệnh Chẩn đoán NAS Chính
SMB/CIFS
smbstatus, testparm, smbclient -L localhost
Kết nối đang hoạt động, xác thực cấu hình, liệt kê chia sẻ
NFS
exportfs -v, rpcinfo -p, showmount -e
Danh sách export, dịch vụ RPC, xác minh mount
Active Directory
wbinfo -t, wbinfo -u, wbinfo -g
Kiểm tra trust, người dùng miền, nhóm miền
Mạng
Ping, Trace Route, Quét ARP, Tra cứu DNS
Kết nối, định tuyến, phát hiện láng giềng
Hiệu năng
Mức sử dụng CPU Cao nhất, Mức sử dụng Mạng Cao nhất, TCP Dump
Phân tích sử dụng tài nguyên và lưu lượng
Ghi log
Log (journalctl, log samba)
Phân tích lỗi và giám sát sự kiện
Quy trình Giám sát Sức khỏe NAS
Trạng thái Dịch vụ -- Kiểm tra Trạng thái Services và theo giao thức cụ thể (Samba/NFS)
Kết nối Mạng -- Xác minh bằng Ping và cấu hình giao diện
Xác thực -- Kiểm tra Người dùng, Nhóm và Winbind (cho môi trường AD)
Hiệu năng -- Giám sát Mức sử dụng CPU Cao nhất và Mức sử dụng Mạng Cao nhất
Nhật ký -- Xem lại log dịch vụ để tìm lỗi hoặc cảnh báo
Các Sự cố NAS Thường gặp & Cách khắc phục
Windows: Không thể Kết nối tới CIFS Shares
Nguyên nhân: Windows 10/11 và Server 2016+ mặc định vô hiệu hóa đăng nhập guest không an toàn, chặn quyền truy cập vào các share cho phép truy cập ẩn danh.
Cách khắc phục: Bật đăng nhập guest không an toàn thông qua Group Policy:
Mở
gpedit.msc→ Computer Configuration → Administrative Templates → Network → Lanman WorkstationĐặt Enable insecure guest logons thành Enabled
Khởi động lại thiết bị Windows
macOS: Lỗi Kết nối SMB
Nguyên nhân: Mặc định trên macOS có thể xung đột với phiên bản giao thức SMB của máy chủ hoặc thiếu các mở rộng dành riêng cho Apple.
Cách khắc phục (phía client): Ép SMB3 trong /etc/nsmb.conf:
Xóa cache SMB (sudo rm -rf /var/db/samba/* /var/db/smb/*) và khởi động lại.
Cách khắc phục (phía server): Thêm các thiết lập module Apple/Samba fruit dưới NAS → CIFS → Advanced Configuration Options:
Bị từ chối quyền trên CIFS Shares
Nguyên nhân: Sai quyền người dùng/nhóm hoặc cấu hình share.
Cách khắc phục:
Xác minh người dùng có quyền truy cập trong danh sách người dùng của dịch vụ NAS
Kiểm tra thiết lập share: đảm bảo Browseable được bật và người dùng có trong Valid Users danh sách
Nếu dùng Force User hoặc Force Group tùy chọn, hãy xác nhận danh tính bị ép có đúng quyền hệ thống tệp
Hiệu năng CIFS Chậm
Nguyên nhân: Phiên bản giao thức SMB không khớp, sự cố mạng hoặc cấu hình chưa tối ưu.
Cách khắc phục:
Xác minh độ ổn định mạng bằng Chẩn đoán NAS Ping và Truy vết đường đi các lệnh
Kiểm tra phiên bản giao thức SMB trong NAS → Volumes → Tùy chọn cấu hình nâng cao -- đảm bảo đang sử dụng SMB2 hoặc SMB3
Theo dõi bằng Mức sử dụng mạng cao nhất trong Chẩn đoán NAS để phát hiện bão hòa băng thông
Liên hệ bộ phận Hỗ trợ VergeOS để biết các tham số tinh chỉnh Samba nâng cao nếu các tối ưu hóa tiêu chuẩn không đủ
Bắt đầu
Khám phá Chẩn đoán vSAN
Đi tới System → Chẩn đoán vSAN, chạy Lấy Mức sử dụng Cụm và Lấy Tốc độ Cụm để thiết lập đường cơ sở của bạn.
Kiểm tra tình trạng NAS
Mở trang Chẩn đoán của từng dịch vụ NAS. Chạy Samba để xem các kết nối đang hoạt động và NFS để xác minh các export. Xem lại Nhật ký để tìm các lỗi gần đây.
Xem hướng dẫn Chẩn đoán
Đọc toàn bộ Hướng dẫn Chẩn đoán vSAN và Hướng dẫn Chẩn đoán NAS trong tài liệu chính thức.
Cập nhật lần cuối
Nội dung này có hữu ích không?