Phòng lab: Giám sát & khắc phục sự cố
Khám phá bảng điều khiển VergeOS, cấu hình cảnh báo, phân tích log hệ thống và thực hành chẩn đoán các sự cố phổ biến.
Mục tiêu
Thực hành giám sát tình trạng sức khỏe hạ tầng VergeOS, cấu hình cảnh báo, phân tích nhật ký hệ thống và chẩn đoán các sự cố thường gặp. Đến cuối bài thực hành này, bạn sẽ tự tin điều hướng các công cụ giám sát của VergeOS và theo dõi một quy trình khắc phục sự cố có cấu trúc.
Yêu cầu tiên quyết
Đã hoàn thành Module 1: Kiến thức nền tảng về kiến trúc
Đã hoàn thành Mô-đun 4: Mạng
Đã hoàn thành Mô-đun 5: Lưu trữ
Đã hoàn thành bài đọc Mô-đun 9 (Bảng điều khiển, Cảnh báo, Chẩn đoán, Nâng cấp)
Một cụm VergeOS đang chạy với quyền quản trị
Độ khó
Trung cấp -- Yêu cầu quen thuộc với giao diện VergeOS và các khái niệm quản trị hệ thống cơ bản
Thời gian ước tính
1,5 giờ
Các bước
Phần 1: Khám phá Bảng điều khiển
Làm quen với bảng điều khiển giám sát của VergeOS.
Đăng nhập vào giao diện VergeOS bằng thông tin xác thực quản trị viên
Điều hướng đến bảng điều khiển chính và xác định:
Các chỉ báo trạng thái nút (trực tuyến, ngoại tuyến, bảo trì)
Các biểu đồ sử dụng CPU, bộ nhớ và lưu trữ
Trạng thái kết nối mạng
Cảnh báo và thông báo đang hoạt động
Đi sâu vào trang chi tiết của một nút riêng lẻ
Xem lại tổng quan tình trạng sức khỏe của cụm và xác định các chỉ số chính
Khám phá trạng thái của nhóm lưu trữ và xác minh tất cả các ổ đĩa đều khỏe mạnh
Ghi lại mức sử dụng tài nguyên hiện tại làm đường cơ sở cho cụm của bạn
Phần 2: Cấu hình Cảnh báo
Thiết lập cảnh báo và quy tắc thông báo.
Điều hướng đến phần cấu hình cảnh báo (Hệ thống → Đăng ký)
Xem lại các quy tắc đăng ký hiện có và tiêu chí cảnh báo đã được cấu hình của chúng
Tạo một cảnh báo đăng ký tùy chỉnh cho:
Mức sử dụng CPU cao (>85% duy trì liên tục)
Dung lượng lưu trữ thấp (ít hơn 20% dung lượng trống)
Mất kết nối nút
Cấu hình một kênh thông báo (email qua SMTP hoặc webhook cho các tích hợp như Slack)
Kiểm tra thông báo cảnh báo bằng cách kích hoạt một ngưỡng (nếu có thể trong môi trường thực hành của bạn)
Cấu hình chuyển tiếp nhật ký đến một máy chủ syslog bên ngoài (hoặc một bộ thu thập nhật ký cục bộ)
Phần 3: Phân tích Nhật ký & Chẩn đoán
Thực hành phân tích nhật ký hệ thống và sử dụng các công cụ chẩn đoán.
Điều hướng đến phần nhật ký hệ thống
Lọc nhật ký theo mức độ nghiêm trọng (Nghiêm trọng, Lỗi, Cảnh báo, Thông điệp)
Tìm kiếm các sự kiện cụ thể liên quan đến:
Các thao tác VM (khởi động, tắt, di chuyển)
Các sự kiện lưu trữ (lỗi ổ đĩa, cân bằng lại)
Các sự kiện mạng (thay đổi trạng thái liên kết)
Xác định các mẫu lỗi phổ biến và nguyên nhân có khả năng gây ra chúng
Sử dụng các công cụ chẩn đoán tích hợp để kiểm tra:
Tình trạng hệ thống lưu trữ phụ
Kết nối mạng giữa các nút
Trạng thái dịch vụ trên toàn cụm
Thực hành tạo một gói chẩn đoán để nâng cấp lên bộ phận hỗ trợ
Phần 4: Các tình huống khắc phục sự cố
Chẩn đoán các sự cố mô phỏng bằng các công cụ bạn đã học.
Tình huống A: Hiệu năng VM chậm -- Một người dùng báo cáo rằng một VM đang chạy chậm. Sử dụng bảng điều khiển và nhật ký để:
Kiểm tra phân bổ tài nguyên và mức sử dụng của VM
Xác định xem nút máy chủ có đang bị quá tải hay không
Kiểm tra độ trễ I/O lưu trữ
Đề xuất một giải pháp
Tình huống B: Sự cố kết nối mạng -- Một tenant báo cáo rằng họ không thể truy cập các mạng bên ngoài. Điều tra:
Cấu hình mạng của tenant
Kết nối lớp mạng ảo
Trạng thái mạng vật lý trên các nút máy chủ
Xác định nguyên nhân gốc rễ và giải pháp
Tình huống C: Cảnh báo lưu trữ -- Hệ thống tạo ra cảnh báo về dung lượng lưu trữ. Xác định:
Nhóm lưu trữ nào bị ảnh hưởng
Điều gì đang chiếm nhiều dung lượng nhất
Các hành động được khuyến nghị (dọn dẹp, mở rộng hoặc di chuyển)
Xác minh
Bài thực hành giám sát và khắc phục sự cố của bạn hoàn thành khi bạn có thể trả lời có cho tất cả các mục sau:
Cập nhật lần cuối
Nội dung này có hữu ích không?