> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/learn-the-platform/vi/module-9-giam-sat-and-khac-phuc-su-co/lab.md).

# Phòng lab: Giám sát & Khắc phục sự cố

## Mục tiêu

Thực hành giám sát tình trạng sức khỏe hạ tầng VergeOS, cấu hình cảnh báo, phân tích nhật ký hệ thống và chẩn đoán các sự cố thường gặp. Đến cuối bài thực hành này, bạn sẽ tự tin điều hướng các công cụ giám sát của VergeOS và theo dõi một quy trình khắc phục sự cố có cấu trúc.

## Yêu cầu tiên quyết

* Đã hoàn thành Module 1: Kiến thức nền tảng về kiến trúc
* Đã hoàn thành Mô-đun 4: Mạng
* Đã hoàn thành Mô-đun 5: Lưu trữ
* Đã hoàn thành bài đọc Mô-đun 9 (Bảng điều khiển, Cảnh báo, Chẩn đoán, Nâng cấp)
* Một cụm VergeOS đang chạy với quyền quản trị

## Độ khó

**Trung cấp** -- Yêu cầu quen thuộc với giao diện VergeOS và các khái niệm quản trị hệ thống cơ bản

## Thời gian ước tính

**1,5 giờ**

## Các bước

### Phần 1: Khám phá Bảng điều khiển

Làm quen với bảng điều khiển giám sát của VergeOS.

1. Đăng nhập vào giao diện VergeOS bằng thông tin xác thực quản trị viên
2. Điều hướng đến bảng điều khiển chính và xác định:
   * Các chỉ báo trạng thái nút (trực tuyến, ngoại tuyến, bảo trì)
   * Các biểu đồ sử dụng CPU, bộ nhớ và lưu trữ
   * Trạng thái kết nối mạng
   * Cảnh báo và thông báo đang hoạt động
3. Đi sâu vào trang chi tiết của một nút riêng lẻ
4. Xem lại tổng quan tình trạng sức khỏe của cụm và xác định các chỉ số chính
5. Khám phá trạng thái của nhóm lưu trữ và xác minh tất cả các ổ đĩa đều khỏe mạnh
6. Ghi lại mức sử dụng tài nguyên hiện tại làm đường cơ sở cho cụm của bạn

### Phần 2: Cấu hình Cảnh báo

Thiết lập cảnh báo và quy tắc thông báo.

1. Điều hướng đến phần cấu hình cảnh báo (Hệ thống → Đăng ký)
2. Xem lại các quy tắc đăng ký hiện có và tiêu chí cảnh báo đã được cấu hình của chúng
3. Tạo một cảnh báo đăng ký tùy chỉnh cho:
   * Mức sử dụng CPU cao (>85% duy trì liên tục)
   * Dung lượng lưu trữ thấp (ít hơn 20% dung lượng trống)
   * Mất kết nối nút
4. Cấu hình một kênh thông báo (email qua SMTP hoặc webhook cho các tích hợp như Slack)
5. Kiểm tra thông báo cảnh báo bằng cách kích hoạt một ngưỡng (nếu có thể trong môi trường thực hành của bạn)
6. Cấu hình chuyển tiếp nhật ký đến một máy chủ syslog bên ngoài (hoặc một bộ thu thập nhật ký cục bộ)

### Phần 3: Phân tích Nhật ký & Chẩn đoán

Thực hành phân tích nhật ký hệ thống và sử dụng các công cụ chẩn đoán.

1. Điều hướng đến phần nhật ký hệ thống
2. Lọc nhật ký theo mức độ nghiêm trọng (Nghiêm trọng, Lỗi, Cảnh báo, Thông điệp)
3. Tìm kiếm các sự kiện cụ thể liên quan đến:
   * Các thao tác VM (khởi động, tắt, di chuyển)
   * Các sự kiện lưu trữ (lỗi ổ đĩa, cân bằng lại)
   * Các sự kiện mạng (thay đổi trạng thái liên kết)
4. Xác định các mẫu lỗi phổ biến và nguyên nhân có khả năng gây ra chúng
5. Sử dụng các công cụ chẩn đoán tích hợp để kiểm tra:
   * Tình trạng hệ thống lưu trữ phụ
   * Kết nối mạng giữa các nút
   * Trạng thái dịch vụ trên toàn cụm
6. Thực hành tạo một gói chẩn đoán để nâng cấp lên bộ phận hỗ trợ

### Phần 4: Các tình huống khắc phục sự cố

Chẩn đoán các sự cố mô phỏng bằng các công cụ bạn đã học.

1. **Tình huống A: Hiệu năng VM chậm** -- Một người dùng báo cáo rằng một VM đang chạy chậm. Sử dụng bảng điều khiển và nhật ký để:
   * Kiểm tra phân bổ tài nguyên và mức sử dụng của VM
   * Xác định xem nút máy chủ có đang bị quá tải hay không
   * Kiểm tra độ trễ I/O lưu trữ
   * Đề xuất một giải pháp
2. **Tình huống B: Sự cố kết nối mạng** -- Một tenant báo cáo rằng họ không thể truy cập các mạng bên ngoài. Điều tra:
   * Cấu hình mạng của tenant
   * Kết nối lớp mạng ảo
   * Trạng thái mạng vật lý trên các nút máy chủ
   * Xác định nguyên nhân gốc rễ và giải pháp
3. **Tình huống C: Cảnh báo lưu trữ** -- Hệ thống tạo ra cảnh báo về dung lượng lưu trữ. Xác định:
   * Nhóm lưu trữ nào bị ảnh hưởng
   * Điều gì đang chiếm nhiều dung lượng nhất
   * Các hành động được khuyến nghị (dọn dẹp, mở rộng hoặc di chuyển)

## Xác minh

Bài thực hành giám sát và khắc phục sự cố của bạn hoàn thành khi bạn có thể trả lời **có** cho tất cả các mục sau:

* [ ] Đã điều hướng thành công bảng điều khiển VergeOS và xác định các chỉ số sức khỏe chính
* [ ] Đã tạo các quy tắc cảnh báo tùy chỉnh với ngưỡng phù hợp
* [ ] Đã cấu hình ít nhất một kênh thông báo (email hoặc webhook)
* [ ] Đã lọc và tìm kiếm nhật ký hệ thống để tìm các sự kiện cụ thể
* [ ] Đã sử dụng các công cụ chẩn đoán để kiểm tra tình trạng lưu trữ, mạng và dịch vụ
* [ ] Đã xử lý ít nhất hai tình huống khắc phục sự cố và xác định nguyên nhân gốc rễ
* [ ] Đã tạo một gói chẩn đoán phù hợp để nâng cấp lên bộ phận hỗ trợ


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/learn-the-platform/vi/module-9-giam-sat-and-khac-phuc-su-co/lab.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
