> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/learn-the-platform/es/modulo-9-supervision-y-resolucion-de-problemas/01-dashboard-health.md).

# Panel y estado del sistema

## Filosofía de monitoreo

VergeOS adopta un **panel único** enfoque para el monitoreo de la infraestructura. Cada componente — cómputo, almacenamiento, redes y estado del hardware — es visible desde la interfaz integrada sin necesidad de herramientas externas de monitoreo. El sistema ofrece métricas en tiempo real, tendencias históricas y registros de eventos en todos los niveles: nodos individuales, clústeres, niveles vSAN, redes, VMs y inquilinos.

Esta página cubre las principales áreas de monitoreo que usarás a diario para evaluar el estado del sistema y solucionar problemas.

```mermaid
graph TB
    subgraph ui["Interfaz de VergeOS — Jerarquía de monitoreo"]
        direction TB
        MAIN["Panel principal<br/>Vista general de todo el sistema"]
        CLUSTER["Vistas del clúster<br/>Grupos de recursos agregados"]
        NODE["Paneles del nodo<br/>Hardware y métricas por nodo"]
        VSAN["Estado de vSAN<br/>Salud y capacidad por nivel"]
        NET["Estado de la red<br/>Conectividad y tráfico"]
        VM["Paneles de VM / inquilino<br/>Métricas por carga de trabajo"]

        MAIN --> CLUSTER
        MAIN --> VSAN
        MAIN --> NET
        CLUSTER --> NODE
        NODE --> VM
    end

    style ui fill:#f0f4ff,stroke:#336
```

## Panel del nodo

La **Panel de nodos** es tu interfaz principal para monitorear servidores físicos (o virtuales) individuales en el entorno. Navega hasta él mediante **Infraestructura → Nodos**, luego selecciona un nodo específico.

### Información de estado del nodo

En la parte superior del panel del nodo, encontrarás campos clave de estado:

| Campo                     | Descripción                                                                                                                                                        |
| ------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| **Estado**                | Estado operativo actual — En ejecución o Sin conexión; durante flujos de mantenimiento puede mostrarse Migrando, Modo de mantenimiento o Saliendo de mantenimiento |
| **Modo de mantenimiento** | Si el nodo está en estado de mantenimiento (cargas de trabajo migradas fuera)                                                                                      |
| **Última vez encendido**  | Marca de tiempo del arranque más reciente                                                                                                                          |
| **Estado de IPMI**        | Estado de la Interfaz Inteligente de Administración de Plataforma                                                                                                  |
| **Dirección de red IPMI** | IP de administración BMC/iDRAC/iLO para acceso remoto                                                                                                              |
| **Versión del sistema**   | Desglose de la versión de VergeOS — versiones de SO, vSAN, Appserver y Kernel                                                                                      |

### Configuración de hardware

El panel también muestra el perfil físico de hardware:

* **CPU** -- Modelo y generación del procesador
* **Núcleos de CPU** -- Número de núcleos físicos
* **RAM** -- Capacidad total de memoria física
* **RAM de failover** -- Memoria reservada para escenarios de failover
* **RAM sobreasignada** -- Memoria disponible para sobreasignación
* **Clúster** -- A qué clúster pertenece este nodo
* **Modelo / etiqueta de activo** -- Plataforma de hardware y etiqueta de inventario del activo

### Gráfico de uso de CPU

El gráfico de uso de CPU es una de las métricas más consultadas. Proporciona visualización de tendencias en tiempo real e históricas con múltiples categorías de desglose:

| Métrica               | Lo que muestra                                                                                      |
| --------------------- | --------------------------------------------------------------------------------------------------- |
| **CPU total**         | Utilización agregada de CPU en todos los núcleos                                                    |
| **Pico de un núcleo** | El núcleo con mayor utilización individual (ayuda a identificar cuellos de botella de un solo hilo) |
| **Usuario**           | Tiempo dedicado a procesos en espacio de usuario                                                    |
| **Sistema**           | Tiempo dedicado a operaciones en espacio de kernel                                                  |
| **Espera de E/S**     | Tiempo en que la CPU está inactiva esperando a que se completen operaciones de E/S                  |
| **Uso de VM**         | CPU consumida por las máquinas virtuales que se ejecutan en este nodo                               |
| **IRQ**               | Tiempo dedicado a manejar interrupciones de hardware y software                                     |

### Tarjetas de estadísticas del nodo

Debajo del gráfico de CPU, el panel presenta tarjetas de métricas de referencia rápida:

* **RAM física** -- Porcentaje actual de utilización de memoria y capacidad total
* **RAM virtual** -- Memoria virtual asignada (normalmente 0% cuando no hay sobreasignación)
* **Temperatura** -- Temperatura actual del nodo con un indicador codificado por colores (verde / amarillo / rojo según los umbrales)
* **Máquinas en ejecución** -- Conteo de VMs activas, contenedores vNet y servicios del sistema en este nodo
* **Uso de núcleos** -- Porcentaje de núcleos de CPU actualmente en uso
* **Uso de RAM** -- Consumo de memoria en todas las máquinas en ejecución

## Panel de recursos de hardware

La sección inferior del panel del nodo proporciona vistas detalladas de cada componente físico de hardware.

### Unidades

Todas las unidades físicas conectadas al nodo se enumeran con datos completos de salud:

| Columna                          | Propósito                                                                        |
| -------------------------------- | -------------------------------------------------------------------------------- |
| **Estado**                       | Indicador en línea / sin conexión                                                |
| **Nombre**                       | Identificador del dispositivo (p. ej., `nvme0n1`, `sda`)                         |
| **Modelo**                       | Fabricante y número de modelo                                                    |
| **Nivel**                        | Asignación del nivel de almacenamiento vSAN (configurada durante la instalación) |
| **ID de unidad vSAN**            | Identificador único dentro de vSAN                                               |
| **Firmware**                     | Versión actual del firmware de la unidad                                         |
| **Bus**                          | Tipo de conexión del bus de hardware (NVMe, SATA, SAS)                           |
| **Uso**                          | Utilización de la capacidad con barra de progreso visual                         |
| **Reparando**                    | Si la unidad se está reconstruyendo actualmente                                  |
| **Errores de lectura/escritura** | Contadores de errores para monitoreo proactivo de la salud                       |

Puedes hacer clic en cualquier unidad para acceder a sus **S.M.A.R.T.** diagnósticos — sectores reasignados, temperatura, horas encendido, nivelación de desgaste y otros indicadores predictivos de fallo.

### Tarjetas de interfaz de red (NIC)

Cada NIC del nodo se muestra con estado operativo y de tejido:

* **Estado** -- Arriba o abajo
* **Estado del tejido** -- Conectividad con el tejido principal. **Confirmado** indica que la NIC está correctamente integrada; **Sin ruta** y **Degradado** son los estados problemáticos a vigilar; **Ninguna** aparece para las NIC que no forman parte del tejido principal. Un icono de globo indica las NIC conectadas al tejido principal
* **Puerto** -- Identificador físico del puerto en la NIC
* **Nombre** -- Identificador de la interfaz (p. ej., `enp2s0f0`)
* **Modelo / proveedor / controlador** -- Detalles de hardware y software
* **Velocidad** -- Velocidad de enlace negociada (p. ej., 10000 Mb/s, 25000 Mb/s)
* **MAC** -- Dirección MAC de hardware
* **Red** -- Red VergeOS asociada
* **RX / TX** -- Total de datos recibidos y transmitidos
* **Tasa RX / TX** -- Tasas actuales de transferencia

### Secciones de hardware adicionales

| Sección                      | Lo que muestra                                                                                                |
| ---------------------------- | ------------------------------------------------------------------------------------------------------------- |
| **Módulos de memoria**       | RAM instalada — cantidad de módulos, capacidad, tipo y especificaciones                                       |
| **Vecinos LLDP**             | Datos del Protocolo de Descubrimiento de Enlace — switch conectado, asignaciones de puertos, topología de red |
| **Dispositivos PCI**         | Todos los dispositivos PCI/PCIe con asignaciones de bus y disponibilidad de passthrough                       |
| **Dispositivos NIC SR-IOV**  | Cantidad de funciones virtuales y estado de asignación para NIC compatibles con SR-IOV                        |
| **Dispositivos NVIDIA vGPU** | Modelo de GPU, perfiles vGPU disponibles y estado de asignación                                               |
| **Dispositivos USB**         | Dispositivos USB conectados con capacidad de passthrough                                                      |

## Monitoreo del estado del tejido

La **tejido central** es la red troncal que conecta todos los nodos VergeOS. Monitorear la salud del tejido es crítico porque la degradación del tejido afecta la replicación de vSAN, la migración en vivo de VMs y la comunicación entre nodos.

En la tabla de NIC de cada nodo, busca la **Estado del tejido** columna:

* **Confirmado** -- La NIC está correctamente integrada en el tejido principal y se comunica con nodos pares
* **Sin ruta** o **Degradado** -- Estados problemáticos que indican que la NIC no participa correctamente en el tejido. Puede indicar un problema de cable, una mala configuración del switch o un fallo de la NIC
* **Ninguna** -- Se muestra para NIC que no forman parte del tejido principal (p. ej., NIC de red externa)

{% hint style="success" %}
**Comprobación rápida de la salud del tejido**

Desde el panel principal, navega a **Infraestructura → Nodos** y revisa el estado del tejido de las NIC en todos los nodos. Cada NIC del tejido principal debe mostrar **Confirmado**. Cualquier **Sin ruta** o **Degradado** estado requiere investigación inmediata — revisa el cableado físico, la configuración del puerto del switch y el estado del controlador de la NIC.
{% endhint %}

## Registros de eventos

Cada panel de nodo incluye una **Registros de eventos** sección que muestra los eventos del sistema en el ámbito de ese nodo. Los eventos se clasifican por nivel de severidad:

| Nivel           | Descripción                                                      | Ejemplos                                                                               |
| --------------- | ---------------------------------------------------------------- | -------------------------------------------------------------------------------------- |
| **Crítica**     | Condiciones que amenazan al sistema y requieren acción inmediata | Nodo sin conexión, vSAN degradado                                                      |
| **Error**       | Fallos que afectan la funcionalidad                              | Fallo de unidad, operaciones fallidas                                                  |
| **Advertencia** | Condiciones que pueden agravarse si no se atienden               | Umbral de temperatura superado, aumento de errores de unidad                           |
| **Mensaje**     | Eventos operativos normales                                      | Cambios de estado de energía, transiciones de modo de mantenimiento, migraciones de VM |

### Entradas de registro comunes

* **Advertencias de temperatura** -- `"El núcleo ha alcanzado la temperatura de advertencia '96 / 95'"` indica que un núcleo de CPU superó el umbral configurado. Los dos números son la lectura actual y el umbral de advertencia calculado para esa CPU. De forma predeterminada (`max_core_temp = 0` en Configuración del clúster → Temperatura del nodo), VergeOS consulta el máximo nominal de hardware de cada CPU y activa la advertencia en `max_core_temp_warn_perc` (predeterminado **10%**) por debajo de ese máximo
* **Eventos de estado de la unidad** -- Notificaciones cuando las unidades se desconectan, comienzan a repararse o reportan nuevos errores de lectura/escritura
* **Cambios de estado de energía** -- Registros de reinicios del nodo, apagados y eventos de encendido
* **Transiciones del modo de mantenimiento** -- Registros cuando un nodo entra o sale del modo de mantenimiento

Cada entrada de registro incluye el **marca de tiempo**, **source** (p. ej., `node1`), y un **mensaje detallado**. Haz clic en **Ver más** para acceder al historial completo de registros.

## Acciones de administración del nodo

El menú del lado izquierdo en el panel del nodo proporciona operaciones esenciales de administración:

### Control de energía

* **Encender / apagar** -- Operaciones estándar de energía mediante IPMI
* **Reiniciar** -- Reinicio ordenado del nodo
* **Forzar apagado** -- Apagado forzado (úsalo solo cuando fallen los métodos ordenados)

### Modo de mantenimiento

**Activa siempre el modo de mantenimiento antes de realizar cambios de hardware o actualizaciones del sistema.** Cuando pones un nodo en modo de mantenimiento, VergeOS migra en vivo las cargas de trabajo activas elegibles a otros nodos del clúster. Las VMs con passthrough de GPU o un tipo de CPU host-passthrough (también passthrough USB o NIC SR-IOV) no son migrables y deben apagarse — manualmente, o automáticamente si el Método de migración de la VM está configurado en Automático.

### Consola remota

Proporciona acceso directo a la consola del nodo mediante IPMI/iDRAC/iLO. Úsalo para escenarios de solución de problemas en los que la interfaz de VergeOS no está accesible o necesitas acceso a nivel de BIOS.

### Acciones adicionales

* **Editar** -- Modificar la configuración del nodo (RAM de failover, sobreasignación, etiquetas)
* **Escalar** -- Añadir recursos al clúster desde este nodo
* **Diagnósticos** -- Acceder a herramientas de diagnóstico a nivel de nodo (escaneo ARP, ethtool, sensores IPMI, pruebas S.M.A.R.T. y más)
* **Actualizar** -- Forzar una actualización de todos los datos del panel

## Vistas a nivel de clúster

Mientras los paneles de nodo muestran la salud de servidores individuales, **las vistas del clúster** proporcionan utilización agregada de recursos en todos los nodos de un clúster.

Vaya a **Sistema → Clústeres** para ver:

* **CPU total** -- Capacidad de procesamiento combinada y utilización en todos los nodos
* **RAM total** -- Memoria agregada con desglose de utilización
* **Cantidad de nodos** -- Número de nodos activos frente al total de nodos del clúster
* **Distribución de cargas de trabajo** -- Cómo se distribuyen las VMs y los servicios entre los nodos

Las vistas del clúster son esenciales para la planificación de capacidad — te ayudan a identificar cuándo un clúster se está acercando a los límites de recursos y cuándo es momento de ampliar con nodos adicionales.

## Resumen del estado de vSAN

Se puede acceder al estado de vSAN desde el panel principal haciendo clic en el **cuadro de conteo de niveles vSAN** cuadro de conteo, o mediante **Infraestructura → Niveles vSAN**.

Los indicadores clave incluyen:

* **Salud del nivel** -- Estado por nivel mostrado mediante el `estado` campo (`online`, `noredundant`, `repairing`, `outofspace`, `offline`, ...) y el `redundant` booleano. La `en curso` marca indica si actualmente hay un Journal Walk en progreso, no la salud general del nivel (un nivel saludable e inactivo muestra `working=false`)
* **Capacidad por nivel** -- Almacenamiento total, usado y disponible para cada nivel
* **Estado de redundancia** -- Si se cumplen los requisitos de redundancia de datos (crítico después de un fallo de unidad o nodo)
* **Estado de reparación** -- Operaciones de reparación activas y progreso (debería ser todo ceros durante la operación normal)
* **Cantidad de dispositivos** -- Número de unidades que participan en cada nivel

{% hint style="warning" %}
**Umbrales de limitación del almacenamiento**

VergeOS aplica limitación automática de E/S a medida que se llena el almacenamiento:

* **Por debajo del 91%** -- Operación normal, sin limitación
* **91–95%** -- Comienza la limitación por poco espacio (se añaden 10 ms de latencia)
* **96%+** -- Limitación crítica (se añaden 50 ms de latencia) con una degradación severa del rendimiento

Supervisa de forma proactiva la capacidad del nivel y configura alertas antes de alcanzar estos umbrales.
{% endhint %}

## Estado de la red

La salud de la red se supervisa desde **Redes** en la navegación principal. Para cada red (externa, interna, DMZ, redes de inquilinos), puedes ver:

* **Estado de conectividad** -- Si la red está en funcionamiento y es accesible
* **Estadísticas de tráfico** -- Volumen y tasas RX/TX por red
* **Máquinas conectadas** -- Qué VMs y servicios están conectados
* **Recuentos de aciertos de reglas del firewall** -- Actividad en las reglas de firewall configuradas
* **Registros específicos de la red** -- Eventos limitados a esa red en particular

## Vista de máquinas en ejecución

Cada panel de nodo incluye una **Máquinas en ejecución** sección que muestra todas las cargas de trabajo activas:

| Columna            | Descripción                                             |
| ------------------ | ------------------------------------------------------- |
| **Estado**         | Indicador de estado en ejecución                        |
| **Tipo**           | Máquina virtual, contenedor vNet o servicio del sistema |
| **Nombre**         | Identificador de la máquina                             |
| **Núcleos de CPU** | Número de núcleos asignados                             |
| **Uso de CPU**     | Porcentaje actual de utilización del procesador         |
| **RAM**            | Memoria asignada con porcentaje de utilización          |
| **Último inicio**  | Marca de tiempo de cuándo se inició la carga de trabajo |

Los tipos de máquina comunes incluyen VMs, contenedores vNet (servicios de red) y servicios del sistema (NAS, DMZ, red externa, etc.).

{% hint style="info" %}
**¿Vienes de VMware o Nutanix?**

En VergeOS, el hardware del nodo, los recursos del clúster, la salud del almacenamiento, el estado de la red y las métricas de las cargas de trabajo viven todos en la misma interfaz integrada — no hace falta un servidor de gestión, una suite de monitoreo ni una CLI separados para la visibilidad del día a día.
{% endhint %}

## Prácticas recomendadas

### Comprobaciones diarias de salud

Revisa las temperaturas del nodo, los contadores de errores de las unidades y el estado del tejido en todos los nodos. Atiende de inmediato cualquier NIC del tejido que muestre **Sin ruta** o **Degradado**, o errores de unidad en aumento, de inmediato.

### Usa el modo de mantenimiento

Activa siempre el modo de mantenimiento antes de cambios de hardware, actualizaciones de firmware o actualizaciones del sistema. Las cargas de trabajo elegibles se migran en vivo antes de tocar el nodo; las VMs que no pueden migrar en vivo (passthrough de GPU, tipo de CPU host-passthrough, passthrough USB, SR-IOV) deben apagarse.

### Supervisa la capacidad de vSAN

Mantén la utilización del nivel por debajo del 85% para conservar margen de rendimiento. Configura alertas de suscripción (tratadas en la siguiente sección) para que te notifiquen antes de alcanzar los umbrales de limitación.

### Revisa los registros con regularidad

Revisa periódicamente los registros de eventos en busca de advertencias de temperatura, errores de unidad y cambios de estado inesperados. Detectar los problemas a tiempo evita fallos en cascada.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/learn-the-platform/es/modulo-9-supervision-y-resolucion-de-problemas/01-dashboard-health.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
