Luis Almaguer | Asesor en Ingeniería de Infraestructura Tecnológica - Adviser
Monitoreo de equipos críticos
Hoy en día, dentro de la industria, si un equipo crítico falla, puede causar pérdidas importantes y daños colaterales dentro de la infraestructura. Por ello, es fundamental mantener una supervisión continua de los equipos que son más relevantes para la operación. Esto es lo que conocemos como monitoreo de infraestructura crítica.
Con esto en mente, se puede llegar a pensar que una simple supervisión local de los equipos podría considerarse como monitoreo, pero existen ciertas diferencias que deben considerarse. Su principal diferencia radica en la capacidad de supervisar los equipos desde prácticamente cualquier lugar, con un mayor alcance y disponibilidad de la información.
En el monitoreo de infraestructura crítica buscamos mantener una revisión constante de ciertas variables que pueden llegar a afectar su funcionamiento. Estas variables pueden ser generales, como la temperatura o la humedad ambiental, o más particulares de cada equipo, como el estado de las baterías en un UPS, la temperatura en un equipo HVAC o la carga en un PDU.
¿Qué es un equipo de misión crítica?
Ya tenemos claro el concepto del monitoreo de equipos, pero ¿qué es un equipo crítico? Un equipo crítico puede considerarse como una parte fundamental de la operación, cuya falla puede causar afectaciones importantes en el funcionamiento de una instalación.
Si bien cualquier falla en un equipo de infraestructura convencional puede representar una molestia o requerir una intervención, una falla en un equipo de infraestructura crítica podría provocar pérdidas económicas, afectar la continuidad de la operación o incluso generar daños en otros sistemas de la infraestructura.
Debido a su importancia dentro de la operación, estos equipos deben mantener un alto nivel de disponibilidad y contar con funciones o capacidades que permitan detectar oportunamente cualquier situación que pueda comprometer su correcto funcionamiento.
¿Es realmente necesario monitorizar los equipos?
Dentro de la infraestructura crítica, los equipos encargados de mantener la continuidad de la operación suelen ser muy variados. Por lo tanto, cada uno genera de forma individual información relacionada con su estado y funcionamiento. Esto genera un problema: la información se encuentra distribuida entre los diferentes equipos y, en muchos casos, es necesario consultar cada dispositivo de manera individual.
La problemática radica en que dicha información puede pasar desapercibida, más aún si no existe personal dedicado a consultar el estado de los equipos de forma continua. Buscando solucionar esta problemática, el monitoreo de infraestructura crítica cobra importancia al llevar la información de múltiples equipos a un punto centralizado, disponible para su consulta por el personal responsable.
Esta centralización es posible gracias a diversos mecanismos que permiten intercambiar información entre los diferentes sistemas. Según las características del equipo, como el fabricante y la versión, pueden existir diferentes interfaces o métodos de comunicación que permiten establecer canales de comunicación entre los equipos y las plataformas encargadas de su monitoreo.
Protocolo de comunicación
Para que exista comunicación entre dos personas, es necesario que esas personas se entiendan, que hablen el mismo idioma y que respeten ciertas reglas para comunicarse. Con los equipos que se encargan del monitoreo y los dispositivos que serán supervisados ocurre algo similar.
Los protocolos de comunicación son el conjunto de reglas y estándares que permiten la comunicación entre dos o más dispositivos. Básicamente, establecen la forma en que los equipos intercambian información y permiten que los datos enviados puedan ser interpretados correctamente.
Ahora que ya sabemos qué es un protocolo de comunicación, podemos hablar de algunos ejemplos utilizados dentro del monitoreo de infraestructura crítica.
SNMP
El Simple Network Management Protocol (SNMP) es uno de los protocolos más utilizados para la supervisión y gestión de dispositivos conectados a una red. Está diseñado para obtener información sobre el estado de los equipos y también permite recibir notificaciones relacionadas con diferentes eventos.
Los dispositivos monitoreados cuentan con un agente, que es un software encargado de recopilar información sobre el dispositivo y sus diferentes variables. Este agente se comunica con un gestor, que se encuentra dentro de la plataforma encargada de realizar el monitoreo.
El gestor y los agentes intercambian información de diferentes maneras. Por ejemplo, el gestor puede solicitar el valor de una variable, como la temperatura actual de un equipo. Dependiendo de las capacidades y configuración del dispositivo, también puede realizar determinadas acciones o modificaciones de forma remota.
Por otra parte, el agente puede enviar avisos o notificaciones cuando se presenta alguna situación que requiere atención, como una falla, desconexión o alarma. Este tipo de notificación se conoce como trap.
Modbus
Modbus es un protocolo ampliamente utilizado en aplicaciones industriales y puede encontrarse en equipos como PLC, sensores, actuadores y diferentes dispositivos de control.
En una implementación tradicional de Modbus, un dispositivo maestro inicia las solicitudes y los dispositivos esclavos responden a ellas. Esto significa que la comunicación parte normalmente de una solicitud realizada por el dispositivo que actúa como maestro.
Es uno de los protocolos utilizados desde hace varias décadas y continúa siendo común debido a su simplicidad y a la gran cantidad de equipos industriales que lo soportan.
Modbus puede encontrarse principalmente en dos variantes: Modbus RTU, utilizado normalmente sobre conexiones seriales, y Modbus TCP, que utiliza redes Ethernet.
En algunas instalaciones, cuando una plataforma de monitoreo utiliza un protocolo diferente al del equipo, pueden utilizarse dispositivos de integración o gateways. Por ejemplo, un gateway puede obtener información de un equipo mediante Modbus y posteriormente poner esa información a disposición de una plataforma mediante SNMP.
BACnet
BACnet es un protocolo utilizado principalmente en sistemas de automatización y gestión de edificios. Es común encontrarlo en sistemas HVAC, equipos de climatización, sensores, controladores y otros dispositivos relacionados con la automatización de instalaciones.
Su utilización permite integrar información proveniente de diferentes sistemas del edificio y llevarla a una plataforma centralizada, facilitando la supervisión de variables como temperatura, humedad, estado de funcionamiento y diferentes alarmas.
Como podemos observar, no todos los dispositivos utilizan el mismo protocolo de comunicación. Este puede variar dependiendo del fabricante, el modelo del equipo y la infraestructura disponible. Sin embargo, estos protocolos cumplen una función común: permitir que los equipos intercambien información con sistemas externos de supervisión.
Plataformas de monitoreo
Una vez que los equipos pueden proporcionar información mediante diferentes protocolos, es necesario contar con una plataforma capaz de recibir, organizar y presentar estos datos de una forma que sea útil para el personal responsable.
Dependiendo del tipo de infraestructura que se quiera supervisar, pueden utilizarse diferentes tipos de plataformas. Por ejemplo, los NMS (Network Management Systems) están orientados principalmente a la supervisión de redes y dispositivos de infraestructura tecnológica. Por otro lado, los sistemas BMS (Building Management System) o BAS (Building Automation System) están enfocados en la automatización y supervisión de instalaciones, incluyendo sistemas HVAC y otros elementos del edificio.
En ambientes como los centros de datos también existen plataformas DCIM (Data Center Infrastructure Management), que permiten centralizar información relacionada con diferentes elementos de la infraestructura, como UPS, PDU, climatización, sensores y otros sistemas asociados al funcionamiento del centro de datos.
La plataforma utilizada dependerá de las necesidades de la instalación y de los equipos que se quieran integrar. Lo importante es que pueda recibir la información proporcionada por los dispositivos, organizarla y presentarla de manera que facilite su supervisión y la detección de condiciones anormales.
Como ejemplo de este tipo de soluciones se encuentra el APC NetBotz 250 (en Adviser encuentras el Netbotz 755), un equipo diseñado para el monitoreo ambiental y de seguridad física en instalaciones de TI. Su función es permitir la supervisión de diferentes condiciones del entorno, como la temperatura y la humedad, ayudando a identificar cambios que puedan representar un riesgo para los equipos instalados. Al contar con esta información de manera centralizada, el personal responsable puede detectar oportunamente una condición anormal y tomar las medidas necesarias antes de que llegue a afectar la operación.
El monitoreo de equipos críticos no consiste únicamente en conocer si un dispositivo se encuentra encendido o apagado. Su verdadero valor está en obtener información sobre su estado y comportamiento, permitiendo identificar oportunamente aquellas condiciones que podrían afectar su funcionamiento.
A través de los diferentes protocolos de comunicación, los equipos pueden proporcionar información a sistemas externos, mientras que las plataformas de monitoreo permiten centralizar, organizar y presentar estos datos para que puedan ser consultados por el personal responsable.
Cuando esta información se combina con una correcta configuración de alarmas, registros históricos y procedimientos de respuesta, es posible detectar anomalías antes de que se conviertan en fallas que afecten la operación.
En infraestructuras donde la continuidad es un factor fundamental, contar con información oportuna sobre el estado de los equipos permite tomar decisiones con mayor anticipación y reducir los riesgos asociados a una interrupción. Por ello, un sistema de monitoreo de infraestructura crítica correctamente implementado no solamente permite observar lo que está ocurriendo en la infraestructura, sino también entender su comportamiento y actuar antes de que una condición menor pueda convertirse en un problema mayor.
Además de permitir la supervisión de los equipos, las soluciones de monitoreo pueden ayudar a mantener la disponibilidad, el rendimiento, la seguridad y el cumplimiento de los sistemas y aplicaciones. En Adviser contamos con productos de monitoreo que permiten detectar y corregir problemas antes de que puedan generar interrupciones en el servicio. Dependiendo de las características de la infraestructura, el monitoreo puede realizarse de forma manual o automatizada y ser controlado de manera remota, facilitando la supervisión de los equipos y la atención oportuna de las condiciones que requieran revisión.

Comentarios