Проактивный мониторинг обнаруживает деградацию инфраструктуры до того, как она станет аварией. Загрузка процессора маршрутизатора, выросшая до 95 %, рост задержек между площадками, ухудшение оптического сигнала — предвестники отказа, которые система фиксирует заранее.
Что мониторим
- доступность сетевых узлов — ICMP, SNMP;
- загрузку интерфейсов и процессоров активного оборудования;
- состояние оптических каналов — оптическая мощность, BER, OSNR;
- инженерные системы ЦОД — температура, влажность, состояние ИБП и ДГУ;
- серверы и СХД — процессор, память, дисковые операции, температура;
- промышленные объекты — через OPC UA, Modbus, МЭК 61850.
Инструменты
Zabbix, PRTG, Prometheus с Grafana, Nagios, NMS-системы вендоров (HP NNMi, Cisco Prime), DCIM для ЦОД. Систему разворачиваем на инфраструктуре заказчика или ведём на своей — в зависимости от требований к передаче данных наружу.
Оповещения
SMS, электронная почта, Telegram, интеграция с ServiceDesk (JIRA, OTRS). Правила оповещения настраиваются по уровням критичности, чтобы дежурная смена не получала сотню писем в сутки и не переставала их читать.
Отчётность
- ежемесячные SLA-отчёты с метриками доступности — uptime, MTTR, MTBF;
- тренды загрузки для планирования ёмкости;
- аналитика инцидентов за период с разбором повторяющихся причин.
Чем это отличается от эксплуатации
Мониторинг — это система, которая видит проблему и сообщает о ней. Реагирование на инцидент, выезд и ремонт — уже эксплуатация и обслуживание, а круглосуточное дежурство по сетям связи — аутсорсинг эксплуатации сети. Услуги берутся и по отдельности, и вместе: в последнем случае за обнаружение и устранение отвечает один подрядчик.