Отключённая рассылка — это не лень персонала
Ломается это так. Мониторинг запустили, каждое отклонение поставили на уведомление, чтобы «ничего не пропустить». Первую ночь дежурный честно читает всё подряд. Вторую — уже заголовки. На третью заказчик просит убрать аварийный адрес из рассылки: сообщения идут пачками и мешают работать. Формально система жива и продолжает писать в журнал. Фактически объект вернулся в состояние «узнаем от арендатора снизу», только теперь за это ещё и платят.
Причина не в количестве самих аварий, а в том, что одно событие порождает много сообщений. Датчик дребезжит на границе уставки — сообщение на каждый переход. Оборудование перезапускается — сообщение на каждый пуск. Пропала связь — сообщение на каждый параметр, который перестал приходить. Человек видит поток, в котором авария и мелочь выглядят одинаково, и глушит канал целиком: выборочно отключить он не может.
Дальше есть ровно два честных пути. Оба рабочие, у обоих своя цена, и выбирать надо по тому, как устроена реакция на объекте, а не по красоте схемы.
Путь первый: сигналит всё, но разложено по важности
Здесь ничего не выбрасывается. Каждое отклонение остаётся событием, но у события появляется уровень, и уровень определяет канал и время доставки. Срочное идёт немедленно и персонально. Важное, но не срочное, копится и уходит одним сообщением в начале смены. Информационное живёт только в журнале и видно, когда человек сам туда заглянул.
- •Уровень назначается по последствию, а не по названию параметра: важно не «температура», а что будет, если её не тронуть до утра,
- •Ночной канал остаётся узким — в него попадает только то, от чего ущерб растёт каждый час,
- •Сводка приходит в фиксированное время и читается целиком, потому что она одна,
- •Журнал сохраняет всё, включая мелочь: при разборе инцидента именно она объясняет, что происходило до аварии.
Кому подходит. Объектам, где за оборудование отвечает один человек или маленькая группа, и где важна полнота картины: инженер хочет видеть всё, что происходило, и сам решает, что из этого значимо. Такой подход хорошо ложится на площадку, где уже собрана история показаний — как в удалённом мониторинге котельной.
Чем платите. Сводку нужно кому-то читать, и это обязанность, а не пожелание: если её не открывают, путь превращается в предыдущий, только тише. Плюс уровни приходится пересматривать, когда объект растёт: то, что на одной установке было мелочью в сводке, на большом парке становится ежедневным потоком.
Путь второй: сигналит только то, на что есть действие
Здесь фильтр стоит раньше. Уведомлением становится не любое отклонение, а событие, у которого есть адресат и действие. Правило простое и проверяется на бумаге: у каждого алерта записано, кто его получает и что делает, получив. Не нашлось действия — сигнал не рассылается, а пишется в журнал и попадает в разбор при следующем обслуживании.
- •Подтверждение по времени: событие становится аварией, если держится дольше заданного интервала, а не в момент первого касания границы,
- •Подавление повторов: пока событие не закрыто, новые сообщения о нём не идут — приходит одно, с отметкой, что оно продолжается,
- •Автоматическое снятие: параметр вернулся в норму — событие закрывается само, и это видно в журнале,
- •Группировка по причине: обрыв связи даёт одно сообщение об объекте, а не отдельное по каждому замолчавшему параметру.
Кому подходит. Объектам, где дежурство сменное и площадок несколько, и где сообщение уходит не одному человеку, а всей смене: цена лишнего сигнала умножается на число получателей. Особенно если парк разнородный и данные сводятся в общую картину — про это отдельно в статье одна панель на разнородный парк оборудования.
Чем платите. Редкое событие, которому не назначили действия, пройдёт мимо канала и всплывёт только при разборе журнала. Поэтому набор правил не пишется один раз навсегда: его пересматривают после каждого инцидента, который пришлось разбирать постфактум, и добавляют то, чего не хватило.
Сравнение по тем пунктам, которые видно в эксплуатации
| Что сравниваем | Путь первый: всё с уровнями | Путь второй: только с действием |
|---|---|---|
| Что приходит ночью | то, чему назначен срочный уровень | то, у чего есть дежурный и действие |
| Кто разбирает остальное | ответственный, по утренней сводке | система, при следующем обслуживании |
| Обрыв связи | сообщение об объекте, уровень задан заранее | одно событие, повторы подавлены |
| Риск | сводку перестают читать | редкое событие без правила проходит мимо |
| Что надо поддерживать | уровни при росте объекта | список действий после каждого разбора |
| Кому проще | один ответственный, полная картина | сменное дежурство, несколько объектов |
Что обязательно на обоих путях
Разница между путями касается фильтрации. Всё остальное одинаково, и без этого не работает ни один из них.
- •У каждого сигнала есть имя получателя, а не общий адрес «на всех»: рассылка в общий чат — это отсутствие ответственного,
- •Повторы об одном событии склеиваются в одно сообщение — это верно для обоих путей: иначе сводка распухает тем же потоком, от которого уходили,
- •Событие закрывается квитированием — отметкой, что человек его увидел и принял, — а не тем, что оно перестало повторяться,
- •«Связь есть» и «оборудование работает» — два разных признака, и путать их нельзя,
- •Текст сообщения содержит объект, узел и что именно произошло: сообщение, по которому надо открывать панель, чтобы понять смысл, ночью не читают,
- •Правила проверяются имитацией: отклонение вызывается намеренно и смотрится, кому и через сколько пришло. Проверка на живой аварии — не проверка.
Как выбрать путь на конкретном объекте
Вопрос решается не архитектурой мониторинга, а тем, кто и как реагирует. Один ответственный, который сам и смотрит, и выезжает, живёт спокойнее на первом пути: ему нужна полнота, а сводку он читает, потому что это его объект. Сменное дежурство и несколько площадок — второй путь: там сообщение без действия обесценивает всю рассылку сразу для всех, кто её получает.
Смешанный вариант тоже нормален: критичные узлы работают по второму пути с жёсткими правилами, остальное — по первому, со сводкой. Важно не то, какой путь выбран, а то, что выбор сделан осознанно и записан. Незаписанные правила рассылки живут ровно до отпуска того, кто их настраивал. С этого же начинается любая диспетчеризация — разбор порядка реакции идёт раньше оборудования, о чём подробнее в статье диспетчеризация здания: с чего начать.
Мы ставим контроль так, чтобы он отличал «связь есть» от «оборудование работает», и сводим аварии в один канал без потока пустых сообщений. Историю событий выгружаете когда угодно и куда угодно — она остаётся вашей вместе с описанием правил. Что именно остаётся у заказчика по каждому направлению — на странице «Что мы делаем и что остаётся у вас».
Частые вопросы
Почему рассылку отключают уже на второй-третий день?
Не из-за одного громкого сообщения, а из-за потока. Пока каждое отклонение уходит отдельным сообщением, ночная смена получает поток повторов об одном и том же событии, и чтение их перестаёт что-либо давать. Человек глушит канал, чтобы спать, и дальше объект остаётся без наблюдения — но выглядит это так, будто мониторинг работает.
Как понять, что конкретный алерт лишний?
Задайте по нему два вопроса: кто именно его получает и что этот человек делает, когда получил. Если ответ на второй вопрос «ничего» или «смотрю, не повторится ли», сигнал не аварийный — его место в журнале и в утренней сводке. Убирать надо не порог, а адресность: сообщение без действия расходует внимание, которое понадобится настоящей аварии.
Что делать с сигналом, который дребезжит на границе нормы?
Не поднимать порог — так теряется реальное отклонение. Правильнее ввести подтверждение по времени: событие считается аварией, если держится дольше заданного интервала, а возврат в норму снимает его автоматически. Повторы об одном и том же событии подавляются до одного сообщения с указанием, что оно продолжается.
Ночью будить или ждать до утра?
Критерий один — растёт ли ущерб, пока никто не реагирует. Разморозка, потеря давления, затопление растут каждый час, значит будить. Отклонение, которое к утру останется таким же, идёт в сводку. Это решение принимается заранее и записывается вместе с уставками, а не выясняется в три часа ночи.
Придёт ли уведомление, если объект вообще пропал из сети?
Только если за молчанием следят отдельно. Обрыв связи и обесточивание не порождают сообщений сами по себе: оборудование замолкает, и без контроля регулярного отклика тишина читается как норма. Поэтому «связь есть» и «оборудование работает» разводятся на два разных признака, и пропажа отклика — такое же событие, как авария.