S
Stitex
Инженерия

Как настроить алерты, чтобы их не отключили

Короткий ответ: поток уведомлений гасят не фильтром в телефоне, а выбором одного из двух путей. Первый — оставить сигналом каждое отклонение, но развести по важности: срочное приходит сразу, остальное собирается в сводку. Второй — сигналить только тем, на что есть действие и адресат, а прочее держать в журнале. Первый путь спокойнее там, где за объект отвечает один человек, второй — там, где дежурство сменное и сообщение уходит нескольким.

3 сентября 20267 минутStitex Technologies

Отключённая рассылка — это не лень персонала

Ломается это так. Мониторинг запустили, каждое отклонение поставили на уведомление, чтобы «ничего не пропустить». Первую ночь дежурный честно читает всё подряд. Вторую — уже заголовки. На третью заказчик просит убрать аварийный адрес из рассылки: сообщения идут пачками и мешают работать. Формально система жива и продолжает писать в журнал. Фактически объект вернулся в состояние «узнаем от арендатора снизу», только теперь за это ещё и платят.

Причина не в количестве самих аварий, а в том, что одно событие порождает много сообщений. Датчик дребезжит на границе уставки — сообщение на каждый переход. Оборудование перезапускается — сообщение на каждый пуск. Пропала связь — сообщение на каждый параметр, который перестал приходить. Человек видит поток, в котором авария и мелочь выглядят одинаково, и глушит канал целиком: выборочно отключить он не может.

Дальше есть ровно два честных пути. Оба рабочие, у обоих своя цена, и выбирать надо по тому, как устроена реакция на объекте, а не по красоте схемы.

Путь первый: сигналит всё, но разложено по важности

Здесь ничего не выбрасывается. Каждое отклонение остаётся событием, но у события появляется уровень, и уровень определяет канал и время доставки. Срочное идёт немедленно и персонально. Важное, но не срочное, копится и уходит одним сообщением в начале смены. Информационное живёт только в журнале и видно, когда человек сам туда заглянул.

  • Уровень назначается по последствию, а не по названию параметра: важно не «температура», а что будет, если её не тронуть до утра,
  • Ночной канал остаётся узким — в него попадает только то, от чего ущерб растёт каждый час,
  • Сводка приходит в фиксированное время и читается целиком, потому что она одна,
  • Журнал сохраняет всё, включая мелочь: при разборе инцидента именно она объясняет, что происходило до аварии.

Кому подходит. Объектам, где за оборудование отвечает один человек или маленькая группа, и где важна полнота картины: инженер хочет видеть всё, что происходило, и сам решает, что из этого значимо. Такой подход хорошо ложится на площадку, где уже собрана история показаний — как в удалённом мониторинге котельной.

Чем платите. Сводку нужно кому-то читать, и это обязанность, а не пожелание: если её не открывают, путь превращается в предыдущий, только тише. Плюс уровни приходится пересматривать, когда объект растёт: то, что на одной установке было мелочью в сводке, на большом парке становится ежедневным потоком.

Путь второй: сигналит только то, на что есть действие

Здесь фильтр стоит раньше. Уведомлением становится не любое отклонение, а событие, у которого есть адресат и действие. Правило простое и проверяется на бумаге: у каждого алерта записано, кто его получает и что делает, получив. Не нашлось действия — сигнал не рассылается, а пишется в журнал и попадает в разбор при следующем обслуживании.

  • Подтверждение по времени: событие становится аварией, если держится дольше заданного интервала, а не в момент первого касания границы,
  • Подавление повторов: пока событие не закрыто, новые сообщения о нём не идут — приходит одно, с отметкой, что оно продолжается,
  • Автоматическое снятие: параметр вернулся в норму — событие закрывается само, и это видно в журнале,
  • Группировка по причине: обрыв связи даёт одно сообщение об объекте, а не отдельное по каждому замолчавшему параметру.

Кому подходит. Объектам, где дежурство сменное и площадок несколько, и где сообщение уходит не одному человеку, а всей смене: цена лишнего сигнала умножается на число получателей. Особенно если парк разнородный и данные сводятся в общую картину — про это отдельно в статье одна панель на разнородный парк оборудования.

Чем платите. Редкое событие, которому не назначили действия, пройдёт мимо канала и всплывёт только при разборе журнала. Поэтому набор правил не пишется один раз навсегда: его пересматривают после каждого инцидента, который пришлось разбирать постфактум, и добавляют то, чего не хватило.

Сравнение по тем пунктам, которые видно в эксплуатации

Что сравниваемПуть первый: всё с уровнямиПуть второй: только с действием
Что приходит ночьюто, чему назначен срочный уровеньто, у чего есть дежурный и действие
Кто разбирает остальноеответственный, по утренней сводкесистема, при следующем обслуживании
Обрыв связисообщение об объекте, уровень задан заранееодно событие, повторы подавлены
Рисксводку перестают читатьредкое событие без правила проходит мимо
Что надо поддерживатьуровни при росте объектасписок действий после каждого разбора
Кому прощеодин ответственный, полная картинасменное дежурство, несколько объектов
Тишина — это тоже состояние, за которым надо следить
Оба пути ломаются одинаково, если считать молчание нормой. Обесточенный контроллер и оборванный канал сообщений не шлют — они просто перестают отвечать. Поэтому регулярный отклик проверяется отдельным признаком, и его пропажа обрабатывается как событие. Иначе самая тихая ночь в истории объекта окажется той, в которую он стоял обесточенным.

Что обязательно на обоих путях

Разница между путями касается фильтрации. Всё остальное одинаково, и без этого не работает ни один из них.

  • У каждого сигнала есть имя получателя, а не общий адрес «на всех»: рассылка в общий чат — это отсутствие ответственного,
  • Повторы об одном событии склеиваются в одно сообщение — это верно для обоих путей: иначе сводка распухает тем же потоком, от которого уходили,
  • Событие закрывается квитированием — отметкой, что человек его увидел и принял, — а не тем, что оно перестало повторяться,
  • «Связь есть» и «оборудование работает» — два разных признака, и путать их нельзя,
  • Текст сообщения содержит объект, узел и что именно произошло: сообщение, по которому надо открывать панель, чтобы понять смысл, ночью не читают,
  • Правила проверяются имитацией: отклонение вызывается намеренно и смотрится, кому и через сколько пришло. Проверка на живой аварии — не проверка.

Как выбрать путь на конкретном объекте

Вопрос решается не архитектурой мониторинга, а тем, кто и как реагирует. Один ответственный, который сам и смотрит, и выезжает, живёт спокойнее на первом пути: ему нужна полнота, а сводку он читает, потому что это его объект. Сменное дежурство и несколько площадок — второй путь: там сообщение без действия обесценивает всю рассылку сразу для всех, кто её получает.

Смешанный вариант тоже нормален: критичные узлы работают по второму пути с жёсткими правилами, остальное — по первому, со сводкой. Важно не то, какой путь выбран, а то, что выбор сделан осознанно и записан. Незаписанные правила рассылки живут ровно до отпуска того, кто их настраивал. С этого же начинается любая диспетчеризация — разбор порядка реакции идёт раньше оборудования, о чём подробнее в статье диспетчеризация здания: с чего начать.

Мы ставим контроль так, чтобы он отличал «связь есть» от «оборудование работает», и сводим аварии в один канал без потока пустых сообщений. Историю событий выгружаете когда угодно и куда угодно — она остаётся вашей вместе с описанием правил. Что именно остаётся у заказчика по каждому направлению — на странице «Что мы делаем и что остаётся у вас».

Частые вопросы

Почему рассылку отключают уже на второй-третий день?

Не из-за одного громкого сообщения, а из-за потока. Пока каждое отклонение уходит отдельным сообщением, ночная смена получает поток повторов об одном и том же событии, и чтение их перестаёт что-либо давать. Человек глушит канал, чтобы спать, и дальше объект остаётся без наблюдения — но выглядит это так, будто мониторинг работает.

Как понять, что конкретный алерт лишний?

Задайте по нему два вопроса: кто именно его получает и что этот человек делает, когда получил. Если ответ на второй вопрос «ничего» или «смотрю, не повторится ли», сигнал не аварийный — его место в журнале и в утренней сводке. Убирать надо не порог, а адресность: сообщение без действия расходует внимание, которое понадобится настоящей аварии.

Что делать с сигналом, который дребезжит на границе нормы?

Не поднимать порог — так теряется реальное отклонение. Правильнее ввести подтверждение по времени: событие считается аварией, если держится дольше заданного интервала, а возврат в норму снимает его автоматически. Повторы об одном и том же событии подавляются до одного сообщения с указанием, что оно продолжается.

Ночью будить или ждать до утра?

Критерий один — растёт ли ущерб, пока никто не реагирует. Разморозка, потеря давления, затопление растут каждый час, значит будить. Отклонение, которое к утру останется таким же, идёт в сводку. Это решение принимается заранее и записывается вместе с уставками, а не выясняется в три часа ночи.

Придёт ли уведомление, если объект вообще пропал из сети?

Только если за молчанием следят отдельно. Обрыв связи и обесточивание не порождают сообщений сами по себе: оборудование замолкает, и без контроля регулярного отклика тишина читается как норма. Поэтому «связь есть» и «оборудование работает» разводятся на два разных признака, и пропажа отклика — такое же событие, как авария.

Разберём вашу рассылку аварий

Посмотрим, что сейчас уходит в канал, какие сигналы дублируют друг друга и что должно приходить ночью. Дальше — правила, по которым это работает без нас.

Контакты

Спросите нас по теме статьи

Опишите свою ситуацию — скажем, что из этого применимо у вас, а что нет. Без обязательств.

Telegram
@StitexBot
Отвечаем
В течение рабочего дня