Алерт в три часа ночи про то, что CPU на секунду подскочил до 85% — это не мониторинг, это генератор недоверия. Через месяц такой практики администратор смотрит на уведомление от Zabbix или Prometheus Alertmanager и думает «опять ерунда», не открывая его вообще. Проблема почти всегда не в том, что алертов настроено мало или много, а в том, что пороги подобраны на глаз, без разбора того, как метрика на самом деле себя ведёт на этом конкретном сервере.
Подробнее →