Утром дежурный увидел в мониторинге, что хост с виртуалками жив, диск занят на 62%, нагрузка в норме — и одновременно двенадцать почтовых уведомлений о недоступности сервисов. Разрыв между «на дашборде всё хорошо» и «половина кластера легла» — это всегда история про то, что мониторили не ту метрику. В этот раз виноват был тонкий том: хост честно показывал свободное место на диске, а пул данных LVM-thin, из которого реально нарезались виртуальные диски, был заполнен под завязку.
Подробнее →