«Мы переехали на Kubernetes, теперь с отказоустойчивостью всё в порядке» — фраза, которая почти всегда звучит до первого серьёзного инцидента, а не после. Kubernetes действительно умеет перезапускать упавшие контейнеры и переселять поды на живые узлы, но сам по себе не знает, что ваше приложение зависло, не защищает от одновременного простоя всех реплик и не спасает пользователя от разрыва соединения при обновлении. Отказоустойчивость в кластере — это не свойство платформы, включённое по умолчанию, а результат десятка конкретных настроек, часть которых…
Подробнее →