«У нас балансировщик и два сервера — если один упадёт, второй подхватит» — фраза, после которой обычно наступает спокойствие в команде и внимание переключается на что-то другое. Проблема в том, что эта схема описывает только один слой инфраструктуры, а отказоустойчивость либо есть у всей цепочки от пользователя до данных, либо её нет вообще — слабое звено определяет реальную живучесть сервиса, а не самое сильное. Разберём, какие точки отказа обычно остаются за кадром у такой схемы и что нужно проверить, прежде чем называть её отказоустойчивой.
Подробнее →