Хуже всего, когда сервис не падает, а просто зависает — метрики зелёные, CPU не занят, а часть клиентов молча ждёт ответ по 20-30 секунд и уходит по таймауту. Мы прошли через такой инцидент: причина оказалась не в приложении и не в базе, а в маленькой, редко упоминаемой настройке ядра — размере очереди accept у слушающего сокета. Разбираем по шагам, что мы видели, какие версии отбросили и что в итоге поменяли.
Подробнее →