Сервис работал нормально, воркеры разгребали задачи, письма уходили, отчёты генерировались — и вдруг всё встало разом. Память кончилась, новые задачи падали с ошибками, а старые вообще перестали обрабатываться. На разборе выяснилось, что очередь росла три недели подряд, просто никто на это не смотрел. Это типичный сценарий, который повторяется в самых разных стеках — от Sidekiq и Celery до Kafka и RabbitMQ, и у него есть понятная механика, предсказуемые ранние признаки и конкретный набор мер защиты.
Подробнее →