Автомасштабирование обычного API-сервера — решённая задача: нагрузка выросла, оркестратор поднял новый под, тот стартовал за секунды и уже принимает трафик. Примените ту же логику к сервису ИИ-инференса на GPU — и получите пользователей, которые ждут ответа заметно дольше обычного именно в момент всплеска, то есть ровно тогда, когда автомасштабирование должно было спасти положение. Дело не в том, что автомасштабирование ИИ-сервиса настроено криво: у него есть фундаментальное ограничение, которое не лечится тюнингом порогов, и его нужно закладывать в…
Подробнее →