Вы арендовали GPU-сервер под свою LLM, открыли nvidia-smi и увидели, что карта во время генерации ответа загружена на несколько процентов, хотя память забита под завязку. Это не баг и не кривая настройка — так себя ведёт любой GPU при обработке одного запроса за раз. Разбираемся, откуда берётся эта неэффективность и почему тот же самый GPU у сервиса с сотней одновременных пользователей внезапно "оживает" и начинает отрабатывать вложенные в него деньги.
Подробнее →