Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Что такое батчинг запросов и почему один пользователь тратит GPU впустую

Вы арендовали GPU-сервер под свою LLM, открыли nvidia-smi и увидели, что карта во время генерации ответа загружена на несколько процентов, хотя память забита под завязку. Это не баг и не кривая настройка — так себя ведёт любой GPU при обработке одного запроса за раз. Разбираемся, откуда берётся эта неэффективность и почему тот же самый GPU у сервиса с сотней одновременных пользователей внезапно "оживает" и начинает отрабатывать вложенные в него деньги.

Подробнее →