Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Как мониторить нагрузку локальной LLM

Модель отвечала за секунду, а через месяц реальной нагрузки ответ стал занимать восемь — и никто не может сказать, с какого дня это началось, потому что никто это не мерил. Нагрузка локальной LLM складывается из трёх независимых слоёв — железа, движка инференса и самих запросов, — и без метрик по каждому из них проблема обнаруживается по жалобе пользователя, а не по графику. Разберём, что снимать на каждом слое, какими инструментами и как читать получившиеся цифры.

Подробнее →