Модель отвечала за секунду, а через месяц реальной нагрузки ответ стал занимать восемь — и никто не может сказать, с какого дня это началось, потому что никто это не мерил. Нагрузка локальной LLM складывается из трёх независимых слоёв — железа, движка инференса и самих запросов, — и без метрик по каждому из них проблема обнаруживается по жалобе пользователя, а не по графику. Разберём, что снимать на каждом слое, какими инструментами и как читать получившиеся цифры.
Подробнее →