Модель отвечает быстро, когда вы один задаёте ей вопросы в чате. Проблема начинается, когда её включают в продакшн: десять, тридцать, сто пользователей одновременно — и внезапно сервис захлёбывается, хотя на демо всё летало. Разница между «модель быстрая» и «модель выдержит нагрузку» — это разница между двумя разными метриками, и путать их — самая частая ошибка при планировании железа под локальный инференс. Дальше — рабочая методика, как измерить реальную пропускную способность именно на вашей связке модели, движка и GPU, не полагаясь на чужие…
Подробнее →