Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Сколько запросов в секунду вытянет локальная модель: методика замера на своём железе

Модель отвечает быстро, когда вы один задаёте ей вопросы в чате. Проблема начинается, когда её включают в продакшн: десять, тридцать, сто пользователей одновременно — и внезапно сервис захлёбывается, хотя на демо всё летало. Разница между «модель быстрая» и «модель выдержит нагрузку» — это разница между двумя разными метриками, и путать их — самая частая ошибка при планировании железа под локальный инференс. Дальше — рабочая методика, как измерить реальную пропускную способность именно на вашей связке модели, движка и GPU, не полагаясь на чужие…

Подробнее →