Вы перезапустили инференс-сервер после обновления модели, деплоя новой версии образа или банального падения процесса — и первый же реальный запрос от пользователя завис на заметную паузу, хотя все следующие отвечают быстро. Это не глюк и не перегрузка GPU — сервису при старте нужно один раз проделать тяжёлую подготовительную работу, прежде чем он будет готов быстро считать токены. Разберём, из чего складывается эта пауза и что реально можно сделать, чтобы она не доставалась живому пользователю.
Подробнее →