Модель обучена, метрики устраивают, в Jupyter-блокноте она отвечает за миллисекунды — и тут начинается вторая, куда менее приятная часть работы. Нужно превратить model.predict(x) в сервис, который принимает запросы по сети, переживает параллельную нагрузку и не падает от кривого JSON на входе. BentoML берёт на себя именно эту обвязку: он не обучает модели и не заменяет ваш пайплайн, а стандартизирует путь от готовой модели до контейнера с рабочим API.
Подробнее →