Вы подняли локальную модель на одной видеокарте, всё работало отлично, пока пользоваться ей не начали одновременно два-три человека или пара приложений. И вдруг ответы, которые раньше приходили за секунды, стали приходить через минуту-две, а то и дольше. Дело не в том, что модель «сломалась» — она просто обрабатывает запросы по очереди, а очередь при неправильной архитектуре растёт быстрее, чем модель успевает её разгребать. Разберём, откуда берётся эта очередь и что с ней делать на практике.
Подробнее →