Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Очередь запросов к локальной LLM: чтобы никто не ждал вечно

Вы подняли локальную модель на одной видеокарте, всё работало отлично, пока пользоваться ей не начали одновременно два-три человека или пара приложений. И вдруг ответы, которые раньше приходили за секунды, стали приходить через минуту-две, а то и дольше. Дело не в том, что модель «сломалась» — она просто обрабатывает запросы по очереди, а очередь при неправильной архитектуре растёт быстрее, чем модель успевает её разгребать. Разберём, откуда берётся эта очередь и что с ней делать на практике.

Подробнее →