vLLM выжимает из GPU максимум за счёт PagedAttention и непрерывного батчинга — и сразу отдаёт OpenAI-совместимый API. Показываем, как поднять его на сервере и не упереться в память. vLLM — движок инференса, который в разы обгоняет наивный transformers.generate на нагрузке с многими параллельными запросами. Секрет — PagedAttention (память под KV-кэш выделяется страницами, как в ОС) и continuous batching (запросы доклеиваются в батч на лету).
Подробнее →