Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Ollama против vLLM: что выгоднее и когда

Оба инструмента запускают одну и ту же открытую модель и отдают ответ по OpenAI-совместимому API — и ведут себя противоположно, как только запросов становится больше одного. Ollama выигрывает у одиночного пользователя и умеет работать без видеокарты; vLLM разносит его в разы на потоке, но требует GPU, в который модель влезает целиком. Ниже — замеры на одном железе, расчёт KV-кэша, точные тексты ошибок и правило выбора.

Подробнее →