Если у вас одна видеокарта — 24 ГБ, редко больше — и вы хотите поместить туда модель покрупнее, universal-движки вроде vLLM часто оказываются не лучшим выбором: они спроектированы под кластеры и батчинг многих запросов, а не под выжимание последнего гигабайта VRAM на одной карте. TabbyAPI и ExLlama — узкоспециализированная связка именно под этот сценарий: одна карта, один (много) пользователь, максимум модели и контекста в доступную память. Разберём, как это работает на практике и в чём реальная цена такой специализации.
Подробнее →