Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
TabbyAPI и exllama: выжимаем максимум из одной видеокарты

Если у вас одна видеокарта — 24 ГБ, редко больше — и вы хотите поместить туда модель покрупнее, universal-движки вроде vLLM часто оказываются не лучшим выбором: они спроектированы под кластеры и батчинг многих запросов, а не под выжимание последнего гигабайта VRAM на одной карте. TabbyAPI и ExLlama — узкоспециализированная связка именно под этот сценарий: одна карта, один (много) пользователь, максимум модели и контекста в доступную память. Разберём, как это работает на практике и в чём реальная цена такой специализации.

Подробнее →