Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Модель загрузилась, но GPU простаивает: разбор по слоям

Вы запускаете локальную модель, в логах ни одной ошибки, процесс инференса стартует, чат отвечает — вроде бы всё в порядке. Но открываете nvidia-smi и видите, что видеокарта загружена на несколько процентов, а генерация ползёт со скоростью, которую вы обычно видите на голом CPU. Это не редкая аномалия, а один из самых частых сценариев в эксплуатации локальных LLM: успешный запуск и эффективное использование GPU — совершенно разные вещи, и движок инференса вам об этом почти никогда не сообщит прямым текстом.

Подробнее →