Вы запускаете локальную модель, в логах ни одной ошибки, процесс инференса стартует, чат отвечает — вроде бы всё в порядке. Но открываете nvidia-smi и видите, что видеокарта загружена на несколько процентов, а генерация ползёт со скоростью, которую вы обычно видите на голом CPU. Это не редкая аномалия, а один из самых частых сценариев в эксплуатации локальных LLM: успешный запуск и эффективное использование GPU — совершенно разные вещи, и движок инференса вам об этом почти никогда не сообщит прямым текстом.
Подробнее →