Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Пропускная способность памяти — настоящий потолок локальной LLM

Вы подняли модель на арендованном сервере, дождались загрузки — и она отвечает мучительно медленно, хотя nvidia-smi или htop показывают загрузку вычислительных блоков на жалкие 30-40%. Первый порыв — списать всё на «слабое железо» и искать карту помощнее. На деле генерация текста почти всегда упирается не в то, сколько операций в секунду умеет процессор или GPU, а в то, с какой скоростью железо успевает прочитать веса модели из памяти. Это другое узкое место, и лечится оно по-другому.

Подробнее →