Совет «берите Q4_K_M и не думайте» родился на Llama 2, и на третьем поколении работает хуже. Квантование Llama 3 стоит дороже: модель обучена на 15 триллионах токенов, избыточности в весах почти не осталось, и то же четырёхбитное округление обходится вдвое большей потерей качества. Ниже — замеры, размеры файлов и три места, где сжатие ломается первыми.
Подробнее →