Если вы разворачивали малую модель и удивлялись, почему одна 7B-модель отвечает заметно осмысленнее другой такого же размера — скорее всего, разница именно в этом. «Дистиллированные» модели (в названии часто мелькает слово distilled или суффикс -distill) обучены не с нуля на сырых данных, а скопированы с поведения модели крупнее. Разберём, что происходит технически, почему это работает лучше прямого обучения и где у этого подхода честный потолок.
Подробнее →