Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Дистилляция модели: маленькая копия большой

Если вы разворачивали малую модель и удивлялись, почему одна 7B-модель отвечает заметно осмысленнее другой такого же размера — скорее всего, разница именно в этом. «Дистиллированные» модели (в названии часто мелькает слово distilled или суффикс -distill) обучены не с нуля на сырых данных, а скопированы с поведения модели крупнее. Разберём, что происходит технически, почему это работает лучше прямого обучения и где у этого подхода честный потолок.

Подробнее →