Вы читаете описание новой модели: «120 миллиардов параметров», а рядом кто-то пишет, что она генерирует текст почти как модель на 15 миллиардов. Дальше — хуже: для развёртывания ей всё равно нужна память как для полных 120 миллиардов. Если это выглядит как противоречие — оно и есть противоречие для человека, который ждёт от больших моделей одинаково больших требований и по скорости, и по памяти. На деле здесь работает архитектура Mixture of Experts (MoE, «смешение экспертов»), и она удивляет свежих людей плюс-минус одинаково каждый раз. Разберём, что…
Подробнее →