Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Смешение экспертов простыми словами: почему MoE быстрее

Вы читаете описание новой модели: «120 миллиардов параметров», а рядом кто-то пишет, что она генерирует текст почти как модель на 15 миллиардов. Дальше — хуже: для развёртывания ей всё равно нужна память как для полных 120 миллиардов. Если это выглядит как противоречие — оно и есть противоречие для человека, который ждёт от больших моделей одинаково больших требований и по скорости, и по памяти. На деле здесь работает архитектура Mixture of Experts (MoE, «смешение экспертов»), и она удивляет свежих людей плюс-минус одинаково каждый раз. Разберём, что…

Подробнее →