Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Квантование моделей GGUF для слабого сервера

Квантование — это то, что превращает 140-гигабайтную модель в 40-гигабайтную почти без потери качества. Именно благодаря ему серьёзные LLM запускаются на обычном CPU-сервере. Разберём, как это работает и что выбрать. Веса нейросети изначально хранятся в 16-битных числах (fp16). Квантование пересчитывает их в 4-, 5- или 8-битные — модель теряет часть точности, но занимает в 2–4 раза меньше памяти и работает быстрее.

Подробнее →