Модель на 7 млрд параметров в исходной точности (FP16) весит около 15 ГБ и не влезает ни в бытовую видеокарту, ни в дешёвый VPS. Квантование моделей ужимает вес в несколько раз, но одинаковая на вид метка «Q4» у разных файлов на Hugging Face означает разный размер и разное качество. Разберём, что на самом деле стоит за Q4, Q5 и Q8 в именах GGUF-файлов, как посчитать нужную память и какой уровень брать для чата, кода и агентов — с командами Ollama и нашими собственными замерами на CPU.
Подробнее →