У qwen2.5:14b в библиотеке Ollama больше двадцати вариантов одного и того же файла — от q2_K на 5,8 ГБ до fp16 на 29,5 ГБ. Разница не только в занятом месте: на одних уровнях модель отвечает как оригинал, на других начинает путаться в числах и выдавать сломанный JSON. Ниже — что означают буквы в имени, сколько теряется на каждом шаге по замерам, как квантование влияет на скорость и какой файл брать под чат, код и вызовы функций.
Подробнее →