В официальной библиотеке Ollama у deepseek-r1 на каждый размер всего три варианта файла: Q4_K_M, Q8_0 и fp16 — промежуточных Q5_K_M и Q6_K там нет вовсе. А привычный совет «берите Q4_K_M и не думайте» на рассуждающей модели работает хуже обычного: квант меняет не только качество ответа, но и длину цепочки размышлений, то есть время ожидания. Ниже: где брать недостающие уровни, как низкий квант ломает </think> и почему у настоящей R1 всё иначе.
Подробнее →