Сообщество / Новая тема

Обсуждение статьиПервый комментарий откроет обсуждение — дальше все вопросы по этой статье будут собираться здесь

Об статье:
Какое квантование выбрать для Mistral

Под именем Mistral в библиотеке Ollama живут модели с разными словарями, и одинаковый на вид тег q4_K_M ведёт себя на них по-разному. У семёрки уровней квантования полтора десятка, у mistral-small3.2 — три, а у mistral-nemo почти гигабайт файла уходит на словарь, который толком не жмётся. Ниже — сколько весит каждый уровень, на каком кванте разваливаются вызовы функций и почему на русском тексте более крупная модель отвечает быстрее мелкой.

Подробнее →