Толковая модель нужна, а видеокарты на сервере нет — и большинство разборов молчаливо предполагают именно её. Ставите Llama или Qwen покрупнее на обычный VPS с процессором — и получаете либо OOM при загрузке весов, либо генерацию по два токена в секунду, на которую без раздражения смотреть невозможно. Phi-4 от Microsoft — как раз тот случай, когда компактность не побочный эффект, а исходная цель: модель разрабатывали для рассуждений и кода, рассчитывая уместить её в скромное железо без потери адекватности ответов. Разберём, что это за семейство, какие…
Подробнее →