Phi-4 на VPS: установка и запуск модели Microsoft
Толковая модель нужна, а видеокарты на сервере нет — и большинство разборов молчаливо предполагают именно её. Ставите Llama или Qwen покрупнее на обычный VPS с процессором — и получаете либо OOM при загрузке весов, либо генерацию по два токена в секунду, на которую без раздражения смотреть невозможно. Phi-4 от Microsoft — как раз тот случай, когда компактность не побочный эффект, а исходная цель: модель разрабатывали для рассуждений и кода, рассчитывая уместить её в скромное железо без потери адекватности ответов. Разберём, что это за семейство, какие размеры в нём есть, как поставить модель через Ollama, сколько ресурсов она реально просит и где ей стоит доверять работу, а где — нет.
Содержание
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Что такое Phi-4 и в чём идея серии Phi
Phi — это линейка компактных открытых моделей (Small Language Models, SLM) от Microsoft Research, и Phi-4 — актуальное на сегодня поколение серии. Ключевая идея, которую Microsoft продвигает во всех материалах о Phi ещё с первых версий: качество обучающих данных важнее их количества. Вместо того чтобы бесконтрольно скармливать модели весь доступный веб, команда делает ставку на тщательно отобранные и синтетические датасеты — учебники, структурированные примеры рассуждений, отфильтрованный код. Логика простая: маленькая модель не может «запомнить» весь мир, зато может научиться рассуждать на образцовых примерах, и тогда её компактный размер меньше бьёт по качеству ответов в тех задачах, для которых она затачивалась.
Практический эффект такого подхода — модель, которая для своего класса по размеру ощутимо сильнее в логике, математике и коде, чем можно было бы ожидать, глядя только на число параметров. Это не значит, что Phi-4 конкурирует с флагманскими моделями на сотни миллиардов параметров по широте знаний — не конкурирует и не должна. Но в нише «уместить в CPU-инференс на обычном сервере» она один из самых обсуждаемых вариантов последних релизов Microsoft.
Важная оговорка: конкретные цифры бенчмарков, на которых любят строить сравнительные таблицы, быстро устаревают и зависят от версии модели, методики замера и квантования, в котором её гоняли. Здесь их сознательно не будет — вместо этого стоит один раз самостоятельно прогнать пару задач из своего реального сценария и сравнить с тем, чем вы пользуетесь сейчас. Это займёт меньше времени, чем спор о процентах в чужом бенчмарке.
Варианты по размеру в семействе
У Phi-4 не одна модель, а линейка: базовая версия для более серьёзных задач и компактные варианты, в названии которых обычно встречается что-то вроде mini — они рассчитаны на ещё более скромное железо, включая устройства без выделенной видеокарты вообще. Разделение по размеру внутри семейства Microsoft периодически пересматривает: появляются новые варианты, старые получают ревизии, меняются названия тегов в реестрах моделей.
Именно поэтому здесь сознательно не приводится жёсткий список тегов с конкретными числами параметров — на момент установки в 2026 году он вполне может отличаться от того, что было актуально ещё полгода назад. Прежде чем качать модель, загляните на официальную страницу Phi-4 в библиотеке Ollama (ollama.com/library) или в карточку модели на Hugging Face — там всегда актуальный список тегов с указанием размера и квантования. Это несложная привычка, но она экономит время: не нужно потом разбираться, почему скачался не тот вариант или почему тег из старой инструкции больше не резолвится.
Общий принцип выбора внутри линейки такой: чем компактнее вариант, тем меньше ему нужно памяти и тем быстрее он отвечает на CPU, но тем осторожнее стоит относиться к сложным многошаговым рассуждениям — там разрыв между базовой и облегчённой версией ощущается сильнее всего.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaУстановка через Ollama
Проще всего попробовать Phi-4 через Ollama — она сама разбирается с форматом весов, квантованием по умолчанию и запуском локального API. Сначала — сама Ollama, если её ещё нет на сервере:
curl -fsSL https://ollama.com/install.sh | sh
Дальше — загрузка модели. Точное имя тега нужно свериться в библиотеке Ollama непосредственно перед установкой: линейка Phi-4 время от времени получает новые ревизии и варианты по размеру, и тег, актуальный сегодня, через несколько месяцев может смениться. На странице модели в разделе Tags всегда виден полный список с размером файла для каждого варианта.
ollama pull phi4
Если библиотека на момент установки показывает более конкретное имя тега (например, с суффиксом версии или размера), используйте именно его — команда pull одинаково работает с любым валидным тегом из реестра. После загрузки — быстрый диалоговый запуск прямо в терминале:
ollama run phi4
Это откроет интерактивный чат: можно сразу задать модели тестовый вопрос по коду или логике и оценить скорость ответа на конкретном сервере. Список уже скачанных моделей и их размер на диске проверяется так:
ollama list
Если модель больше не нужна, освобождает место:
ollama rm phi4
Для мини-варианта (или любого другого тега компактнее базового) команды идентичны — меняется только имя тега после pull и run. Разницу в подходах между Ollama и альтернативными раннерами вроде llama.cpp разобрано отдельно в материале Llama.cpp против Ollama: что выгоднее и когда — если вы уже определились с Phi-4 и решаете, чем именно её крутить, это полезное чтение.
Требования к RAM и диску
Ollama по умолчанию раздаёт модели в квантовании, близком к 4-битному (обычно варианты вроде Q4_K_M), и именно эта версия скачивается командой ollama pull без дополнительных уточнений. Общее правило для оценки памяти под квантованную модель: примерно 0,6–0,8 ГБ RAM на каждый миллиард параметров плюс запас в пару гигабайт под контекст и служебные накладные расходы движка. Точный вес конкретного тега Phi-4 стоит смотреть прямо в выводе ollama pull — там указывается размер скачиваемого файла, и по нему легко прикинуть требуемую память с запасом.
Практический ориентир для любой компактной модели в 4-битном квантовании: 8 ГБ RAM тянут её впритык, с риском уйти в своп при длинном контексте; 16 ГБ дают комфортный запас для повседневной работы; если рядом с моделью крутится ещё веб-сервер, база данных или несколько параллельных запросов — закладывайте от 16 ГБ и выше. Компактные mini-варианты линейки требовательнее к памяти заметно меньше базовой версии — это и есть их основной смысл существования.
На диске квантованная модель весит в разы меньше своей полноразмерной BF16-версии — обычно счёт идёт на единицы гигабайт для базового тега и ещё меньше для облегчённых вариантов. Но диск на сервере стоит брать с запасом: кэш Ollama, логи и место под пробы других моделей быстро съедают освобождённое место. Общую методику расчёта под разные квантования разбирали в материале Квантование моделей Q4/Q5/Q8: что выбрать — она применима и к Phi-4, и к любой другой модели в библиотеке Ollama. Если сервер совсем скромный, стоит заглянуть и в материал коллег Какую модель Ollama поставить на 4 ГБ RAM — там разбирается сценарий на границе возможного, куда компактные варианты Phi-4 часто попадают в шорт-лист.
Что касается CPU: чем больше ядер и чем выше пропускная способность памяти процессора, тем быстрее генерация — Phi-4, как и любая другая модель через Ollama, не использует видеокарту, если её нет, и упирается именно в память и вычисления процессора. На современном многоядерном VPS компактный вариант линейки вполне выдаёт скорость, пригодную для интерактивного использования, не претендуя, впрочем, на комфорт GPU-инференса.
Где Phi-4 хороша, а где не стоит рассчитывать на многое
Сильная сторона модели, вытекающая напрямую из философии обучения на качественных данных, — задачи с чёткой внутренней логикой: код, отладка, объяснение алгоритмов, математические выкладки, рассуждения по шагам. Для скрипта, который парсит логи, генерирует SQL-запросы или помогает разобраться в стектрейсе, компактная модель этого класса часто справляется на удивление достойно — заметно лучше, чем можно ожидать от модели её размера в задачах общего профиля.
Слабые стороны тоже стоит проговорить честно. Широта фактических знаний — модель, обученную преимущественно на курируемых и синтетических данных, не стоит переоценивать в вопросах о редких фактах, актуальных событиях или узкоспециализированных областях за пределами кода и математики: здесь более крупные модели общего назначения обычно увереннее. Многоязычность — англоязычные и связанные с кодом задачи для Phi-4, как правило, сильная сторона, а качество на менее представленных в обучении языках может ощутимо проседать по сравнению с флагманскими мультиязычными моделями. Проверить это на своих задачах быстрее и надёжнее, чем полагаться на чужие обзоры.
Итог для выбора: сценарий — компактный сервер без GPU и задачи с уклоном в код и логику — Phi-4 стоит попробовать одной из первых. Нужен универсальный ассистент с широкими фактическими знаниями на разных языках — разумнее смотреть в сторону более крупных моделей.
Интеграция через API Ollama
После ollama pull модель сразу доступна не только в интерактивном режиме, но и как локальный OpenAI-совместимый API — по умолчанию Ollama слушает 127.0.0.1:11434. Это открывает прямой путь встроить Phi-4 в собственный скрипт или сервис без дополнительной обвязки.
Простой запрос к модели через curl:
curl http://127.0.0.1:11434/api/generate -d '{
"model": "phi4",
"prompt": "Объясни разницу между списком и кортежем в Python",
"stream": false
}'
Для приложений, которые уже написаны под клиент OpenAI, у Ollama есть отдельный совместимый эндпоинт — достаточно поменять base_url в клиенте на адрес сервера и указать имя модели:
curl http://127.0.0.1:11434/v1/chat/completions -d '{
"model": "phi4",
"messages": [{"role": "user", "content": "Напиши функцию сортировки слиянием на Python"}]
}'
Из Python это выглядит как обычный вызов клиента, только с изменённым адресом:
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:11434/v1", api_key="ollama")
response = client.chat.completions.create(
model="phi4",
messages=[{"role": "user", "content": "Проверь этот код на ошибки: ..."}]
)
print(response.choices[0].message.content)
Если API нужно открыть не только для локальных процессов на сервере, порт 11434 не стоит выставлять в интернет напрямую без авторизации — закройте его фаерволом снаружи и проксируйте через Nginx с отдельным ключом на уровне прокси.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaОбсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Частые вопросы
Phi-4 работает без видеокарты?
Да, это одна из целей серии — компактные модели, спроектированные с расчётом на CPU-инференс. Через Ollama модель запускается на обычном VPS без GPU, и в квантованном виде это основной ожидаемый сценарий использования.
Какой тег скачивать — базовый или mini?
Зависит от объёма RAM и сложности задач. Базовая Phi-4 точнее на многошаговых рассуждениях, mini-варианты экономичнее по памяти и быстрее на слабом железе. Точный список актуальных тегов и их размеров всегда стоит смотреть в библиотеке Ollama непосредственно перед установкой — линейка обновляется.
Чем Phi-4 отличается от Qwen или Llama того же класса?
Прямое сравнение с точными цифрами быстро устаревает и сильно зависит от задачи, поэтому надёжнее один раз прогнать на своём сервере одинаковый набор тестовых запросов через каждую модель и сравнить субъективно. По общей направленности Phi-4 заметно ориентирована на код и логику, тогда как соседние семейства часто ровнее по многоязычности и фактическим знаниям.
Можно ли дообучить Phi-4 под свою задачу?
Модель распространяется как open-weight, дообучение (fine-tuning) технически возможно, но требует отдельного сервера с GPU — сам продакшен-инференс через Ollama этого не требует.
Сколько стоит попробовать Phi-4 на VPS?
Для компактных вариантов линейки хватает недорогого тарифа с 8–16 ГБ RAM без видеокарты — заметно дешевле GPU-сервера, нужного для более крупных моделей.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.