MAATRIX / Блог / Миф: локальный ИИ бесплатный

Миф: локальный ИИ бесплатный

MAATRIX

Скачали Llama или Qwen, подняли Ollama на своём железе — и в голове щёлкает: «всё, я слез с подписок, теперь это бесплатно». Формально вы правда перестали платить за токены облачному API. Но за запуск модели всё равно кто-то платит — просто счёт приходит не от OpenAI, а от вычислительной инфраструктуры, вашего времени и вашего электричества. Разберём, из чего на самом деле состоит стоимость локального ИИ и когда «свой» действительно дешевле чужого.

Рациональное зерно: веса модели правда бесплатны

Здесь миф не на пустом месте. Открытые веса — Llama, Qwen, Mistral, DeepSeek и десятки других — можно скачать и использовать без лицензионных отчислений, без счётчика токенов и без риска, что завтра провайдер поднимет цену API вдвое. Это реальное и важное отличие от закрытых моделей, за обращение к которым вы платите на каждый запрос, независимо от того, где физически крутится инференс.

Это отличие принципиально меняет структуру расходов, и об этом дальше пойдёт речь. Но «модель ничего не стоит» — это не то же самое, что «инференс ничего не стоит». Модель — это просто файл с весами, лежащий на диске. Чтобы превратить его в работающего ассистента, отвечающего на запросы, нужен работающий сервер, который эти веса держит в памяти GPU и обрабатывает поток входящих обращений. И вот это уже не бесплатно ни при каком раскладе.

Первая статья расходов: вычислительное железо

Модель весом в 7–8 млрд параметров в квантовании Q4 занимает порядка 4–6 ГБ видеопамяти, модель на 70 млрд параметров — уже 35–45 ГБ, и это без учёта контекста и KV-кэша под параллельные запросы. Такие объёмы видеопамяти не встречаются в бытовых видеокартах, поэтому большинство тех, кто говорит «у меня локальный ИИ», на самом деле арендуют GPU-сервер — свой или чужой дата-центр, но всё равно чужое железо с почасовой или помесячной оплатой.

И вот тут ключевое отличие от облачного API: аренда GPU-сервера — это фиксированный ежемесячный счёт, который приходит независимо от того, сделали вы за месяц сто запросов или сто тысяч. Условный сервер с картой уровня RTX 4090 или профессиональной A-серии в аренде обходится в сумму, сопоставимую по порядку величины с несколькими сотнями долларов в месяц — точная цифра зависит от конфигурации и провайдера, поэтому ориентируйтесь на прайс конкретного тарифа, а не на абстрактное число. Этот счёт вы платите 1-го числа независимо от нагрузки. Токен из облачного API, наоборот, тарифицируется строго по факту использования: не сделали запрос — не заплатили ни цента.

Разница не в том, что один вариант «бесплатный», а другой «платный» — разница в модели тарификации: фиксированная стоимость против переменной. Это разные экономические механизмы, и путать их с «есть плата» / «нет платы» — источник мифа.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть ИИ на сервере

Вторая статья расходов: время администратора

Развёрнутый inference-сервер не работает сам по себе вечно. Кто-то должен:

  • подобрать и настроить рантайм (vLLM, llama.cpp, Ollama, TGI — у каждого свои особенности и грабли);
  • следить за обновлениями драйверов CUDA/ROCm и совместимостью версий, потому что несовместимая связка драйвер-рантайм-модель — частая причина падения сервиса именно после «безобидного» апдейта;
  • мониторить утилизацию GPU и памяти, чтобы вовремя заметить деградацию (это отдельная тема — как мониторить нагрузку локальной LLM, если этот вопрос актуален отдельно);
  • обновлять сами модели, разбираться с квантованием, если новая версия не влезает в имеющуюся память;
  • разбирать инциденты: модель зависла, выросла задержка ответа, кончилось место на диске под чекпоинты.

Если вы делаете всё это сами в свободное время — вы не платите деньгами, но платите часами, которые могли бы уйти на что-то другое. Экономисты называют это альтруистично «издержками упущенной возможности», но по сути это та же стоимость, просто не выставленная счётом. Если вы нанимаете администратора или DevOps-инженера на эти задачи — стоимость становится прямой строкой в бюджете, причём часто более заметной, чем счёт за облачный API на старте проекта.

Важный нюанс: у облачного API эта статья расходов не исчезает полностью — вам всё ещё нужно писать промпты, обрабатывать ответы, следить за лимитами. Но объём инфраструктурной возни у вас в разы меньше: провайдер API сам обновляет рантайм, сам следит за отказоустойчивостью железа, сам разбирается с драйверами. Вы платите за это в цене токена — просто не видите эту часть отдельной строкой.

Третья статья расходов: электричество (если железо ваше)

Если вы не арендуете сервер в дата-центре, а держите физическую видеокарту у себя — в офисе или дома — добавляется прямая статья расходов на электричество. Мощная видеокарта под нагрузкой инференса потребляет заметную долю киловатта, и если сервер работает круглосуточно в ожидании запросов, счётчик крутится и в те часы, когда запросов нет вообще. Точную цифру в рублях или долларах называть не будем — она зависит от тарифа в вашем регионе и от того, простаивает GPU в режиме ожидания или активно считает, — но сам факт: это реальные деньги, которые не появляются в счёте облачного API, потому что там эту статью расходов провайдер размазывает по цене токена и делит между тысячами клиентов.

При аренде GPU-сервера в дата-центре электричество уже включено в стоимость аренды — это по сути тот же принцип, просто провайдер сервера, а не провайдер API, взял на себя эту статью расходов и заложил её в почасовую или помесячную цену.

Утилизация решает всё: почему свой запрос иногда дороже облачного

Вот здесь начинается самая контринтуитивная часть мифа. Возьмём условный сервер с фиксированной стоимостью аренды в месяц. Если через него проходит миллион запросов за месяц — стоимость аренды, размазанная на каждый запрос, получается копеечной. Если через тот же сервер за тот же месяц проходит сто запросов — та же самая фиксированная стоимость аренды делится на в десять тысяч раз меньшее число обращений, и эффективная цена одного запроса взлетает пропорционально.

Это и есть суть претензии к мифу «бесплатно»: стоимость запроса к локальному ИИ — не константа, она обратно пропорциональна загрузке сервера. При низкой утилизации (типичная ситуация для пет-проекта, MVP или сервиса с редкими всплесками трафика) эффективная стоимость одного запроса к своей модели может оказаться выше, чем аналогичный запрос к дешёвому облачному API, который вы бы оплатили строго по факту использования, без простаивающего между запросами железа.

Методику точного расчёта эффективной стоимости одного запроса — с учётом амортизации аренды, доли времени простоя и объёма реального трафика — разбирает отдельная статья: как считать стоимость одного запроса к вашей LLM. Здесь важен сам вывод из этой методики: у переменной (облачной) модели тарификации цена запроса стабильна независимо от объёма трафика, а у фиксированной (локальной) — падает с ростом утилизации и растёт при простое. Это значит, что вопрос «что дешевле» не имеет универсального ответа — он зависит от вашего реального профиля нагрузки, а не от того, где физически стоит GPU.

Похожий разбор с акцентом на выбор между вариантами — в статье локальная модель против облачного API: что выгоднее и когда: там разложены сценарии, где выигрывает каждый из подходов.

Когда локальный ИИ реально выгоднее

Мифом «бесплатно» злоупотребляют, но зерно правды в другом: при высокой и предсказуемой постоянной загрузке фиксированная стоимость аренды GPU-сервера действительно окупается и начинает выигрывать у переменной оплаты за токены. Логика простая: если сервер загружен большую часть времени, вы платите за вычисления по фиксированной ставке, а не по счётчику токенов, который у облачных провайдеров как правило дороже в пересчёте на единицу вычислений при постоянной высокой нагрузке.

Практические ориентиры, когда стоит считать точку окупаемости всерьёз:

  • у вас стабильный поток запросов, а не редкие всплески — сервис используется постоянно, а не «включается по случаю»;
  • вы можете прогнозировать объём нагрузки хотя бы на пару месяцев вперёд, чтобы не переплатить за простаивающую мощность;
  • чувствительность к приватности данных требует, чтобы запросы не покидали периметр — это отдельный довод в пользу локального инференса, не связанный со стоимостью напрямую;
  • вам нужна модель, которой в принципе нет в облачных API (дообученная под вашу задачу, редкая архитектура, специфичный язык).

Расчёт точки окупаемости между постоянной арендой и оплатой по факту разобран подробнее в статье точка окупаемости GPU-сервера против аренды — там же обсуждается промежуточный вариант: аренда GPU по часам без постоянного контракта, который частично снимает проблему низкой утилизации, не давая при этом полной свободы от инфраструктурных забот.

Честный вывод: локальный ИИ — не бесплатный, а имеет другую структуру расходов. Вместо переменной оплаты за использование вы получаете фиксированную стоимость, не зависящую от объёма трафика. Это выгодно при высокой постоянной загрузке и невыгодно при низкой — и ни то ни другое не является магическим освобождением от затрат, просто разные способы платить за одни и те же вычисления.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть ИИ на сервере

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Частые вопросы

Если модель open-source и я плачу только за аренду сервера, разве это не дешевле облачного API по определению?

Нет — сравнивать нужно не «бесплатная модель» с «платный токен», а полную стоимость владения (аренда + время администратора + электричество, если железо своё) с ценой за токен у конкретного провайдера при вашем реальном объёме трафика. При низкой утилизации аренда может проиграть.

Можно ли вообще не платить, если использовать модель на собственном ноутбуке без сервера?

Формально да, если модель помещается в память вашего устройства и вас устраивает скорость. Но это не «производственный» вариант — при параллельных запросах, необходимости держать сервис доступным 24/7 или работе с моделями крупнее нескольких миллиардов параметров ноутбук перестаёт справляться, и вы всё равно приходите к отдельному серверу.

Как понять, выгоднее ли мне локальный вариант, не считая всё вручную с нуля?

Начните с оценки среднего числа запросов в день и сравните эффективную стоимость запроса при вашей реальной утилизации с прайсом облачного API — методика в статье про стоимость одного запроса к вашей LLM поможет получить конкретную цифру, а не приблизительное ощущение.

Аренда GPU по часам решает проблему простоя?

Частично — вы платите только за часы фактического использования, а не за постоянный месячный контракт, что снижает риск переплаты при низкой и нерегулярной нагрузке. Но такая аренда обычно дороже за час вычислений, чем долгосрочный контракт, и требует своей логики автоматического старта/остановки сервера.

А как же электричество — оно правда значимо?

При аренде сервера в дата-центре электричество уже включено в цену аренды и отдельно не считается. Оно становится заметной статьёй расходов только если физическая видеокарта стоит у вас — тогда её стоит учитывать наравне с временем администратора, а не игнорировать как несущественную мелочь.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →