Сколько стоит держать свой ИИ-сервер в месяц: разбор по конфигурациям
«Сколько стоит свой ИИ-сервер» — вопрос, на который обычно отвечают одной цифрой, а зря: она зависит от класса модели, который вы туда ставите, и почти не зависит от того, сколько людей этой моделью пользуется. Ниже — разбор по трём уровням конфигурации, от лёгкой 1-3B модели для личных задач до 13B+ для рабочей группы, что реально входит в счёт кроме аренды сервера и почему при росте команды именно свой сервер оказывается единственной статьёй расходов, которая не растёт линейно.
Содержание
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Из чего на самом деле складывается счёт
Первое заблуждение — считать, что к цене тарифа надо прибавлять трафик и домен. На практике у большинства хостингов, включая MAATRIX, это не так:
- Трафик обычно включён без лимита. Ollama и веб-интерфейс поверх неё гоняют данные внутри дата-центра между вашим браузером и сервером — это не десятки терабайт, и провайдеры давно перестали считать это отдельной строкой. Уточнить стоит только для совсем нетипичной нагрузки — например, если сервер параллельно раздаёт видео или бэкапы наружу.
- Домен не обязателен. Обращаться к серверу можно по IP или через самоподписанный сертификат в локальной сети. Домен и Let's Encrypt нужны, только если хотите красивый адрес и браузер без предупреждения о сертификате — это отдельная покупка на стороне регистратора, а не часть тарифа сервера.
- Диск под веса моделей — единственная переменная, которая реально зависит от того, что вы делаете. Одна модель в одном кванте почти не заметна на фоне тарифного NVMe, но если экспериментируете с несколькими моделями и квантованиями одновременно, место утекает быстрее, чем кажется.
- Бэкапы — на MAATRIX идут в тариф по умолчанию (ежедневные снапшоты на отдельную ноду), но у других хостингов это может быть отдельной опцией — стоит свериться до заказа, а не после инцидента.
Итог: реальный ежемесячный счёт почти всегда равен цене тарифа сервера плюс ноль. Это отличает свой ИИ-сервер от большинства облачных ИИ-сервисов, где к базовой подписке пристраиваются лимиты, доплаты за превышение и отдельные тарифы за API.
Три уровня конфигурации: обзор
Прежде чем выбирать тариф, полезно увидеть все три уровня рядом — дальше в статье каждый разобран отдельно.
| Уровень | Модели | vCPU | RAM | NVMe | Для кого |
|---|---|---|---|---|---|
| Базовый | 1-3B (qwen2.5:3b, gemma2:2b, phi-4-mini) | 2-4 | 4-8 ГБ | 40-60 ГБ | Один пользователь, личные задачи, черновики |
| Средний | 7-8B (qwen2.5:7b, llama3.1:8b, mistral:7b) | 4-8 | 16 ГБ | 60-100 ГБ | Небольшая команда, рабочий чат-бот |
| Старший | 13B+ (qwen2.5:14b, квантованные 20B+) | 8+ | 32 ГБ | 100+ ГБ | Отдел, несколько параллельных сессий, RAG поверх базы знаний |
Границы между уровнями не жёсткие — плюс-минус один квант модели сдвигает требования в ту или иную сторону. Полная арифметика, откуда берутся эти цифры RAM, разобрана в таблице требований для Ollama: вес файла модели, умноженный на 1,1 под буферы вычислений, плюс KV-кэш под контекст, плюс полтора гигабайта на систему.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaБазовый уровень: под 1-3B модели
Это конфигурация для одного человека, который хочет личного помощника без утечки переписки наружу — черновики писем, суммаризация текста, простые вопросы без глубоких рассуждений. 2-4 vCPU и 4-8 ГБ RAM с запасом закрывают любую модель класса 1-3B в Q4-кванте: qwen2.5:3b весит около 2 ГБ, gemma2:2b — ещё меньше.
Честное ограничение этого уровня — не количество пользователей, а качество ответов. Модели 1-3B хороши в узких, повторяющихся задачах и плохи там, где нужно удерживать длинный контекст или рассуждать в несколько шагов — здесь регулярно выгоднее не наращивать тариф, а признать, что для конкретной задачи локальная модель такого размера не подходит вовсе.
Второй пользователь на этом тарифе технически возможен — Ollama не запрещает параллельные запросы, — но каждый параллельный слот требует своего комплекта KV-кэша поверх весов модели, и на 4-8 ГБ RAM это быстро упирается в память ещё до того, как упрётся в CPU.
Средний уровень: под 7-8B модели
Самый частый выбор для рабочего сценария — свой аналог ChatGPT для команды из нескольких человек, RAG-поиск по документации, ассистент разработчика. 4-8 vCPU и 16 ГБ RAM — уровень, на котором можно поставить qwen2.5:7b, llama3.1:8b или mistral:7b в Q4_K_M (5-5,6 ГБ веса) с запасом под Open WebUI, базу для истории диалогов и один-два параллельных слота.
Разница между 7B и соседними моделями по скорости и качеству не всегда идёт так, как ожидаешь по размеру файла на диске — сравнение моделей и практический выбор между Ollama и альтернативными движками разобраны в статье CPU или GPU для локальной LLM — что выгоднее.
На MAATRIX этому уровню соответствует тариф Heka — около 8 vCPU, 16 ГБ RAM, ориентировочно
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.
Ollama и Open WebUI на этом уровне можно поднять автоматически из каталога приложений при заказе сервера — без ручной установки. Если интересно, что происходит под капотом, — пошаговая установка Ollama на сервере разбирает это по командам.
Старший уровень: под 13B+
Здесь начинается конфигурация под отдел, а не под одного пользователя: несколько человек одновременно, RAG поверх крупной базы знаний, модель классом выше для задач, где качество ответа важнее скорости. 8+ vCPU, 32 ГБ RAM и 100+ ГБ NVMe — тариф, на котором помещается модель 13-14B в Q4 с запасом под несколько параллельных слотов и OLLAMA_MAX_LOADED_MODELS=2, если нужно держать в памяти сразу основную и резервную модель.
Практический предел этого уровня — не память, а скорость генерации на CPU. Модель крупнее 13-14B на чистом CPU уже заметно медленнее в расчёте на пользователя, и если параллельных сессий больше двух-трёх одновременно, дешевле считать не апгрейд RAM, а переход на тариф с видеокартой — там же разбирается, в какой момент аренда GPU по часам выгоднее покупки собственной конфигурации.
Проверить, во что реально упирается сервер под нагрузкой нескольких пользователей — в CPU, память или диск, — можно штатными средствами:
htop
free -h
iostat -x 2
Если iowait в iostat регулярно выше нескольких процентов при активных запросах — узкое место не в модели, а в диске, и решается заменой на NVMe с более высоким IOPS, а не увеличением RAM.
Почему цена своего сервера не растёт от числа пользователей
Это главное отличие от облачных ИИ-подписок, и именно оно чаще всего решает выбор при росте команды. Облачная подписка почти всегда тарифицируется на пользователя: добавили пятого человека в команду — заплатили за пятое место, добавили десятого — за десятое. Рост линейный и не имеет потолка: чем больше людей подключается к сервису, тем выше ежемесячный счёт, без исключений.
Свой сервер устроен иначе. Тариф куплен под конфигурацию — vCPU, RAM, NVMe, — а не под число учётных записей. Пятый и десятый пользователь Open WebUI не добавляют ни цента к счёту за аренду: они добавляют нагрузку на те же ресурсы. Практический потолок — не деньги, а параллельные слоты и скорость генерации: в какой-то момент десятому пользователю придётся ждать очереди, если все ядра заняты чужими запросами. Но это вопрос конфигурации и очереди, а не растущего инвойса.
Отсюда простая логика перехода: пока команда маленькая и облачная подписка на каждого человека дешевле одного тарифа за сервер — выгоднее облако. В момент, когда сумма подписок за всех сотрудников превышает стоимость тарифа, который тянет их совместную нагрузку, — экономика переворачивается в пользу своего сервера, и дальше рост команды её только усиливает, потому что знаменатель (число людей) растёт, а числитель (счёт за сервер) — нет. Точный момент перехода зависит от конкретных цен подписок у вашей команды и от того, какой уровень конфигурации нужен под их нагрузку, — здесь нет универсального числа, но логика одна и та же для любого размера команды.
Отдельно стоит учесть неценовые причины, которые смещают решение в пользу своего сервера раньше точки экономической окупаемости: данные не покидают периметр компании, нет риска, что лимиты или условия внешнего сервиса поменяются без предупреждения, и нет зависимости от доступности стороннего API в моменте, когда он нужен больше всего.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaОбсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Частые вопросы
Можно ли начать с базового уровня и потом перейти на средний без потери данных?
Да — модель и её веса живут отдельно от системы, а Open WebUI хранит историю диалогов в своей базе. Перенос сводится к переносу диска или снапшота на тариф с бóльшим объёмом RAM, установка Ollama и моделей не требует настройки с нуля.
Что произойдёт со скоростью ответов, если пользователей станет больше, чем рассчитан тариф?
Запросы встанут в очередь на тех же ядрах — ответ будет приходить медленнее, но сервис не упадёт и счёт не изменится. Если задержка становится неприемлемой регулярно, а не в пиковые минуты, — это сигнал перейти на тариф выше, а не признак, что подход в целом не работает.
Входит ли статический IP в стоимость тарифа?
Обычно да, отдельный внешний IP на сервер — стандартная часть VPS-тарифа, домен и SSL-сертификат — отдельные, необязательные покупки поверх него.
Стоит ли сразу брать старший уровень, если бюджет позволяет?
Не обязательно — переплата за неиспользуемую память и ядра происходит каждый месяц, а не один раз. Разумнее начать с уровня под текущую нагрузку и перейти выше, когда конкретно упрётесь в память или скорость, — переход занимает часы, а не недели.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.