Сколько стоит держать локальную LLM в месяц
«Сколько стоит локальная LLM в месяц» — вопрос без единого ответа, потому что чаще всего его считают неправильно: сравнивают цену видеокарты с тарифом на глаз или прикидывают «модель же бесплатная». По факту счёт складывается из фиксированной аренды сервера, дисковых гигабайт под веса и точки, где свой сервер обгоняет по деньгам облачный API — а она есть не всегда. Ниже — реальные цифры: сколько токенов в секунду дают разные модели на одном железе, сколько токенов покупает доллар в облаке и как за пять шагов посчитать свою цифру, а не чужую из чужой статьи.
Содержание
- Из чего складывается стоимость локальной LLM
- Модель определяет тариф — но RAM растёт не плавно, а скачками
- За те же деньги: сколько токенов в секунду дают разные модели
- Точка окупаемости: когда свой сервер дешевле облачного API
- Скрытые расходы, которые ломают смету
- Как посчитать свой ежемесячный чек за 5 шагов
- Какой тариф MAATRIX взять под локальную LLM
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Из чего складывается стоимость локальной LLM
Ключевая разница с облачным API не в сумме, а в природе счёта. Облако тарифицирует как счётчик такси — включили, платите за поездку. Локальная модель — как аренда квартиры: платите за адрес целиком, а сколько раз за месяц там ночевали, для суммы не важно.
Реальный ежемесячный счёт складывается из трёх частей:
- Аренда сервера — фиксированная сумма за vCPU, RAM и NVMe, одинаковая что при 10, что при 10 000 запросах в месяц. Это основная статья, и именно она заменяет собой счётчик токенов.
- Диск под веса — при экспериментах с несколькими моделями или квантованиями съедает заметную часть тарифа; разберём отдельно в разделе про скрытые расходы.
- Простой — сервер тарифицируется по часам аренды, а не по часам работы модели. Ночью, пока никто не шлёт запросов, счётчик не останавливается.
Хорошая новость: сама генерация ответа не добавляет ни рубля сверху. Сколько бы токенов модель ни выдала за месяц, счёт за аренду не изменится ни на копейку — в отличие от OpenAI или Anthropic, где каждый токен добавляет строку в инвойс. Плохая новость: вы платите этот фиксированный тариф и за месяц, когда сервис почти не трогали.
Модель определяет тариф — но RAM растёт не плавно, а скачками
Прежде чем считать деньги, нужно знать модель. Грубая формула памяти — вес файла × 1,1 на буферы вычислений, плюс KV-кэш под контекст, плюс 1,5 ГБ на систему; полная арифметика с примерами по классам моделей — в таблице RAM для Ollama.
Для денег важнее другое: тарифы у любого хостинга идут ступенями — 8 → 16 → 32 ГБ, а не плавно по гигабайту. Если по расчёту не хватает 300 МБ до вашего тарифа, вы не доплачиваете за эти 300 МБ — вы переходите на следующую ступень целиком, а это обычно рост счёта в полтора-два раза. Отсюда практическое правило: не берите модель классом выше «на всякий случай». Разница между 7B и 14B в одном квантовании — это не «немного умнее», это весь следующий ценовой уровень.
Если после установки Open WebUI, Postgres и модели эмбеддингов вы упираетесь в те же лишние 300–500 МБ, часто дешевле не прыгать на ступень выше, а срезать num_ctx или взять квант ниже — Q4_K_M вместо Q5_K_M экономит 15–20% веса. Дешевле потерять эти проценты качества, чем платить за тариф, который нужен на 5%.
Развернуть за пару минут
Готовый образ на VPS MAATRIX: NVMe, AMD EPYC, root-доступ. Локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaЗа те же деньги: сколько токенов в секунду дают разные модели
Ядер сверх четырёх для однопоточного чата можно не покупать — это уже разбирали замером на этом стенде (AMD EPYC 9554, 16 vCPU = 8 физических ядер с гипертредами, qwen2.5:7b Q4_K_M, Ollama 0.33.1): генерация выходит на полку на 4 потоках и держится до 16, а на 32 обваливается в двадцать раз — упирается не в CPU, а в пропускную способность памяти. Полный разбор с cgroup, NUMA и Docker — в статье Ollama не использует все ядра CPU. Вывод для тарифа простой: 16 или 32 vCPU ради скорости одного диалога — переплата, важнее объём и скорость памяти, а не число ядер.
А вот что от модели к модели меняется реально — при 16 потоках на том же стенде:
| Модель | Вес в памяти (Q4_K_M) | Скорость генерации |
|---|---|---|
qwen2.5:3b | 2,2 ГБ | 34,1 ток/с |
mistral:7b | 5,0 ГБ | 12,1 ток/с |
qwen2.5:7b | 5,1 ГБ | 7,4 ток/с |
llama3.1:8b | 5,6 ГБ | 12,8 ток/с |
gemma2:9b | уточняйте в ollama show | 8,8 ток/с |
Неочевидная деталь: llama3.1:8b и qwen2.5:7b весят почти одинаково — 5,6 против 5,1 ГБ, разница 10% — а скорость отличается на 70%. Размер файла не единственный параметр, который решает счёт: архитектура и токенизатор двигают токены в секунду не меньше, чем гигабайты. Если задача допускает замену модели, llama3.1:8b и mistral:7b в этом сравнении — более выгодный выбор по скорости на гигабайт памяти, чем qwen2.5:7b.
Цифры сняты на 16 потоках — это ядра тарифа заметно выше минимального. На 4 физических ядрах ждите генерацию на уровне значений при 4–8 потоках из таблицы по ссылке выше: для большинства моделей это те же цифры, там как раз плато, а не пропорциональное падение.
Точка окупаемости: когда свой сервер дешевле облачного API
Здесь и происходит настоящий расчёт «сколько стоит». Возьмём два реальных прайса на момент публикации, лето 2026 года (уточняйте перед расчётом — цены API меняются чаще, чем стоимость аренды сервера): у OpenAI gpt-4o-mini — $0,15 за миллион входных токенов и $0,60 за миллион выходных; у Anthropic Claude Haiku 4.5 —
Развернуть за пару минут
Готовый образ на VPS MAATRIX: NVMe, AMD EPYC, root-доступ. Локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaЗа те же деньги: сколько токенов в секунду дают разные модели
Ядер сверх четырёх для однопоточного чата можно не покупать — это уже разбирали замером на этом стенде (AMD EPYC 9554, 16 vCPU = 8 физических ядер с гипертредами, qwen2.5:7b Q4_K_M, Ollama 0.33.1): генерация выходит на полку на 4 потоках и держится до 16, а на 32 обваливается в двадцать раз — упирается не в CPU, а в пропускную способность памяти. Полный разбор с cgroup, NUMA и Docker — в статье Ollama не использует все ядра CPU. Вывод для тарифа простой: 16 или 32 vCPU ради скорости одного диалога — переплата, важнее объём и скорость памяти, а не число ядер.
А вот что от модели к модели меняется реально — при 16 потоках на том же стенде:
| Модель | Вес в памяти (Q4_K_M) | Скорость генерации |
|---|---|---|
qwen2.5:3b | 2,2 ГБ | 34,1 ток/с |
mistral:7b | 5,0 ГБ | 12,1 ток/с |
qwen2.5:7b | 5,1 ГБ | 7,4 ток/с |
llama3.1:8b | 5,6 ГБ | 12,8 ток/с |
gemma2:9b | уточняйте в ollama show | 8,8 ток/с |
Неочевидная деталь: llama3.1:8b и qwen2.5:7b весят почти одинаково — 5,6 против 5,1 ГБ, разница 10% — а скорость отличается на 70%. Размер файла не единственный параметр, который решает счёт: архитектура и токенизатор двигают токены в секунду не меньше, чем гигабайты. Если задача допускает замену модели, llama3.1:8b и mistral:7b в этом сравнении — более выгодный выбор по скорости на гигабайт памяти, чем qwen2.5:7b.
Цифры сняты на 16 потоках — это ядра тарифа заметно выше минимального. На 4 физических ядрах ждите генерацию на уровне значений при 4–8 потоках из таблицы по ссылке выше: для большинства моделей это те же цифры, там как раз плато, а не пропорциональное падение.
Точка окупаемости: когда свой сервер дешевле облачного API
Здесь и происходит настоящий расчёт «сколько стоит». Возьмём два реальных прайса на момент публикации, лето 2026 года (уточняйте перед расчётом — цены API меняются чаще, чем стоимость аренды сервера): у OpenAI gpt-4o-mini — $0,15 за миллион входных токенов и $0,60 за миллион выходных; у Anthropic Claude Haiku 4.5 — $1 и $5 за миллион соответственно.
Переведём в другую единицу — сколько токенов покупает один доллар облачного бюджета:
| Модель | Вход | Выход |
|---|---|---|
gpt-4o-mini | 6,67 млн ток. | 1,67 млн ток. |
Claude Haiku 4.5 | 1 млн ток. | 200 тыс. ток. |
Возьмите цену своего тарифа в долларах и умножьте на нужную строку — получите объём токенов в месяц, после которого аренда окупает себя против конкретной модели. Ниже этого объёма выгоднее остаться на API: там нет платы за простой.
Пример с реальными ценами на условной нагрузке. Внутренний бот на 300 запросов в день, по 800 токенов на вход и 400 на выход, — это 7,2 млн входных и 3,6 млн выходных токенов в месяц. На gpt-4o-mini это ≈ $3,24 в месяц. На Claude Haiku 4.5 — уже ≈ $25,20: разница почти в восемь раз при одинаковой нагрузке, и это тоже часть ответа на «сколько стоит» — сравнение стоит начинать не «свой сервер против облака», а «какое облако» вообще. При таком объёме ни один арендованный сервер не окупится: нужно на два-три порядка больше запросов, то есть заметный продакшн-трафик, а не один внутренний бот.
Отдельно про кэш. Если в запросах повторяется большой системный промпт или RAG-контекст, кэш-чтение у Anthropic стоит 0,1 от базовой цены входа — для Haiku 4.5 это $0,10 за миллион, и порог окупаемости сдвигается в пользу облака ещё сильнее, чем по грубому расчёту. Считать это точно по своим логам, а не прикидкой, — в разборе стоимости LLM-запросов на своём сервере.
Скрытые расходы, которые ломают смету
Кроме тарифа, в реальный счёт попадают вещи, которые обычно не считают заранее.
Диск под несколько версий одной модели. Ollama хранит веса как блобы в /usr/share/ollama/.ollama/models при установке официальным скриптом, и при сравнении квантований Q4_K_M, Q5_K_M, Q6_K одной модели рядом на диске легко набегает 15–20 ГБ.
ollama list
du -sh /usr/share/ollama/.ollama/models
ollama rm qwen2.5:7b-instruct-q5_K_M
NVMe в тарифах обычно с большим запасом относительно RAM, но при активных экспериментах сразу с несколькими моделями стоит проверять эту цифру, а не считать её бесконечной.
Простаивающая память. По умолчанию Ollama держит модель в памяти 5 минут после последнего запроса (OLLAMA_KEEP_ALIVE, по умолчанию 5m) и выгружает её сама. На счёт за тариф это не влияет — вы платите за ГБ RAM целиком, использует их модель прямо сейчас или нет, — но определяет, останется ли на сервере память под что-то ещё параллельно с LLM.
Скачивание весов. Тег на 5 ГБ — не разовая мелочь, если вы перебираете кванты или модели: каждый ollama pull — это заново все гигабайты по сети, а повторные попытки при обрыве считаются с нуля. Трафик у большинства тарифов не лимитирован, но время на нестабильном канале — тоже расход, просто не в рублях.
Смена модели через полгода. Если выяснится, что модели не хватает для задачи и нужен переход классом крупнее, это не апгрейд диска на лету, а фактически новый тариф — с переносом окружения, Open WebUI, базы и, возможно, локации.
Как посчитать свой ежемесячный чек за 5 шагов
Универсального числа «локальная LLM стоит X в месяц» не существует — оно зависит от модели, объёма и того, с каким облаком сравнивать. Зато есть воспроизводимый порядок расчёта.
- Выберите минимально достаточную модель под качество, которое реально нужно задаче, — не с запасом «на будущее».
- Переведите вес в тариф по формуле из раздела про модель и RAM: вес × 1,1 + KV-кэш + 1,5 ГБ, округление вверх до ближайшей ступени RAM у хостинга.
- Прикиньте нагрузку по ядрам по таблице скорости — хватает ли генерации на число одновременных пользователей, или нужно закладывать параллельные слоты (каждый — свой комплект KV-кэша поверх весов).
- Сравните с точкой окупаемости против облачного API на своих реальных цифрах объёма — токенах в месяц, а не «часто пишем в бота».
- Добавьте разовые расходы — диск под эксперименты и время на перенос, если модель придётся менять.
После пятого шага на руках не абстрактная оценка, а конкретная конфигурация: столько-то ядер, столько-то RAM, такой-то тариф — и обоснование, почему не ступенью выше и не ступенью ниже.
Какой тариф MAATRIX взять под локальную LLM
Разделим на два честных варианта, как и для любой конфигурации под Ollama на CPU.
Минимум: 4 физических ядра, 16 ГБ RAM, 60 ГБ NVMe. Сюда с запасом помещается любая модель из таблицы выше — qwen2.5:7b, mistral:7b, llama3.1:8b весят 5–5,6 ГБ, плюс KV-кэш, плюс система, плюс Open WebUI, если он рядом. Честное ограничение: параллельных слотов мало — это скорее один активный диалог за раз, чем сервис на отдел.
Комфортный вариант: 8 физических ядер, 32 ГБ RAM, 100+ ГБ NVMe. Свободно живёт модель до 9B, плюс несколько квантов рядом для сравнения без спешки, плюс OLLAMA_MAX_LOADED_MODELS=2 без риска упереться в память. Ядра сверх восьми для генерации погоды не делают — эта ступень даёт запас по памяти и параллельным слотам, а не по вычислениям.
Ollama из каталога apps.maatrix.io ставится автоматически при заказе сервера — вставлять команды установки не нужно, работает на Ubuntu и Debian, демон сразу в автозапуске. Доступы — в личном кабинете; дальше только ollama pull с нужным тегом. Разворачивали раньше вручную — вот пошаговая установка Ollama на сервере.
Локация — Лондон. Задержка самой модели от расстояния не зависит: веса лежат локально, наружу запрос не уходит. Важно, откуда вы их качаете и куда идёт трафик сервисов вокруг модели — с британской площадки скачивание идёт на полной скорости канала, плюс низкий пинг до пользователей в ЕС и европейский правовой периметр для рабочих документов. Для персональных данных россиян и требований 152-ФЗ — российская локация; для этой задачи Лондон закрывает большинство остальных сценариев.
Оплата — картой российского банка, по СБП, криптовалютой или токеном MAAT: иностранная карта не нужна, хотя сервер стоит в Великобритании. Точную стоимость тарифа смотрите на странице аренды VPS — она зависит от текущих цен на NVMe, и число, названное здесь сегодня, устареет быстрее, чем формула из раздела про модель и RAM.
Развернуть за пару минут
Готовый образ на VPS MAATRIX: NVMe, AMD EPYC, root-доступ. Локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaПереведём в другую единицу — сколько токенов покупает один доллар облачного бюджета:
| Модель | Вход | Выход |
|---|---|---|
gpt-4o-mini | 6,67 млн ток. | 1,67 млн ток. |
Claude Haiku 4.5 | 1 млн ток. | 200 тыс. ток. |
Возьмите цену своего тарифа в долларах и умножьте на нужную строку — получите объём токенов в месяц, после которого аренда окупает себя против конкретной модели. Ниже этого объёма выгоднее остаться на API: там нет платы за простой.
Пример с реальными ценами на условной нагрузке. Внутренний бот на 300 запросов в день, по 800 токенов на вход и 400 на выход, — это 7,2 млн входных и 3,6 млн выходных токенов в месяц. На gpt-4o-mini это ≈
,24 в месяц. На Claude Haiku 4.5 — уже ≈ Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.
5,20: разница почти в восемь раз при одинаковой нагрузке, и это тоже часть ответа на «сколько стоит» — сравнение стоит начинать не «свой сервер против облака», а «какое облако» вообще. При таком объёме ни один арендованный сервер не окупится: нужно на два-три порядка больше запросов, то есть заметный продакшн-трафик, а не один внутренний бот.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.
Отдельно про кэш. Если в запросах повторяется большой системный промпт или RAG-контекст, кэш-чтение у Anthropic стоит 0,1 от базовой цены входа — для Haiku 4.5 это $0,10 за миллион, и порог окупаемости сдвигается в пользу облака ещё сильнее, чем по грубому расчёту. Считать это точно по своим логам, а не прикидкой, — в разборе стоимости LLM-запросов на своём сервере.
Скрытые расходы, которые ломают смету
Кроме тарифа, в реальный счёт попадают вещи, которые обычно не считают заранее.
Диск под несколько версий одной модели. Ollama хранит веса как блобы в /usr/share/ollama/.ollama/models при установке официальным скриптом, и при сравнении квантований Q4_K_M, Q5_K_M, Q6_K одной модели рядом на диске легко набегает 15–20 ГБ.
ollama list
du -sh /usr/share/ollama/.ollama/models
ollama rm qwen2.5:7b-instruct-q5_K_M
NVMe в тарифах обычно с большим запасом относительно RAM, но при активных экспериментах сразу с несколькими моделями стоит проверять эту цифру, а не считать её бесконечной.
Простаивающая память. По умолчанию Ollama держит модель в памяти 5 минут после последнего запроса (OLLAMA_KEEP_ALIVE, по умолчанию 5m) и выгружает её сама. На счёт за тариф это не влияет — вы платите за ГБ RAM целиком, использует их модель прямо сейчас или нет, — но определяет, останется ли на сервере память под что-то ещё параллельно с LLM.
Скачивание весов. Тег на 5 ГБ — не разовая мелочь, если вы перебираете кванты или модели: каждый ollama pull — это заново все гигабайты по сети, а повторные попытки при обрыве считаются с нуля. Трафик у большинства тарифов не лимитирован, но время на нестабильном канале — тоже расход, просто не в рублях.
Смена модели через полгода. Если выяснится, что модели не хватает для задачи и нужен переход классом крупнее, это не апгрейд диска на лету, а фактически новый тариф — с переносом окружения, Open WebUI, базы и, возможно, локации.
Как посчитать свой ежемесячный чек за 5 шагов
Универсального числа «локальная LLM стоит X в месяц» не существует — оно зависит от модели, объёма и того, с каким облаком сравнивать. Зато есть воспроизводимый порядок расчёта.
- Выберите минимально достаточную модель под качество, которое реально нужно задаче, — не с запасом «на будущее».
- Переведите вес в тариф по формуле из раздела про модель и RAM: вес × 1,1 + KV-кэш + 1,5 ГБ, округление вверх до ближайшей ступени RAM у хостинга.
- Прикиньте нагрузку по ядрам по таблице скорости — хватает ли генерации на число одновременных пользователей, или нужно закладывать параллельные слоты (каждый — свой комплект KV-кэша поверх весов).
- Сравните с точкой окупаемости против облачного API на своих реальных цифрах объёма — токенах в месяц, а не «часто пишем в бота».
- Добавьте разовые расходы — диск под эксперименты и время на перенос, если модель придётся менять.
После пятого шага на руках не абстрактная оценка, а конкретная конфигурация: столько-то ядер, столько-то RAM, такой-то тариф — и обоснование, почему не ступенью выше и не ступенью ниже.
Какой тариф MAATRIX взять под локальную LLM
Разделим на два честных варианта, как и для любой конфигурации под Ollama на CPU.
Минимум: 4 физических ядра, 16 ГБ RAM, 60 ГБ NVMe. Сюда с запасом помещается любая модель из таблицы выше — qwen2.5:7b, mistral:7b, llama3.1:8b весят 5–5,6 ГБ, плюс KV-кэш, плюс система, плюс Open WebUI, если он рядом. Честное ограничение: параллельных слотов мало — это скорее один активный диалог за раз, чем сервис на отдел.
Комфортный вариант: 8 физических ядер, 32 ГБ RAM, 100+ ГБ NVMe. Свободно живёт модель до 9B, плюс несколько квантов рядом для сравнения без спешки, плюс OLLAMA_MAX_LOADED_MODELS=2 без риска упереться в память. Ядра сверх восьми для генерации погоды не делают — эта ступень даёт запас по памяти и параллельным слотам, а не по вычислениям.
Ollama из каталога apps.maatrix.io ставится автоматически при заказе сервера — вставлять команды установки не нужно, работает на Ubuntu и Debian, демон сразу в автозапуске. Доступы — в личном кабинете; дальше только ollama pull с нужным тегом. Разворачивали раньше вручную — вот пошаговая установка Ollama на сервере.
Локация — Лондон. Задержка самой модели от расстояния не зависит: веса лежат локально, наружу запрос не уходит. Важно, откуда вы их качаете и куда идёт трафик сервисов вокруг модели — с британской площадки скачивание идёт на полной скорости канала, плюс низкий пинг до пользователей в ЕС и европейский правовой периметр для рабочих документов. Для персональных данных россиян и требований 152-ФЗ — российская локация; для этой задачи Лондон закрывает большинство остальных сценариев.
Оплата — картой российского банка, по СБП, криптовалютой или токеном MAAT: иностранная карта не нужна, хотя сервер стоит в Великобритании. Точную стоимость тарифа смотрите на странице аренды VPS — она зависит от текущих цен на NVMe, и число, названное здесь сегодня, устареет быстрее, чем формула из раздела про модель и RAM.
Развернуть за пару минут
Готовый образ на VPS MAATRIX: NVMe, AMD EPYC, root-доступ. Локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaОбсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Частые вопросы
Модель бесплатная — почему тогда локальная LLM вообще стоит денег?
Лицензия на веса — да, бесплатна. Деньги берёт не модель, а инфраструктура: аренда сервера с нужным объёмом RAM и NVMe, которая тарифицируется помесячно независимо от того, сколько токенов вы сгенерировали.
Что дешевле в пересчёте на токен — свой сервер или облачный API?
Зависит от объёма. При низкой и нерегулярной нагрузке дешевле API — там нет платы за простой; порог считается по разделу про точку окупаемости, и для многих внутренних сценариев он оказывается на два-три порядка выше реального трафика.
Изменится ли счёт, если модель работает не круглосуточно?
Нет — аренда сервера тарифицируется помесячно, а не по факту использования, в отличие от облачного API. OLLAMA_KEEP_ALIVE освобождает RAM после простоя для других задач на том же сервере, но не уменьшает сумму в счёте; сэкономить можно только переходом на тариф меньше.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.