Энергопотребление ИИ-сервера: счёт за электричество
Вы посчитали стоимость видеокарты, материнской платы и блока питания — и вроде бы сложили честный бюджет на собственный ИИ-сервер. А потом приходит первый счёт за электричество, и цифра не совпадает ни с одной прикидкой из форумов. Дело в том, что при аренде VPS или облачного GPU расход электричества спрятан внутри тарифа — вы платите за час аренды и не думаете о киловаттах. На своём железе это отдельная статья расходов, и посчитать её на глаз почти невозможно: паспортный TDP карты, реальное потребление под нагрузкой и итоговый счёт — это три разных числа.
Содержание
Сколько реально ест видеокарта под инференсом
Первая ошибка при прикидке бюджета — взять цифру TDP с коробки видеокарты и умножить её на 24 часа в сутки. Так вы почти гарантированно переоцените реальный счёт, потому что типичная нагрузка инференса (генерация ответов LLM, обработка изображений, эмбеддинги) редко держит карту на пиковой мощности постоянно — есть паузы между токенами, ожидание следующего запроса, разная загрузка вычислительных блоков в зависимости от размера модели и батча.
Точную цифру для вашей карты не возьмёт ни одна общая статья — она зависит от:
- конкретной модели видеокарты и её ревизии;
- установленного лимита мощности (многие карты позволяют программно ограничить потребление ниже заводского TDP через
nvidia-smi -pl <ватты>или аналог для другого вендора); - типа нагрузки — генерация текста токен за токеном нагружает карту иначе, чем пакетная обработка эмбеддингов;
- версии драйвера и фреймворка инференса (vLLM, llama.cpp, TensorRT-LLM и другие по-разному утилизируют GPU).
Поэтому первый практический шаг — не гадать, а измерить. Если карта на базе NVIDIA, самый быстрый способ посмотреть текущее потребление в моменте:
nvidia-smi --query-gpu=power.draw,power.limit,utilization.gpu --format=csv -l 5
Команда выведет реальную мощность в ваттах, установленный лимит и загрузку GPU каждые 5 секунд. Погоняйте на ней типичный для вас сценарий — не синтетический бенчмарк, а именно ту нагрузку, которая будет у вас каждый день (например, обработку очереди реальных запросов из вашего чат-бота или RAG-пайплайна), и посмотрите на диапазон значений, а не на пиковое число в первую секунду теста.
Для длительного лога вместо разового просмотра удобнее писать значения в файл:
nvidia-smi --query-gpu=timestamp,power.draw,utilization.gpu --format=csv -l 60 >> gpu-power-log.csv
Это даст вам почасовой (или с любым другим интервалом) срез за сутки-двое реальной работы — гораздо более честную основу для расчёта, чем строчка TDP из спецификации. Для карт других производителей ищите аналогичный инструмент мониторинга в официальной документации — методика та же: не полагаться на паспортное значение, а снять показания под своей типичной нагрузкой.
Режим работы решает больше, чем ватты в простое
Второй фактор, который сильнее всего искажает интуитивные прикидки, — это не мощность карты сама по себе, а то, сколько времени она реально работает под нагрузкой в течение суток.
Карта, которая обрабатывает непрерывный поток запросов (например, публичный API с постоянным трафиком или batch-обработку данных ночью), проводит бОльшую часть времени близко к рабочей мощности. Карта, которая отвечает на редкие интерактивные запросы одного-двух сотрудников (типичный сценарий локального ИИ-помощника для небольшой команды), большую часть времени простаивает в режиме ожидания — а простой у современных GPU потребляет заметно меньше, чем активная генерация.
Отсюда ключевая вещь для расчёта: недостаточно знать, что сервер "включён 24 часа в сутки". Нужно понимать реальную долю времени под нагрузкой — то, что иногда называют duty cycle. Два сервера с одинаковой видеокартой могут иметь совершенно разный счёт за электричество просто из-за разного профиля использования:
| Сценарий использования | Характер нагрузки на GPU |
|---|---|
| Личный ИИ-ассистент, несколько запросов в час | Короткие всплески, основное время — простой |
| Внутренний чат-бот отдела, рабочие часы | Нагрузка сосредоточена в 8-10 часов, ночью простой |
| Публичный API-сервис с постоянным трафиком | Нагрузка близка к постоянной весь день |
| Пакетная обработка (эмбеддинги базы знаний) ночью | Пиковая нагрузка несколько часов, остальное время простой |
Если вы не измеряли собственный профиль нагрузки, это стоит сделать до расчёта бюджета, а не после — тем же логированием через nvidia-smi, но за более длительный период (несколько дней, а лучше неделю, чтобы захватить и будни, и выходные).
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть ИИ на сервереСервер потребляет не только видеокартой
Третья частая ошибка — считать электричество только по GPU и забывать про остальной сервер. Видеокарта обычно самый прожорливый компонент, но далеко не единственный:
- Процессор — под инференсом CPU обычно загружен несравнимо меньше GPU, но не равен нулю: он готовит батчи, обслуживает сетевой стек, токенизацию, очередь запросов. Для многопользовательских серверов с несколькими GPU нагрузка на CPU может быть заметнее.
- Оперативная память и системная плата — фоновое потребление, небольшое, но не нулевое, особенно на платах с большим числом слотов PCIe для нескольких карт.
- Охлаждение — вот здесь скрывается реальная статья расходов, которую часто недооценивают. Видеокарта под интенсивным инференсом греется сильно и стабильно, а не короткими пиками, как в играх. Это значит, что кулеры корпуса и/или карты работают дольше на повышенных оборотах, а если сервер стоит не в специально охлаждаемой серверной, а в обычном помещении — добавляется расход на охлаждение самого помещения (кондиционер), который в счёт за "работу ИИ" обычно не попадает, но фактически им порождён.
- Блок питания — важный, но часто игнорируемый нюанс: КПД БП не 100%, и на дешёвых или устаревших блоках часть энергии из розетки уходит в тепло, а не в компоненты. Сертификация 80 PLUS (Bronze/Gold/Platinum и выше) напрямую влияет на то, сколько реально "берёт" сервер из сети сверх того, что потребляют сами компоненты — это стоит проверять в спецификации конкретного блока питания, а не считать все БП одинаковыми.
Практический вывод: измерять стоит потребление сервера целиком из розетки, а не только видеокарты через nvidia-smi. Для этого нужен отдельный измеритель мощности — бытовой ваттметр, включаемый между розеткой и блоком питания сервера (в рознице такие продаются как "измеритель мощности" или "ваттметр в розетку"), либо, если сервер стоит в стойке с управляемым PDU, показания берутся прямо с самого PDU. Если у сервера есть аппаратный BMC/IPMI, часто можно снять показания потребления и через него:
ipmitool sensor | grep -i power
Конкретное имя сенсора и точность показаний зависят от производителя платформы — проверяйте документацию своей материнской платы или сервера.
Методика расчёта: три числа и одна формула
Когда у вас есть данные по факторам выше, расчёт сводится к трём величинам.
(а) Реальное среднее энергопотребление сервера под типичной для вас нагрузкой. Это то, что вы измеряете ваттметром на розетке (не паспортный TDP видеокарты и не сумма TDP всех компонентов "на бумаге"), усреднённое за представительный период — сутки или неделю реальной работы, а не синтетический тест.
(б) Актуальный тариф на электричество в вашем регионе. Здесь важны нюансы: некоторые тарифы дневные/ночные, некоторые зависят от объёма потребления (льготный лимит и повышенный тариф сверх него), для юрлиц тариф обычно отличается от бытового. Берите тариф из вашего актуального счёта или с сайта поставщика — не из статьи в интернете годичной давности.
(в) Ожидаемое реальное время работы под нагрузкой за месяц. Это не "количество часов, когда сервер включён", а количество часов, когда он реально обрабатывает запросы (плюс отдельно — часы простоя с его собственным, более низким, но не нулевым потреблением).
Формула:
Расход в месяц (кВт·ч) =
(Мощность под нагрузкой (Вт) × часы под нагрузкой в месяц
+ Мощность в простое (Вт) × часы простоя в месяц) / 1000
Счёт за электричество = Расход в месяц (кВт·ч) × тариф (руб/кВт·ч)
Подставим условный пример — только для иллюстрации самой методики счёта, а не как прогноз для вашего оборудования:
Допустим (цифры условные, не измеренные):
Мощность под нагрузкой из розетки: 500 Вт
Мощность в простое из розетки: 150 Вт
Часы под нагрузкой в месяц: 150 ч
Часы простоя (сервер включён, но не занят): 570 ч (30 дней × 24 ч − 150 ч)
Тариф: 6 руб/кВт·ч
Расход = (500 × 150 + 150 × 570) / 1000 = (75000 + 85500) / 1000 = 160,5 кВт·ч
Счёт = 160,5 × 6 ≈ 963 руб/мес
Ключевое здесь — не итоговая цифра (у вас она будет другой из-за другой карты, другого профиля нагрузки и другого тарифа), а сама структура расчёта: без реального измерения мощности из розетки под вашей нагрузкой любая оценка бюджета остаётся гаданием.
Своё железо или аренда: честный совокупный расчёт
Когда вы сравниваете покупку собственного GPU-сервера с арендой VPS или облачного GPU, справедливое сравнение включает не только цену самого оборудования и ежемесячный платёж за аренду. На стороне собственного железа в реальную совокупную стоимость (TCO) нужно закладывать:
- стоимость оборудования и его амортизацию за срок службы;
- текущий счёт за электричество, посчитанный по методике выше — а не по паспортному TDP;
- охлаждение помещения, если сервер стоит не в специально подготовленной серверной, а это отдельная статья расходов сверх электричества самого сервера;
- ваше время на администрирование, обновление драйверов, устранение неполадок с железом;
- риск простоя при поломке компонента — время, а иногда и деньги на ремонт или замену.
Экономика этого сравнения сильно зависит от профиля нагрузки, который мы разбирали во втором разделе. При нерегулярной, невысокой нагрузке — вы держите ИИ-сервер "на всякий случай", а реальных часов работы под нагрузкой набирается немного в месяц — аренда часто оказывается экономически выгоднее собственного железа именно за счёт того, что вы не платите за простаивающее оборудование и не несёте эксплуатационные расходы отдельно от совместного использования удалённой инфраструктуры: провайдер размазывает свои расходы на электричество и охлаждение между множеством клиентов, которые вместе занимают GPU почти постоянно.
При стабильно высокой, предсказуемой нагрузке — сервер занят большую часть рабочего времени — картина может смещаться в пользу собственного железа, потому что фиксированные расходы (включая электричество) размазываются на больший объём фактически выполненной работы. Но это стоит проверять на своих цифрах: посчитайте эксплуатационные расходы собственного варианта по методике из этой статьи и сравните с суммой аналогичных по мощности тарифов аренды за тот же период — универсального ответа "своё железо всегда дешевле после N месяцев" не существует, потому что переменная электричества и охлаждения у всех разная.
Если вы сравниваете конкретные цифры аренды, стоит также прочитать аренда против покупки сервера и своя видеокарта против аренды GPU: что выгоднее и когда — там разобраны сценарии по срокам окупаемости отдельно от вопроса электричества. Если задача — прикинуть общий ежемесячный бюджет на собственный ИИ-сервер целиком (не только электричество), пригодится сколько стоит держать свой ИИ-сервер в месяц. А для расчёта TCO на длинном горизонте — выделенный против облака: TCO на три года.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть ИИ на сервереНужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.
Частые вопросы
Можно ли посчитать счёт за электричество без покупки ваттметра, только по спецификации карты?
Приблизительно да, но с оговоркой: спецификация даёт TDP — верхнюю границу, а не реальное потребление под вашей конкретной нагрузкой. Такая прикидка обычно завышает счёт, иногда заметно. Для точной цифры нужен либо реальный замер на розетке, либо хотя бы лог nvidia-smi --query-gpu=power.draw под вашим типичным сценарием — это даст число ближе к правде, чем паспортный TDP.
Программное ограничение мощности карты (power limit) реально экономит электричество?
Да, это рабочий инструмент — nvidia-smi -pl <ватты> позволяет снизить потолок потребления карты ниже заводского значения. На инференсе (в отличие от обучения) снижение лимита часто слабо сказывается на скорости ответа, потому что узкое место — не всегда чистая вычислительная мощность, а зависит от модели и типа нагрузки. Стоит протестировать на своём сценарии, прежде чем закладывать экономию в бюджет.
Стоит ли учитывать охлаждение помещения отдельно от самого сервера?
Да, если сервер стоит не в специально подготовленной серверной с собственной системой охлаждения, а в обычном помещении, где для комфортной температуры нужен кондиционер. Это отдельная статья расходов, которую сервер порождает, но которая не попадёт в показания ваттметра, воткнутого только в блок питания сервера.
Как понять свой профиль нагрузки, если сервер только разворачивается и статистики ещё нет?
Оцените по аналогии с ожидаемым использованием: сколько людей и как часто будут отправлять запросы, есть ли фоновые задачи (индексация базы знаний, батчевая обработка). После первых одной-двух недель реальной работы снимите лог nvidia-smi за несколько дней и пересчитайте бюджет по фактическим цифрам — первоначальная оценка почти всегда требует такой корректировки.
Разница в энергопотреблении между простоем и нагрузкой действительно настолько значима?
Да, и именно поэтому режим работы карты (второй фактор в этой статье) часто важнее для итогового счёта, чем модель самой видеокарты. Сервер с постоянной нагрузкой и сервер с редкими запросами на одинаковом железе могут давать счета, различающиеся в разы — не из-за разного оборудования, а из-за разной доли времени под реальной работой.
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →