MAATRIX / Блог / Выбор GPU-сервера с несколькими видеокартами

Выбор GPU-сервера с несколькими видеокартами

Выбор GPU-сервера с несколькими видеокартами

MAATRIX

Одной видеокарты хватает не всегда: большая модель не влезает в память, обучение тянется сутками, а инференс упирается в пропускную способность. Выбор GPU-сервера с несколькими видеокартами решает эти задачи — но только если карты соединены правильно, а питание и охлаждение выдерживают полную нагрузку. Разберём, сколько карт брать, как они должны общаться между собой и на что смотреть, чтобы не переплатить за простаивающее железо.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Зачем вообще несколько видеокарт

Причин ставить в сервер две и более карты по сути три, и они не равнозначны.

  • Модель не помещается в одну карту. LLM на 70B в fp16 требует около 140 ГБ памяти — это несколько карт, объединённых в общий пул VRAM. Здесь multi-GPU не роскошь, а единственный способ вообще запустить модель.
  • Нужно ускорить обучение. Данные разбиваются между картами, каждая считает свою часть батча, градиенты синхронизируются. Две карты дают почти двукратный прирост, если нет узкого места в связи.
  • Много параллельных задач. Инференс-сервис обслуживает запросы на нескольких картах одновременно, каждая держит свою копию модели.

Важно честно определить свой случай. Если вам просто нужно быстрее обучать модель, помещающуюся в 24 ГБ, — иногда дешевле взять одну более мощную карту, чем две средних. Multi-GPU оправдан, когда либо не хватает памяти, либо линейно масштабируется вычисление.

NVLink против обычного PCIe

Ключевой вопрос многокарточного сервера — как карты обмениваются данными. От этого зависит, получите вы почти двукратный прирост или упрётесь в шину.

  • PCIe. Карты общаются через материнскую плату. Пропускная способность PCIe 4.0 x16 — около 32 ГБ/с. Для инференса и задач, где карты почти не переговариваются, этого достаточно.
  • NVLink. Прямой мост между картами со скоростью в сотни ГБ/с. Критичен для обучения, где градиенты синхронизируются каждый шаг. Разница между NVLink и PCIe на распределённом обучении бывает кратной.

Правило простое: если планируете обучать модели, где карты постоянно обмениваются данными, — ищите конфигурацию с NVLink (A100, H100, некоторые A6000). Для инференса и независимых задач хватает PCIe, и это заметно дешевле.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер

Сколько карт брать

Число карт диктует не амбиция, а память модели и тип нагрузки. Ориентир для планирования:

ЗадачаКартПример конфигурации
Инференс LLM 7–13B, SD1RTX 4090 24 ГБ
Инференс 30–70B, дообучение22× A6000 48 ГБ или 2× A100
Обучение средних моделей44× A100 40/80 ГБ + NVLink
Крупные модели, продакшн88× A100/H100 в одном узле

Не берите больше карт «про запас». Восемь GPU в узле требуют дорогого шасси, мощного питания и продуманного охлаждения, а если ваша нагрузка их не загружает — вы платите за простой. Наращивать проще снизу вверх: начать с двух карт и добавить, когда упрётесь в потолок.

Питание и охлаждение — где ломаются самосборы

Именно на этом чаще всего спотыкаются те, кто собирает multi-GPU сервер сам. Каждая топовая карта под нагрузкой ест 300–450 Вт. Четыре карты — это 1,5–2 кВт только на GPU, плюс процессор, диски и накладные расходы.

  • Блок питания должен иметь запас: суммарное потребление под пиком не должно превышать 80% номинала БП. Для четырёх карт это киловаттные серверные блоки с резервированием.
  • Охлаждение. Игровые карты с «тихими» вентиляторами в плотном корпусе перегреваются и троттлят. В серверных шасси ставят карты с турбинным (blower) охлаждением или пассивные под общий продув корпуса.
  • Питающая линия. Стойка в дата-центре имеет лимит по мощности на юнит. 8-GPU узел может не влезть в бюджет обычной стойки.

Отсюда практический вывод: многокарточная сборка — это инженерия питания и теплоотвода, а не просто «вставить карты». Готовый GPU-сервер у провайдера снимает эту головную боль: питание, охлаждение и совместимость уже просчитаны.

Ещё один недооценённый фактор — материнская плата и линии PCIe. Чтобы каждая карта получила полноценные x16, нужны процессор и чипсет с достаточным числом линий, иначе часть карт работает на урезанной скорости шины. На потребительских платформах линий PCIe попросту не хватает на четыре полноскоростные карты, и это всплывает уже после сборки, когда обучение идёт медленнее ожидаемого. Серверные платформы проектируются именно под многокарточную плотность, поэтому готовый узел избавляет от неприятного сюрприза с урезанными линиями.

Параллелизм: как модель делится между картами

Чтобы несколько карт работали как одно целое, нагрузку распределяют одним из способов. Их полезно понимать, выбирая железо.

  • Data parallelism. Каждая карта держит полную копию модели и обрабатывает свою часть батча. Просто, хорошо масштабируется, но модель должна влезать в одну карту.
  • Tensor parallelism. Слои модели разрезаются между картами. Позволяет запускать модели, не помещающиеся в одну VRAM. Требует быстрой связи — тут NVLink критичен.
  • Pipeline parallelism. Модель делится на стадии, каждая стадия на своей карте, данные текут по конвейеру. Хорош для очень глубоких моделей.

На практике фреймворки (DeepSpeed, Megatron, vLLM, Accelerate) комбинируют подходы. Для вас как заказчика вывод такой: под tensor/pipeline parallelism нужна связка карт с быстрым интерконнектом, под data parallelism хватит и PCIe.

Локация и оплата

Локацию под многокарточный сервер выбирайте по задаче. Для доступа к внешним репозиториям моделей, датасетам и API удобны зарубежные узлы — США дают самый широкий доступ к AI-экосистеме, Великобритания — низкий пинг до Европы и GDPR-соседство. Если данные должны оставаться в российском правовом поле — берите узел в РФ.

MAATRIX даёт GPU-серверы во всех трёх локациях с оплатой из России картой, СБП, криптовалютой или токеном MAAT. Начать можно с двухкарточной конфигурации и масштабироваться, когда нагрузка вырастет, — не переплачивая за восемь карт с первого дня.

Чек-лист перед заказом

Сведём выбор в короткий список, по которому стоит пройтись перед оплатой.

  • Определите, что именно упирается: память модели или скорость вычисления. От этого зависит число карт и нужда в NVLink.
  • Посчитайте требуемую VRAM: суммарная память карт должна с запасом покрывать модель плюс активации и оптимизатор.
  • Под обучение с частой синхронизацией берите NVLink; под инференс и независимые задачи — PCIe.
  • Проверьте, что конфигурация имеет запас по питанию и адекватное охлаждение — на готовом сервере это ответственность провайдера.
  • Не берите карт больше, чем реально загрузите: простаивающий GPU — это оплаченный, но не работающий ресурс.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Частые вопросы

Две карты дадут ровно двукратный прирост?

На хорошо параллелящихся задачах — почти да, если связь не узкое место. На обучении с частой синхронизацией без NVLink прирост меньше из-за накладных расходов на обмен градиентами.

Обязателен ли NVLink?

Нет. Для инференса и независимых задач достаточно PCIe. NVLink важен для распределённого обучения и tensor parallelism, где карты постоянно обмениваются данными.

Можно ли смешивать разные модели карт?

Технически иногда да, но на практике не стоит: разная память и скорость приводят к тому, что система работает по самой слабой карте, а часть фреймворков этого не любит. Берите однотипные GPU.

Как оплатить многокарточный сервер из России?

Картой РФ, по СБП, криптовалютой или токеном MAAT. Зарубежный счёт или иностранная карта не нужны.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.