MAATRIX / Блог / Выбор GPU-сервера для инференса LLM

Выбор GPU-сервера для инференса LLM

Выбор GPU-сервера для инференса LLM

MAATRIX

Запустить свою языковую модель — значит арендовать GPU-сервер, и главный вопрос здесь: какая видеокарта и сколько видеопамяти реально нужны. Выбор GPU-сервера для инференса LLM определяется не бюджетом «побольше», а размером модели, которую вы хотите крутить. Разберём по пунктам, сколько VRAM нужно под разные модели, какая карта подойдёт, как не переплатить и на что смотреть, кроме видеопамяти.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Что такое инференс и почему важна VRAM

Инференс — это работа уже обученной модели: она принимает запрос и генерирует ответ. В отличие от обучения, инференс не меняет модель, а лишь прогоняет через неё данные. Для инференса LLM ключевой ресурс — видеопамять, потому что модель должна целиком поместиться в VRAM видеокарты, чтобы работать быстро. Если она не влезает, часть выгружается в оперативную память или на диск, и скорость падает в разы.

Поэтому выбор GPU-сервера начинается с вопроса «какая модель и какого размера мне нужна». Размер модели в параметрах (7B, 13B, 70B) и формат квантования определяют, сколько VRAM она займёт. Квантование — сжатие модели до меньшей точности (обычно 4 бита) — резко уменьшает аппетит почти без потери качества, и именно квантованные версии крутят на практике.

Отсюда логика подбора: определяете нужную модель, смотрите её требования к VRAM, берёте карту с запасом. Всё остальное — процессор, оперативная память сервера — вторично, потому что тяжёлую работу делает GPU. Переплата за лишние ядра при скромной карте бессмысленна, как и попытка запустить крупную модель на карте, куда она не помещается.

Сколько VRAM нужно под разные модели

Дадим конкретные ориентиры для квантованных в 4 бита моделей — именно их обычно запускают. Модель на 7–8B параметров требует примерно 5–6 ГБ VRAM. Модель на 13–14B — около 10 ГБ. Модель на 32–34B — порядка 20–24 ГБ. Тяжёлые 70B — от 40 ГБ и выше. К этим числам добавляйте небольшой запас на контекст: чем длиннее диалог или документ, тем больше памяти уходит дополнительно.

Переведём это в выбор карты. Видеокарта на 8–12 ГБ комфортно тянет модели до 13B — этого хватает для большинства повседневных задач: ответы, помощь с текстами, программирование, чат-боты. 24 ГБ открывают модели уровня 32B, заметно более сильные. Для 70B нужна либо очень большая профессиональная карта, либо две карты, объединяющие память, — это уже серьёзный уровень для требовательных задач.

Модель (4-bit)VRAMКласс карты
7–8B5–6 ГБ8–12 ГБ
13–14B~10 ГБ12–16 ГБ
32–34B20–24 ГБ24 ГБ
70B40+ ГБбольшая карта или две

Практичный совет: для старта и большинства задач карты на 12–24 ГБ достаточно. Гнаться за 70B стоит, только если качества моделей поменьше реально не хватает под вашу задачу.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер

Какая видеокарта подходит

Для инференса LLM нужна видеокарта NVIDIA с поддержкой CUDA — экосистема (Ollama, движки инференса) заточена под неё. Внутри линейки NVIDIA выбор идёт по объёму VRAM и поколению: более свежие поколения быстрее и энергоэффективнее при том же объёме памяти. Но для инференса объём VRAM важнее сырой скорости — сначала модель должна поместиться, а потом уже считаться быстро.

Профессиональные карты с большим объёмом памяти (24 ГБ и выше) удобны тем, что берут крупные модели на одну карту без ухищрений. Потребительские карты дешевле, но ограничены по памяти. Для сервера обычно берут то, что даёт нужный объём VRAM под вашу модель по разумной цене. Два подхода к 70B — одна очень большая карта или две поменьше с объединением памяти — выбираются по доступности и цене.

Не забывайте про скорость генерации как метрику комфорта. На подходящей карте модель отвечает почти мгновенно, выдавая десятки токенов в секунду. Если скорость критична (интерактивный чат, поток запросов), берите карту с запасом производительности, а не только памяти. Для пакетной обработки, где важнее пропускная способность, чем мгновенность, требования мягче.

Проверка и запуск

Определившись с сервером, проверьте, что карта видна и готова. Первая команда на новом GPU-сервере:

nvidia-smi

Она покажет модель видеокарты, объём VRAM, версию драйвера и текущую загрузку. Это ваша точка отсчёта — по объёму памяти вы понимаете, какие модели поместятся. Дальше поднять инференс проще всего через Ollama, который сам управляет загрузкой модели в VRAM:

curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.1

Ollama автоматически задействует видеокарту, если она видна, и подберёт параметры под доступную память. Запустив модель, следите за nvidia-smi под нагрузкой: если VRAM забита под завязку и часть уходит в оперативную память, скорость просядет — это сигнал взять модель поменьше или карту побольше. Так вы на практике убеждаетесь, что конфигурация подобрана верно.

Локация и оплата

Для инференса LLM локация сервера влияет на две вещи: задержку до пользователей и доступ, если модель обращается к внешним сервисам. Если ваши пользователи в России, ближняя локация даст меньший пинг и более отзывчивый сервис. Если инференс — часть конвейера, обращающегося к зарубежным API, разумна зарубежная локация с чистым IP. Для чисто локальной модели, работающей на вашем сервере, географию выбирают по аудитории.

MAATRIX предлагает GPU-серверы в разных локациях — RU, US, UK, — так что вы подбираете географию под задачу: ближе к российским пользователям или за рубежом ради доступа к внешним сервисам. Оплата идёт из России картой, СБП, криптовалютой или токеном MAAT, поэтому аренда мощной видеокарты не упирается в проблему зарубежных платежей.

Важное преимущество аренды перед покупкой — гибкость. Мощная видеокарта стоит дорого, а нужна не всегда в максимальной конфигурации. Арендуя GPU-сервер, вы берёте ровно ту карту, что нужна под текущую модель, и меняете её при изменении задач, не вкладываясь в железо, которое устареет. Начать инференс LLM у MAATRIX можно с карты под вашу модель и нарастить её из панели, когда понадобится модель посильнее.

Как не переплатить: итог

Сведём выбор в практическое правило. Определите нужную модель по качеству под свою задачу, посмотрите её требования к VRAM (7–8B — 5–6 ГБ, 13B — 10 ГБ, 32B — 24 ГБ, 70B — 40+), возьмите карту с этим объёмом плюс небольшой запас на контекст. Не берите 70B, если хватает 13B, — разница в цене велика, а выигрыш в качестве под многие задачи невелик.

Начинайте с разумного минимума под текущую задачу и наращивайте по факту. Карта на 12–24 ГБ закрывает большинство сценариев инференса и не разоряет. Переход на более мощную конфигурацию у нормального провайдера — вопрос смены сервера из панели, а не покупки нового железа. Такой подход бережёт бюджет и даёт именно ту производительность, что нужна вашей модели, без переплаты за простаивающую мощность.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Частые вопросы

Сколько VRAM нужно для инференса LLM?

Для квантованных в 4 бита моделей: 7–8B — 5–6 ГБ, 13B — около 10 ГБ, 32B — 20–24 ГБ, 70B — от 40 ГБ. Добавляйте запас на длину контекста диалога или документа.

Какая карта нужна для инференса?

Видеокарта NVIDIA с поддержкой CUDA. Для инференса объём VRAM важнее сырой скорости: сначала модель должна поместиться в память, а потом уже считаться быстро. 12–24 ГБ закрывают большинство задач.

Аренда или покупка GPU?

Аренда гибче: мощная карта дорога, а нужна не всегда в максимуме. Вы берёте карту под текущую модель и меняете при смене задач, не вкладываясь в железо, которое устареет.

Как оплатить GPU-сервер из России?

У MAATRIX доступна оплата картой российского банка, по СБП, криптовалютой и токеном MAAT, зарубежная карта не требуется.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.