GPU-сервер в Великобритании под несколько пользователей
Команде из нескольких человек редко нужен персональный GPU каждому: карты простаивают большую часть суток, а счёт растёт. Один GPU-сервер в Великобритании под несколько пользователей закрывает задачи всей группы — если правильно разделить ресурсы, настроить изоляцию и очередь. Ниже разберём, как это сделать без конфликтов за память и без «сервер занят у Пети до вечера».
Содержание
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Когда общий GPU-сервер выгоднее персональных
Логика простая: видеокарта дорога, а загружена неравномерно. Дата-сайентист гоняет обучение пару часов в день, остальное время карта пустует. Если посадить на один сервер трёх-четырёх человек с непересекающимся графиком, утилизация вырастает в разы, а стоимость на человека падает.
Общий сервер оправдан, когда:
- нагрузки короткие и разнесены по времени (инференс, дообучение, эксперименты);
- команда небольшая — до 5–8 активных пользователей на одну-две карты;
- задачи не требуют монопольного захвата всей памяти на сутки.
Если же у вас двое суток непрерывного обучения на полной VRAM — общий доступ будет мешать, и честнее взять отдельные сервёра или карты. Об этом стоит сказать прямо: шеринг экономит на простое, но не на пиковой нагрузке.
Почему Великобритания как локация
UK — удобная точка для распределённой команды, часть которой в Европе. Пинг до Лондона из большинства стран ЕС держится в пределах 10–30 мс, что важно для интерактивной работы через SSH, Jupyter или удалённый рабочий стол. Британские дата-центры дают предсказуемую сеть и соседство с GDPR-юрисдикцией, если вы обрабатываете персональные данные европейских пользователей.
Для доступа к внешним AI-сервисам и репозиториям моделей (Hugging Face, реестры образов) британский IP работает стабильно и без региональных ограничений, с которыми иногда сталкиваются в других локациях. Оплатить сервер из России можно картой, СБП, криптовалютой или токеном MAAT — иностранная карта не нужна.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Арендовать GPU-сервер в UKТри способа разделить одну видеокарту
Разделение GPU между пользователями решается на нескольких уровнях.
- Тайм-шеринг по расписанию. Самый простой вариант: карта одна, пользователи работают по очереди. Управляется дисциплиной команды или планировщиком. Годится для маленьких групп.
- MPS (Multi-Process Service). NVIDIA MPS позволяет нескольким процессам делить один GPU одновременно с меньшими накладными расходами на переключение контекста. Память при этом общая — за ней нужно следить.
- MIG (Multi-Instance GPU). На картах уровня A100/H100 GPU физически режется на изолированные инстансы со своей памятью и вычислительными блоками. Каждый пользователь получает гарантированный кусок, не мешая соседям.
MIG — самый честный способ «раздать» карту: изоляция аппаратная, сосед не съест вашу VRAM. Но он доступен только на дата-центровых GPU и делит карту на фиксированные профили. Например, A100 на 80 ГБ можно разбить на семь инстансов по 10 ГБ, на три по 20 ГБ или на комбинацию профилей под разные задачи. Каждый инстанс ведёт себя как отдельная маленькая видеокарта: свои вычислительные блоки, своя память, свой лимит.
Практический совет по выбору способа: если команда до трёх человек и бюджет ограничен — начните с тайм-шеринга и договорённости о слотах. Когда людей становится больше и появляются жалобы «карта опять занята» — переходите на MIG-карту либо на вторую видеокарту с MPS. Не стройте сложную схему заранее: чаще всего реальный график работы проще, чем кажется на старте.
Изоляция пользователей на уровне ОС
Разделение железа — половина дела. Вторую половину закрывает изоляция окружений, чтобы пользователи не мешали друг другу файлами, процессами и версиями библиотек.
- Заведите каждому отдельного пользователя ОС и рабочую директорию с квотой на диск.
- Раздавайте GPU через контейнеры: Docker с
--gpusили Kubernetes с device plugin. Внутри контейнера — свой CUDA, свой PyTorch, чужие зависимости не конфликтуют. - Ограничивайте видимость карт переменной
CUDA_VISIBLE_DEVICES, чтобы процесс пользователя видел только выделенный ему GPU или MIG-инстанс.
Пример запуска изолированного окружения на конкретной карте:
docker run --gpus '"device=0"' -it \
--cpus=8 --memory=32g \
-v /home/alice/work:/work \
pytorch/pytorch:latest bash
Так пользователь Alice получает карту 0, 8 ядер и 32 ГБ RAM — и не выйдет за эти рамки.
Очередь задач вместо ручной договорённости
Когда людей больше трёх, «кто первый встал» перестаёт работать. Нужен планировщик, который ставит задачи в очередь и выдаёт GPU по мере освобождения.
- Slurm — классика для вычислительных кластеров: пользователь отправляет job, планировщик выделяет ресурсы и запускает, когда карта свободна.
- Run:ai, Nvidia Base Command — более «продуктовые» решения с квотами и приоритетами.
- Для маленькой команды хватает и простого решения: очередь на базе
ts(task spooler) или самописный скрипт с блокировкой на файл.
Планировщик решает две боли сразу: карты не простаивают (задачи стартуют автоматически) и никто не ждёт вслепую — видно позицию в очереди. Отдельный плюс — воспроизводимость: job описан скриптом, его легко перезапустить и передать коллеге. Для команды это ещё и слой учёта: по логам планировщика видно, кто сколько GPU-часов потратил за неделю, и можно честно распределять затраты между проектами.
Не переусложняйте на старте. Slurm мощный, но требует настройки контроллера и демонов на узлах. Если у вас один сервер и три человека, task spooler или простой скрипт с файловой блокировкой дадут 80% пользы за 20% усилий. Переходить на Slurm имеет смысл, когда серверов становится несколько и появляется потребность в приоритетах и честных квотах.
Квоты, лимиты и мониторинг
Чтобы один пользователь не забрал всё, задайте лимиты и следите за расходом.
- Дисковые квоты на домашние директории и общий кэш моделей.
- Лимиты по RAM и CPU через cgroups или параметры контейнера.
- Приоритеты и лимиты времени job в планировщике.
Мониторинг ведите через nvidia-smi, dcgm-exporter + Prometheus + Grafana. Так вы видите, кто и сколько потребляет, и вовремя ловите зависшие процессы, держащие память. Полезная команда для быстрого среза:
nvidia-smi --query-gpu=index,utilization.gpu,memory.used,memory.total --format=csv
Как подобрать конфигурацию под команду
Отталкивайтесь от числа одновременных пользователей и типа нагрузки. Ориентир по видеокартам:
| GPU | VRAM | Под что подходит команде |
|---|---|---|
| RTX 4090 / 3090 | 24 ГБ | Инференс LLM 7–13B, эксперименты, Stable Diffusion на 2–3 человек по очереди |
| A5000 / A6000 | 24–48 ГБ | Дообучение средних моделей, стабильная многопользовательская работа |
| A100 40/80 ГБ | 40–80 ГБ | MIG-разделение на 2–7 изолированных инстансов, серьёзное обучение |
| H100 | 80 ГБ | Крупные модели, максимальная плотность пользователей через MIG |
Общее правило: для чистого инференса и лёгких экспериментов хватает 24 ГБ и тайм-шеринга. Как только нужна гарантированная изоляция для 4+ человек — берите карту с поддержкой MIG. Под MAATRIX вы можете начать с одной карты и добавить вторую, когда очередь начнёт расти.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Арендовать GPU-сервер в UKОбсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Частые вопросы
Сколько пользователей потянет один GPU-сервер?
Зависит от нагрузки: на лёгком инференсе через MPS/MIG комфортно 4–8 человек, на тяжёлом обучении — по сути один монопольно. Ориентируйтесь на пиковую загрузку, а не на список сотрудников.
Не съест ли сосед мою видеопамять?
При тайм-шеринге и MPS память общая, поэтому нужен мониторинг и дисциплина. MIG даёт аппаратную изоляцию — ваш кусок VRAM недоступен другим.
Нужен ли Kubernetes для нескольких пользователей?
Нет. Для маленькой команды достаточно Docker с --gpus, отдельных пользователей ОС и простой очереди. Kubernetes оправдан, когда пользователей и серверов становится много.
Как оплатить GPU-сервер в Великобритании из России?
Картой российского банка, по СБП, криптовалютой или токеном MAAT. Иностранная карта и зарубежный счёт не требуются.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.