MAATRIX / Блог / GPU-сервер в США под несколько пользователей

GPU-сервер в США под несколько пользователей

GPU-сервер в США под несколько пользователей

MAATRIX

Держать по видеокарте на каждого сотрудника дорого и неудобно. Гораздо разумнее взять один GPU-сервер в США под несколько пользователей: команда разработчиков, аналитиков или дизайнеров работает с моделями через общий бэкенд, а вы платите за одно железо вместо пяти. Ниже — как рассчитать конфигурацию, поднять Ollama и разграничить доступ, чтобы люди не мешали друг другу.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Зачем один GPU-сервер на всю команду

Локальные модели — Llama, Qwen, Mistral, DeepSeek — прекрасно работают на одной хорошей видеокарте. Но покупать RTX 4090 каждому программисту нет смысла: карта простаивает 90% времени, а обновлять парк железа больно. Общий сервер решает это иначе.

Модель загружается в видеопамять один раз и обслуживает запросы всех пользователей по очереди. Пока один человек читает ответ, GPU уже считает запрос второго. При типичной офисной нагрузке — несколько запросов в минуту на человека — одна карта спокойно тянет команду из 5–15 человек. Вы получаете предсказуемый ежемесячный платёж вместо капитальных затрат и возни с драйверами на десятке машин.

Второй плюс — контроль. Данные не уходят в облако OpenAI или Anthropic, весь трафик остаётся на вашем сервере. Для команд, работающих с чувствительным кодом или клиентскими данными, это часто решающий аргумент.

Почему именно США

Локация в США даёт три конкретных преимущества для работы с ИИ. Первое — чистый выделенный IP, с которого без ограничений доступны все зарубежные сервисы: если вы совмещаете локальные модели с обращениями к облачным API (OpenAI, Claude, Gemini), запросы уходят напрямую, без блокировок и капчи.

Второе — доступность мощного GPU-железа. Американские дата-центры первыми получают свежие видеокарты, и выбор конфигураций там шире. Третье — стабильные каналы: если пользователи распределены по разным странам, США оказываются удобной нейтральной точкой с хорошей связностью до Европы и Азии.

Для команды внутри России стоит честно учесть пинг: до восточного побережья США это обычно 100–130 мс. Для чат-интерфейса и генерации кода задержка незаметна — ответ всё равно печатается потоком. Если же нужен минимальный отклик для интерактивных инструментов, рассмотрите европейскую локацию, но по охвату и цене на GPU США выигрывают.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер в США

Сколько видеопамяти нужно

Ключевой параметр GPU-сервера — объём VRAM. Именно он определяет, какую модель вы загрузите и скольким людям её хватит. Число пользователей влияет слабее, чем принято думать: модель в памяти одна, а параллельные запросы съедают лишь немного дополнительной памяти под контекст.

Ориентир по видеопамяти под разные модели (квантизация Q4):

МодельНужно VRAMУровень задач
7–8B (Llama 3.1 8B, Qwen 7B)6–8 ГБЧат, черновики, простой код
13–14B10–12 ГБУверенный код, анализ текста
32–34B20–24 ГБСложные задачи, ревью, RAG
70B40–48 ГБМаксимальное качество

На практике под команду до 15 человек хватает одной карты класса RTX 4090 (24 ГБ) с моделью 14–32B. Каждый одновременный запрос добавляет примерно 0,5–2 ГБ под контекст, поэтому запас в несколько гигабайт закладывайте сразу. Если пользователей больше или нужны параллельные тяжёлые сессии — берите 48 ГБ (RTX A6000, L40S) либо две карты.

Ollama как общий бэкенд

Самый простой способ отдать модель команде — Ollama. Он ставится одной строкой, сам управляет загрузкой в VRAM и держит очередь запросов. Установка на сервере с драйверами NVIDIA:

curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:14b
ollama run qwen2.5:14b "Проверка: ответь одним словом"

По умолчанию Ollama слушает только localhost. Чтобы к нему обращались пользователи по сети, откройте его на всех интерфейсах — задайте переменную окружения и перезапустите сервис:

sudo systemctl edit ollama
# в редакторе добавьте:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_NUM_PARALLEL=4"
sudo systemctl daemon-reload
sudo systemctl restart ollama

Параметр OLLAMA_NUM_PARALLEL задаёт, сколько запросов обрабатывается одновременно — поднимайте его под размер команды, следя за свободной VRAM. Ollama даёт OpenAI-совместимый API на порту 11434, поэтому к нему подключаются привычные клиенты: Open WebUI, плагины для VS Code, любые скрипты. Поднимите рядом Open WebUI — и у команды появится удобный веб-чат с авторизацией и историей.

Разделение доступа между пользователями

Открыть порт 11434 в интернет напрямую нельзя — у Ollama нет встроенной аутентификации, и вашим сервером тут же начнут пользоваться посторонние. Правильная схема — закрыть API и пускать людей через контролируемый вход.

Рабочие варианты по возрастанию удобства:

  • Firewall + WireGuard. Порт модели доступен только внутри VPN. Каждый сотрудник получает свой конфиг, посторонних нет. Просто и надёжно.
  • Reverse proxy с ключами. Nginx перед Ollama проверяет токен в заголовке. Разным людям — разные ключи, легко отозвать доступ у уволенного.
  • Open WebUI. Даёт логины-пароли, роли и лимиты из коробки. Пользователи заходят в браузер, ключи API им не нужны вовсе.

Для команды из живых людей проще всего Open WebUI за reverse proxy с HTTPS. Для интеграций и скриптов — отдельные API-ключи через Nginx. Так вы видите, кто и сколько потребляет, и управляете доступом централизованно.

Выбор конфигурации сервера

Собрать сервер стоит вокруг видеокарты, остальное подбирается под неё. Оперативной памяти берите примерно вдвое больше VRAM — она нужна на подгрузку моделей и системные буферы. Диск — NVMe, потому что веса моделей весят десятки гигабайт и грузиться с медленного диска будут долго.

Ориентиры под размер команды:

КомандаGPU / VRAMRAMДиск
до 5 человек16–24 ГБ32 ГБ200 ГБ NVMe
5–15 человек24 ГБ (RTX 4090)64 ГБ500 ГБ NVMe
15+ или тяжёлые модели48 ГБ / 2 карты128 ГБ1 ТБ NVMe

Не переплачивайте за железо на вырост вслепую: начните с конфигурации под текущую команду, а расширяйтесь, когда упрётесь в очередь запросов или в потолок VRAM. GPU-сервер легко масштабировать сменой тарифа, поэтому разумнее стартовать точно под задачу.

Стабильность и безопасность

Чтобы общий сервер служил команде без сюрпризов, настройте несколько вещей сразу. Вход только по SSH-ключу, парольная аутентификация отключена. Фаервол закрывает всё, кроме нужных портов — SSH и вход в веб-интерфейс через HTTPS. Порт Ollama наружу не смотрит никогда.

Настройте автозапуск сервисов после перезагрузки (systemctl enable ollama) и следите за температурой и загрузкой GPU через nvidia-smi. Раз в пару недель проверяйте свободное место на диске — кэш моделей и логи растут незаметно. Обновления безопасности системы включите в автоматическом режиме. Этих мер достаточно, чтобы сервер годами обслуживал команду без вашего внимания.

Оплатить сервер в США из России можно без иностранной карты: MAATRIX принимает карты российских банков, СБП, криптовалюту и токен MAAT. GPU-сервер за рубежом заказывается так же просто, как обычный VPS.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер в США

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Частые вопросы

Сколько пользователей потянет один GPU-сервер?

При офисной нагрузке одна карта на 24 ГБ спокойно обслуживает 5–15 человек: модель в памяти одна, запросы идут по очереди через Ollama.

Нужна ли каждому мощная видеокарта?

Нет, в этом и смысл общего сервера. Видеопамять сервера определяет размер модели, а пользователи делят её без своего GPU.

Как разграничить доступ между людьми?

Закройте API фаерволом и пускайте через WireGuard, reverse proxy с ключами или Open WebUI с логинами — так у каждого свой контролируемый вход.

Как оплатить сервер в США из России?

Картой российского банка, по СБП, криптовалютой или токеном MAAT — иностранная карта не нужна.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.