MAATRIX / Блог / Как поднять локальный запуск LLM через Ollama на сервере

Как поднять локальный запуск LLM через Ollama на сервере

Как поднять локальный запуск LLM через Ollama на сервере

MAATRIX

Своя языковая модель на собственном сервере — это приватность, отсутствие лимитов и оплаты за токены, а ещё независимость от блокировок. Локальный запуск LLM через Ollama на сервере — самый простой способ прийти к этому: один инструмент ставит и модель, и удобный API за пару команд. Разберём по шагам установку, выбор модели под ваше железо, честные требования к GPU и VRAM и то, как открыть доступ к модели для приложений.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Почему именно Ollama

Ollama берёт на себя всю рутину, которая обычно отпугивает от локальных моделей. Он сам скачивает модель в оптимизированном квантованном формате, подбирает параметры под ваше железо, поднимает локальный API и умеет держать несколько моделей, переключаясь между ними по запросу. Вам не нужно вручную возиться с весами, токенизаторами и зависимостями — всё работает из коробки.

Второе преимущество — совместимость. Ollama отдаёт ответы по протоколу, близкому к OpenAI API, поэтому к нему легко подключаются готовые интерфейсы, боты и библиотеки. Вы поднимаете модель один раз, а дальше используете её из любого приложения так же, как облачные сервисы, только без оплаты за токены и без утечки данных наружу.

Честно назовём и рамки: Ollama отлично подходит для запуска готовых моделей и инференса, но это не инструмент для обучения своих моделей с нуля. Для дообучения и тонкой настройки существуют отдельные фреймворки. Зато для задачи «поднять рабочую LLM и обращаться к ней» лучшего старта не найти.

Что нужно от сервера: GPU и память

Главный вопрос — нужен ли GPU. Ответ честный: для комфортной скорости — да, а для экспериментов и небольших моделей можно обойтись мощным CPU, просто медленнее. Скорость генерации на видеокарте в разы выше, потому что модель целиком лежит в быстрой видеопамяти.

Ключевой параметр — объём VRAM, он определяет, какая модель поместится. Ориентиры для квантованных в 4 бита моделей: 7–8B параметров требуют примерно 5–6 ГБ VRAM, 13–14B — около 10 ГБ, 32–34B — порядка 20–24 ГБ, а тяжёлые 70B — от 40 ГБ и выше. Соответственно, видеокарта уровня 8–12 ГБ комфортно тянет модели до 13B, 24 ГБ открывают 32B, а для 70B нужна либо очень большая карта, либо две.

На CPU модели тоже запускаются, если хватает обычной оперативной памяти: 7B в 4-битном квантовании требует около 8 ГБ RAM. Скорость будет порядка нескольких токенов в секунду — терпимо для единичных запросов и тестов, но некомфортно для интерактивного чата. Поэтому под реальную рабочую нагрузку берут GPU-сервер. У MAATRIX GPU-сервер можно арендовать с оплатой из России картой, СБП или криптой — удобно, когда зарубежные платежи недоступны, а видеокарта нужна здесь и сейчас.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер

Установка Ollama

Установка предельно проста и на чистом Linux-сервере занимает минуту:

curl -fsSL https://ollama.com/install.sh | sh

Скрипт сам определит наличие видеокарты NVIDIA и подтянет нужную поддержку CUDA, если драйверы установлены. Убедитесь заранее, что драйвер стоит и карта видна:

nvidia-smi

Эта команда покажет модель видеокарты, объём VRAM и текущую загрузку. Если карта отображается — Ollama задействует её автоматически. Если GPU нет, инструмент спокойно запустится на процессоре, просто модель будет считаться медленнее. После установки сервис Ollama уже работает в фоне и слушает локальный порт 11434, готовый принимать запросы.

Запуск первой модели

Скачать и сразу пообщаться с моделью — одна команда. Ollama загрузит веса при первом обращении и запомнит их для следующих запусков:

ollama run llama3.1

Для русского языка и универсальных задач хорошо показывают себя современные модели среднего размера — они дают качественные ответы и помещаются в скромную видеопамять. Начните с модели на 7–8B: она быстрая, нетребовательная и покрывает большинство задач — от ответов на вопросы до обработки текста. Если качества не хватает и позволяет железо, поднимитесь до 13B или 32B.

Управление моделями тоже простое: ollama list покажет скачанные модели, ollama pull имя заранее загрузит нужную, ollama rm имя освободит место. Модели весят от нескольких гигабайт, поэтому заложите на диск запас — под несколько моделей комфортно иметь 50 ГБ и больше. Экспериментируйте: переключение между моделями бесплатно и мгновенно.

Доступ по API и интеграция

Локальная модель ценна тем, что к ней можно подключить приложения. Ollama отдаёт HTTP API, к которому обращаются и скрипты, и готовые интерфейсы. Простейший запрос выглядит так:

curl http://localhost:11434/api/generate -d '{"model":"llama3.1","prompt":"Привет!"}'

По умолчанию сервис слушает только localhost — это безопасно, но не даёт обратиться к модели с других машин. Чтобы открыть доступ по сети, задайте переменную окружения OLLAMA_HOST=0.0.0.0 для сервиса и обязательно закройте порт фаерволом, оставив доступ только доверенным адресам, либо спрячьте API за обратным прокси с авторизацией. Открытый в интернет без защиты порт модели — приглашение чужим потреблять ваши ресурсы. Поверх API удобно поставить веб-интерфейс вроде Open WebUI, и тогда вы получите свой приватный аналог ChatGPT с историей чатов и выбором моделей.

Обслуживание и оптимизация

Чтобы сервер с моделью работал стабильно, следите за несколькими вещами. Во-первых, за температурой и загрузкой GPU через nvidia-smi — под долгой нагрузкой карта греется, и важно, чтобы охлаждение справлялось. Во-вторых, за памятью: если модель не помещается в VRAM целиком, часть уходит в оперативную память или на процессор, и скорость резко падает — это сигнал взять модель поменьше или карту побольше.

Оптимизируйте под задачу. Для интерактивного чата важна скорость отклика — берите модель, которая целиком влезает в VRAM. Для пакетной обработки текстов скорость единичного ответа менее критична, зато можно взять модель покрупнее ради качества. Квантование — ваш друг: 4-битные версии почти не теряют в качестве по сравнению с полными, но занимают в разы меньше памяти.

Держите Ollama и модели в актуальном состоянии — выходят новые, более сильные версии при тех же требованиях к железу. И оформите запуск как системный сервис с автостартом, чтобы модель поднималась после перезагрузки сервера сама. Когда захотите нарастить возможности — перейти на модель покрупнее или добавить вторую видеокарту, — сделать это у MAATRIX можно из панели с привычной оплатой из России, без переезда на новую площадку.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.

Арендовать GPU-сервер

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Частые вопросы

Нужен ли GPU для запуска LLM через Ollama?

Для комфортной скорости — да. На мощном CPU модели до 7B тоже работают при 8–16 ГБ RAM, но со скоростью в несколько токенов в секунду, что подходит для тестов, а не для интерактивного чата.

Сколько VRAM нужно под модель?

Для 4-битных версий: 7–8B — около 5–6 ГБ, 13B — порядка 10 ГБ, 32B — 20–24 ГБ, 70B — от 40 ГБ. Объём видеопамяти напрямую определяет доступный размер модели.

Можно ли обращаться к модели из приложений?

Да, Ollama отдаёт HTTP API, совместимый по духу с OpenAI. Откройте доступ через переменную OLLAMA_HOST, закрыв порт фаерволом или спрятав за прокси с авторизацией.

Как оплатить GPU-сервер из России?

У MAATRIX доступна оплата картой российского банка, по СБП, криптовалютой и токеном MAAT, зарубежная карта не требуется.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.