MAATRIX / Блог / text-generation-webui на VPS

text-generation-webui на VPS

text-generation-webui на VPS: установка и запуск
Блог MAATRIX · 2026-07-07

text-generation-webui (oobabooga) — швейцарский нож для локальных LLM: десятки форматов моделей, вкладки для чата и тонкой настройки генерации, встроенный OpenAI-совместимый API. Разбираем установку на сервере.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Чем хорош text-generation-webui

Это веб-интерфейс, который объединяет разные бэкенды инференса под одной крышей и даёт полный контроль над параметрами генерации.

  • Много загрузчиков — llama.cpp (GGUF), Transformers, ExLlamaV2, GPTQ.
  • Тонкая настройка — temperature, top_p, повторные штрафы, шаблоны промптов.
  • OpenAI API — включается расширением.
  • Чат, notebook и режим инструкций в одном окне.

Загрузка и переключение моделей активно бьёт по диску и памяти, поэтому быстрый NVMe заметно ускоряет старт. На VPS MAATRIX (AMD EPYC + NVMe) веса подгружаются ощутимо шустрее, чем на обычных SATA-хранилищах.

Главное отличие от чат-ориентированных интерфейсов — это исследовательский инструмент. Здесь удобно сравнивать модели, подбирать шаблон промпта под конкретную архитектуру, крутить sampling-параметры и сразу видеть, как меняется ответ. Если ты не просто «общаешься с ботом», а подбираешь модель под задачу или отлаживаешь генерацию, text-generation-webui экономит массу времени по сравнению с ручными curl-запросами.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.

Арендовать VPS для text-generation-webui

Установка

Проект ставится скриптом, который сам создаёт окружение и подтягивает зависимости.

sudo apt update && sudo apt -y install git
git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui

На Linux запускаем установочный скрипт (спросит тип железа — CPU или NVIDIA). Он сам создаёт изолированное окружение через Conda и ставит нужные под выбранное железо колёса, так что руками зависимости собирать не придётся.

./start_linux.sh

Первый запуск качает много пакетов и может занять несколько минут — здесь как раз выручает быстрый диск и сеть сервера. После сборки окружение переиспользуется, и последующие старты идут за секунды.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Загружаем модель

Модели кладутся в папку models. Для CPU берём GGUF, для GPU — GPTQ/ExLlama. Скачать можно прямо через встроенный downloader, указав репозиторий на HuggingFace.

python download-model.py TheBloke/Llama-2-7B-Chat-GGUF

После этого модель появляется в выпадающем списке на вкладке Model — выбираешь загрузчик и жмёшь Load. Ключевой момент: загрузчик должен соответствовать формату весов. GGUF грузится через llama.cpp, GPTQ и EXL2 — через ExLlamaV2, а обычные веса HuggingFace — через Transformers. Если перепутать, модель либо не загрузится, либо выдаст мусор. Для CPU-сценария почти всегда берут GGUF с квантом Q4_K_M — компромисс между размером и качеством.

Доступ по сети

По умолчанию интерфейс слушает localhost. Чтобы открыть его на сервере, добавь флаги.

./start_linux.sh --listen --listen-port 7860

Можно включить простую защиту логином-паролем прямо у Gradio.

./start_linux.sh --listen --gradio-auth user:strongpass

Включаем OpenAI API

Расширение отдаёт привычный /v1/chat/completions, и приложение сможет обращаться к модели как к OpenAI.

./start_linux.sh --listen --api --api-port 5000
curl http://SERVER_IP:5000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"messages":[{"role":"user","content":"Привет"}]}'

Так один сервер закрывает сразу два сценария: живой веб-интерфейс для экспериментов и стабильный API для приложений. Модель загружается один раз и держится в памяти, а обращаться к ней можно и через браузер, и через SDK. Настройки sampling, заданные в интерфейсе, применяются и к API-запросам, что удобно при подборе параметров.

Прод и частые ошибки

  • Не выставляй Gradio голым в интернет — минимум gradio-auth, а лучше Nginx + TLS.
  • OOM при загрузке — бери квантованную версию (Q4_K_M для GGUF) или уменьши контекст.
  • Неверный загрузчик — GGUF грузится через llama.cpp, GPTQ через ExLlama/Transformers.
  • Автозапуск — оберни start_linux.sh в systemd-сервис.

Ещё частая ловушка — путаница с параметрами сэмплинга. Слишком высокая temperature превращает ответы в бессвязный поток, а слишком низкая делает их однообразными; проверь также, что выбран правильный шаблон промпта под конкретную модель, иначе она может вести себя странно даже при верных настройках. И следи за свободным местом: коллекция GGUF-моделей быстро занимает десятки гигабайт, поэтому запас на диске лучше закладывать сразу, а неиспользуемые веса — чистить.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.

Арендовать VPS для text-generation-webui

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Частые вопросы

Работает ли на VPS без GPU?

Да, через загрузчик llama.cpp и GGUF-модели. На быстрых CPU небольшие квантованные модели вполне отзывчивы.

Чем отличается от Open WebUI?

text-generation-webui глубже про настройку генерации и разные бэкенды, Open WebUI — про чистый чат-опыт и командную работу.

Есть ли API для приложений?

Да, расширение даёт OpenAI-совместимый эндпоинт на отдельном порту, его можно подключать любым SDK.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.