MAATRIX / Блог / Генерация контента ИИ на своём VPS

Генерация контента ИИ на своём VPS

Генерация контента ИИ на своём сервере: VPS-пайплайн
Блог MAATRIX · 2026-07-07

Когда контента нужно много — статьи, описания товаров, посты — ручная работа в чат-интерфейсе не масштабируется. Поставим генерацию на поток на своём VPS: пакетно, по расписанию, под вашим контролем.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Почему пакетная генерация просит свой сервер

Разовый текст удобно писать в чате. Но сотни описаний товаров или регулярные посты — это скрипты, очереди и расписание, которым нужен постоянно работающий сервер.

  • Пакетность — генерация по списку тем за один прогон
  • Расписание — cron запускает генерацию ночью
  • Стоимость — локальная модель без оплаты за токены

На локальной модели важен быстрый диск и сильный CPU — AMD EPYC + NVMe у MAATRIX ускоряют и загрузку модели, и запись результатов пачками.

Экономика на объёме — главный аргумент за свой сервер. Внешний API берёт плату за каждый токен, и на тысячах карточек товаров счёт растёт линейно. Локальная модель на VPS стоит фиксированную аренду вне зависимости от того, сгенерировали вы сто текстов или десять тысяч. Плюс никаких лимитов запросов в минуту и внешних сбоев: пайплайн полностью в вашей власти и работает столько, сколько нужно.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.

Арендовать VPS для генерации контента

Настройка сервера и модели

Для генерации текста комфортна модель 7-8B на 16 ГБ RAM. Поднимаем Ollama:

curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
python3 -m venv ~/venv && source ~/venv/bin/activate
pip install openai jinja2

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Скрипт пакетной генерации

Читаем список тем из файла и генерируем текст по шаблонному промпту:

import json
from openai import OpenAI
ai = OpenAI(api_key="x", base_url="http://127.0.0.1:11434/v1")

PROMPT = "Напиши SEO-описание товара '{item}' на 600 знаков."
results = []
for item in open("items.txt"):
    item = item.strip()
    r = ai.chat.completions.create(model="qwen2.5:7b",
        messages=[{"role": "user", "content": PROMPT.format(item=item)}])
    results.append({"item": item, "text": r.choices[0].message.content})
json.dump(results, open("out.json", "w"), ensure_ascii=False, indent=2)

Шаблон промпта выносите в отдельный файл — так удобно менять стиль без правки кода. Скрипт умышленно сохраняет промежуточный результат в JSON: если генерация оборвётся на середине списка, вы не потеряете уже готовые тексты. Для продакшена стоит добавить проверку, что тема ещё не обработана, — тогда повторный запуск дописывает только недостающее, а не гоняет всё заново.

Очередь и параллелизм

Чтобы не ждать генерацию последовательно, используйте очередь. Для локальной модели параллелизм ограничен CPU, поэтому 2-4 воркера — разумный максимум на среднем тарифе.

from concurrent.futures import ThreadPoolExecutor
with ThreadPoolExecutor(max_workers=3) as ex:
    out = list(ex.map(generate, items))

Не ставьте воркеров больше, чем ядер — иначе генерация замедлится из-за конкуренции за CPU. С внешним API картина обратная: там узкое место не ваш процессор, а лимиты провайдера, поэтому число параллельных запросов упирается в rate limit, а не в железо. На локальной же модели именно количество и мощность ядер определяют пропускную способность, и здесь производительность на ядро у EPYC-платформы MAATRIX даёт ощутимую разницу на больших прогонах.

Автозапуск по расписанию

Регулярную генерацию вешаем на cron. Например, каждую ночь в 3:00:

crontab -e
# добавить строку:
0 3 * * * /home/user/venv/bin/python /home/user/gen.py >> /home/user/gen.log 2>&1

Логи в отдельный файл помогают отследить, сколько текстов сгенерировано и где были ошибки. Типичный рабочий цикл выглядит так: ночью cron прогоняет свежий список тем и складывает черновики, утром человек открывает out.json, вычитывает и публикует одобренное. ИИ берёт на себя объём и скорость, а редактор — качество и ответственность за то, что выходит под именем бренда.

Качество и частые ошибки

  • Шаблонность — варьируйте промпт и температуру, добавляйте факты о товаре в контекст.
  • Обрыв текста — увеличьте max_tokens, проверьте лимит модели.
  • Дубликаты — храните хэши сгенерированного, отсеивайте повторы.
  • OOM при параллелизме — уменьшите число воркеров или размер модели.

Финальную вычитку оставляйте за человеком: ИИ ускоряет черновики, но публиковать без проверки рискованно.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.

Арендовать VPS для генерации контента

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Частые вопросы

Локальная модель или API для генерации?

На больших объёмах локальная выгоднее — платите за аренду VPS, а не за токены. API удобнее для эпизодических задач.

Какой тариф нужен?

Для модели 7-8B ориентируйтесь на 16 ГБ RAM. Быстрый NVMe у MAATRIX ускоряет пакетную запись.

Можно ли генерировать по расписанию?

Да, через cron: скрипт запускается ночью и складывает готовые тексты в файл или базу.

Нужна ли вычитка текстов?

Да. ИИ хорош для черновиков, но перед публикацией тексты стоит проверять на факты и стиль.

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.