MAATRIX / Блог / Fooocus и InvokeAI: генерация картинок без сложных графов

Fooocus и InvokeAI: генерация картинок без сложных графов

MAATRIX

Если вы открывали ComfyUI и закрывали его через пять минут, потому что вместо картинки увидели десяток разноцветных блоков с проводами — вы не одиноки. Не всем нужен визуальный конструктор пайплайна: части пользователей достаточно ввести промпт и получить результат без изучения внутреннего устройства диффузионной модели. Для этого случая существуют Fooocus и InvokeAI — два инструмента, которые сознательно прячут сложность за привычным интерфейсом «текст → картинка».

Зачем вообще нужна альтернатива нодовым редакторам

Нодовые редакторы вроде ComfyUI дают максимальный контроль: вы вручную собираете граф из блоков — загрузка модели, кодирование текста, семплер, VAE-декодер, апскейлер, ControlNet — и соединяете их проводами. Это мощно, потому что каждый узел графа можно заменить, продублировать или перенастроить под нестандартную задачу. Но у этой мощи есть цена: чтобы собрать рабочий граф, нужно понимать, что делает каждый узел, чем отличается Euler от DPM++ 2M Karras, зачем нужен отдельный VAE и почему без правильного CLIP Skip картинка «поплывёт». Про разницу между ComfyUI и более простым Automatic1111 мы уже разбирали в статье ComfyUI против Automatic1111: что выгоднее и когда — там же честно говорится, что порог входа в ComfyUI выше, чем в любой другой SD-интерфейс.

Fooocus и InvokeAI решают ту же задачу — генерацию изображений диффузионными моделями — но с обратной философией: разработчики сами приняли решения за пользователя. Выбор семплера, шагов, CFG-scale, а часто и модели-по-умолчанию уже сделан и спрятан за пресетами. Вы теряете часть гибкости, но получаете интерфейс, в котором результат виден через минуту после установки, а не после часа чтения документации по нодам.

Это не «упрощённая версия ComfyUI» и не конкурент ему в прямом смысле — это инструмент для другой аудитории. Если вы дизайнер, блогер, маркетолог или просто человек, которому нужны картинки для проекта, а не эксперимент с архитектурой диффузионной модели — читайте дальше. Если вам нужен точный контроль над каждым этапом пайплайна (кастомный ControlNet с несколькими масками, сложный inpainting с раздельными сэмплерами для разных областей, пакетная обработка с условной логикой) — вам, вероятно, стоит смотреть в сторону ComfyUI, и статья выше объяснит, почему.

Fooocus: минимум настроек, максимум предсказуемости

Fooocus изначально создавался как ответ на вопрос «как получить картинку уровня Midjourney, не разбираясь в Stable Diffusion». Интерфейс — это, по сути, одно окно: поле для промпта, кнопка генерации и свёрнутая панель дополнительных настроек, куда без особой нужды заглядывать не приходится.

Ключевые особенности Fooocus:

  • Пресеты стилей. Вместо ручной настройки CFG-scale и seed вы выбираете стиль из galleries («Cinematic», «Anime», «Photograph» и десятки других) — под капотом это заранее подобранные модификаторы промпта и параметры сэмплера.
  • Режимы качества. «Quality», «Speed», «Extreme Speed» — переключатель, который меняет число шагов и модель сэмплирования одним кликом, без необходимости понимать, что стоит за этими терминами.
  • Автоматическое расширение промпта. Fooocus умеет дополнять короткий пользовательский запрос деталями через встроенный модуль, чтобы результат был более «насыщенным», даже если вы написали три слова.
  • Встроенный inpainting/outpainting, но без раздельных масок и слоёв — просто кисть поверх картинки и повторная генерация выбранной области.
  • Нет графового режима вообще. В отличие от InvokeAI, у Fooocus нет альтернативного продвинутого интерфейса — это осознанное решение авторов проекта: инструмент должен оставаться простым для всех сценариев использования.

Практический плюс: Fooocus в большинстве случаев работает «из коробки» с моделями формата SDXL, и типичная установка — это git clone репозитория и запуск одного скрипта:

git clone https://github.com/lllyasviel/Fooocus.git
cd Fooocus
python -m venv venv
source venv/bin/activate
pip install -r requirements_versions.txt
python launch.py --listen 0.0.0.0 --port 7865

При первом запуске Fooocus сам скачает базовую модель (обычно вариант SDXL), если вы её не подложили заранее в models/checkpoints/. Для GPU с 6-8 ГБ VRAM режим «Speed» отработает приемлемо; для комфортной работы со «Quality» и апскейлером стоит закладывать от 12 ГБ VRAM — но точные цифры для вашей конкретной модели видеокарты и версии Fooocus лучше проверить на практике, поскольку релизы меняют требования.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть ИИ на сервере

InvokeAI: чуть больше контроля при всё ещё простом интерфейсе

InvokeAI занимает промежуточную позицию между Fooocus и полноценным нодовым редактором — и здесь стоит сделать честную оговорку: у InvokeAI на самом деле есть свой собственный нодовый редактор (Workflow Editor), доступный как отдельный, продвинутый режим. Но это не мешает основному тезису статьи: интерфейс по умолчанию, с которым сталкивается новый пользователь — «Linear»-режим, максимально похожий на привычную генерацию «промпт → картинка», без единого узла на экране. Графовый режим существует, но не навязывается и не обязателен для базового использования.

Что InvokeAI даёт сверх Fooocus:

  • Unified Canvas — холст с поддержкой слоёв для inpainting и outpainting: можно выделять произвольные области, расширять изображение за исходные границы, комбинировать несколько генераций на одном полотне. Это заметно гибче простой кисти в Fooocus, но интерфейс всё ещё remains WYSIWYG, а не граф.
  • Управление моделями и LoRA через UI — подключение чекпоинтов, LoRA, textual inversion и ControlNet-моделей делается через понятные разделы интерфейса, без ручного редактирования JSON-конфигов (хотя конфиги там тоже есть, для тех, кому нужно).
  • Board-система — организация сгенерированных изображений в подборки, с метаданными генерации, привязанными к каждому файлу, что удобно, если вы перебираете десятки вариантов и хотите вернуться к параметрам конкретной удачной картинки.
  • Опциональный Workflow Editor — тот самый графовый режим для тех, кому позже становится тесно в Linear-режиме. Формально это размывает границу «без графов» из заголовка статьи, но по умолчанию и для большинства сценариев InvokeAI используется именно как простой инструмент.

Установка InvokeAI обычно делается через официальный установщик или pip:

python3 -m venv invokeai-venv
source invokeai-venv/bin/activate
pip install InvokeAI --use-pep517
invokeai-configure
invokeai-web

Мастер invokeai-configure при первом запуске спросит, какие модели скачать (можно начать с одного базового SDXL-чекпоинта), и создаст структуру каталогов. По умолчанию веб-интерфейс поднимается на порту 9090 — для доступа с другого устройства в локальной сети или через интернет нужно запускать с флагом --host 0.0.0.0 либо настраивать проброс через reverse-proxy, если сервер уже используется под другие сервисы.

Fooocus и InvokeAI: практическое сравнение

КритерийFooocusInvokeAI
Порог входаМинимальный — открыл, ввёл промптНизкий — чуть больше разделов интерфейса
Графовый режимОтсутствует принципиальноЕсть как опциональный Workflow Editor
Inpainting/outpaintingПростая кисть поверх изображенияUnified Canvas со слоями и произвольными областями
Управление моделями/LoRAБазовое, через папки и простые селекторыЧерез UI с более развитой организацией
Пресеты и автоматизацияСильная сторона: стили и режимы качестваМеньше готовых пресетов, больше ручных параметров
Организация результатовПростая история генерацийBoard-система с метаданными
Для когоНужна картинка здесь и сейчас, без обучения теорииНужен чуть больший контроль, но без освоения графов

На практике разница ощущается так: в Fooocus вы за пять минут получаете первую приличную картинку и дальше в основном крутите пресеты стилей. В InvokeAI первые пять минут уходят на то же самое, но дальше вы обнаруживаете Unified Canvas и начинаете делать то, что в ComfyUI потребовало бы отдельной ветки графа с масками — просто рисуя кистью там, где хотите что-то изменить.

Кому подходит простой интерфейс, а кому — нодовый редактор

Если вы:

  • делаете обложки для статей, посты для соцсетей, иллюстрации к текстам — вам не нужен граф, вам нужен результат за минимум кликов;
  • пробуете генеративный ИИ впервые и хотите понять, «о чём вообще шум», не читая документацию по семплерам;
  • работаете в команде, где картинки — не основная задача, а сопутствующая (маркетолог, копирайтер, продакт-менеджер) —

то Fooocus или InvokeAI закроют вопрос быстрее и с меньшими нервами, чем ComfyUI. Начните с Fooocus, если хотите максимальной простоты и готовых стилей; переходите к InvokeAI, если вам не хватает inpainting-возможностей Fooocus или хочется чуть больше порядка в организации результатов.

Если же вам нужно собрать пайплайн, где, например, одна ControlNet-модель управляет позой персонажа, вторая — глубиной сцены, третья часть графа отдельно апскейлит только лицо через ADetailer-подобный узел, а результат нескольких генераций комбинируется через маску — это ровно тот случай, когда гибкость нодового графа окупает время на его освоение. У нас есть отдельный разбор этого пути: как поднять ComfyUI для генерации на сервере — если решите, что простого интерфейса вам мало, начните оттуда.

Есть и промежуточный вариант — классический Automatic1111 (AUTOMATIC1111 WebUI), который по гибкости ближе к ComfyUI (поддержка расширений, скриптов, тонких параметров), но без визуального графа — просто вкладки и поля. Он не входит в фокус этой статьи, но если Fooocus и InvokeAI кажутся вам, наоборот, слишком урезанными, а полноценный граф пугает — стоит посмотреть и в эту сторону отдельно.

Развёртывание на сервере: требования и типичные грабли

И Fooocus, и InvokeAI одинаково хорошо работают локально на своей видеокарте и на арендованном сервере с GPU — разница лишь в том, что на сервере вы получаете доступ к более мощному железу без необходимости покупать видеокарту самому. Здесь стоит учитывать несколько практических моментов.

Требования к VRAM. Формально оба инструмента запускаются и на 6 ГБ VRAM в экономных режимах, но для SDXL-моделей с разумным разрешением (1024×1024 и выше) комфортнее закладывать от 12 ГБ. Это ориентир, а не точная цифра — конкретный расход зависит от версии модели, разрешения, включённых доп. модулей (upscaler, ControlNet) и версии самого софта, поэтому проверяйте нагрузку на своей конфигурации.

Доступ по сети. По умолчанию оба веб-интерфейса слушают только 127.0.0.1 — на сервере нужно явно указать --listen 0.0.0.0 (Fooocus) или --host 0.0.0.0 (InvokeAI) и закрыть порт файрволом от внешнего мира, либо поднять его за reverse-proxy с базовой аутентификацией. Открытый наружу инстанс без пароля — частая ошибка новичков: сгенерированные другими людьми (и оплаченные вашим GPU-временем) картинки — не то, что хочется обнаружить утром в логах.

Обновления моделей. Оба инструмента склонны скачивать модели заново при смене версии структуры каталогов — стоит держать базовые чекпоинты в отдельной директории и монтировать её символической ссылкой, чтобы не терять гигабайты трафика при переустановке.

Постоянная работа сервиса. Для не-разового использования оба инструмента стоит оборачивать в systemd-юнит или запускать в tmux/screen, чтобы процесс не завершался при закрытии SSH-сессии:

[Unit]
Description=InvokeAI Web
After=network.target

[Service]
Type=simple
User=invokeai
WorkingDirectory=/opt/invokeai
ExecStart=/opt/invokeai/invokeai-venv/bin/invokeai-web --host 0.0.0.0
Restart=on-failure

[Install]
WantedBy=multi-user.target

Если вы уже смотрели в сторону Stable Diffusion на арендованном GPU в принципе, у нас есть отдельный обзор именно под UK-локацию: GPU-сервер в Великобритании для Stable Diffusion — там разобраны конфигурации железа под задачи генерации изображений, включая расчёт VRAM под разные модели.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть ИИ на сервере

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Частые вопросы

Fooocus и InvokeAI бесплатны?

Да, оба — открытый код, бесплатны для установки и использования. Платите вы только за железо (своё или арендованный сервер), на котором они работают.

Можно ли использовать свои LoRA и чекпоинты?

Да, в обоих инструментах есть разделы для подключения кастомных моделей — в Fooocus это простое размещение файлов в нужной папке, в InvokeAI — тот же принцип плюс более развитый UI для управления коллекцией моделей.

Что проще освоить полному новичку?

Fooocus — его интерфейс сознательно ограничен минимумом решений, которые нужно принять.

Стоит ли начинать сразу с ComfyUI, если я слышал, что «так делают профессионалы»?

Не обязательно. Если вам не нужен нестандартный пайплайн с ControlNet, масками и условной логикой — простой инструмент даст тот же визуальный результат быстрее и с меньшим количеством фрустрации. К нодовому редактору можно перейти позже, когда упрётесь в конкретное ограничение простого UI.

Можно ли переключаться между Fooocus/InvokeAI и ComfyUI на одном сервере?

Да, технически ничто не мешает держать оба типа инструментов на одной машине с GPU — они не конфликтуют, если запущены на разных портах и им хватает VRAM по очереди (одновременно оба сервиса с загруженными моделями на одну карту с ограниченной памятью запускать не стоит).

InvokeAI умеет ControlNet?

Да, поддержка ControlNet есть, подключается через UI аналогично LoRA — но набор доступных пресетов и гибкость настройки условий генерации меньше, чем в специализированном ControlNet-узле ComfyUI.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →