MAATRIX / Блог / Можно ли обучать модель на чужих данных: правовая рамка

Можно ли обучать модель на чужих данных: правовая рамка

MAATRIX

Дообучаете модель под свою задачу и на середине процесса ловите себя на вопросе: а данные, на которых она учится, вообще ваши? Тема острая и быстро меняющаяся — единой практики нет ни в одной юрисдикции, суды по всему миру спорят об этом прямо сейчас. Ниже — не юридическая консультация, а обзор для ориентира: какие сценарии обучения обычно безопасны, какие спорны, и что делать на практике, когда разворачиваете дообучение на собственном сервере. Оговорка сразу и прямо: это обзорный материал, а не правовое заключение. Право в области обучения ИИ на данных активно развивается, различается по странам, и в конкретных судебных делах ответы пока противоречивы. Для реального юридического решения — тем более если речь о коммерческом продукте с деньгами на кону — нужна консультация юриста, знакомого с правом интеллектуальной собственности в вашей юрисдикции и юрисдикции ваших пользователей.

Три разных сценария обучения — и своя грань риска у каждого

Прежде чем разбираться, "можно или нельзя", стоит развести три принципиально разных случая, потому что правовые вопросы у них разные:

  1. Обучение на собственных данных компании — внутренняя переписка, документация, код, база знаний. Это ваши данные, вы ими владеете или имеете права на использование.
  2. Обучение на данных, собранных из внешних источников — веб-скрапинг сайтов, форумов, книг, статей для формирования датасета. Здесь встаёт вопрос авторского права третьих лиц.
  3. Обучение на данных ваших клиентов — переписка пользователей вашего сервиса, их запросы, загруженные ими файлы. Здесь встаёт вопрос согласия конкретных людей.

Смешивать эти три случая — источник большинства недоразумений. Разберём каждый отдельно.

Свои данные компании — обычно самый спокойный случай

Если вы дообучаете модель на внутренней переписке компании, технической документации, кодовой базе, тикетах поддержки или базе знаний — с точки зрения авторских прав третьих лиц это обычно не создаёт правовых сложностей. Логика простая: это ваши материалы, созданные вашими сотрудниками в рамках трудовых отношений, права на них по умолчанию принадлежат компании (детали зависят от трудовых договоров и юрисдикции, но общий принцип именно такой).

Практический пример: компания разворачивает открытую модель на своём сервере и дообучает её на архиве переписки в поддержке, чтобы получить ассистента, отвечающего в стиле и терминологии компании. Датасет — это экспорт из собственной helpdesk-системы, никаких чужих текстов туда не попадает. Это тот сценарий, где юридических вопросов по авторскому праву третьих лиц, как правило, не возникает.

Нюанс, который всё же стоит держать в голове: если во внутренней переписке встречаются персональные данные сотрудников или клиентов (имена, контакты, содержание личных обращений), это уже вопрос не авторского права, а защиты персональных данных — тема отдельная и рассмотрена ниже, а также в статье о том, что считается персональными данными. Код и техническая документация обычно этой проблемы не несут, а вот переписка с клиентами — уже может.

Практическая настройка на своём сервере под такой сценарий не требует ничего специфического с юридической стороны — достаточно обычной гигиены доступа к серверу и данным. Если хотите разобраться с самой технической частью дообучения, у нас есть отдельный разбор обучения LoRA на арендованном GPU — там про параметры, VRAM и подготовку датасета.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть ИИ на сервере

Веб-скрапинг для датасета — спорная зона

Другая история — когда для обучения собственной модели вы собираете датасет со сторонних источников: сайтов, форумов, статей, книг, изображений из открытого интернета. Здесь возникает главный правовой вопрос последних лет: является ли использование чужого текста или изображения, защищённого авторским правом, для *обучения* модели (а не для прямого воспроизведения этого текста читателю) нарушением авторских прав?

Интуитивно кажется, что раз модель не выдаёт скопированный текст дословно, а "учится на нём" и генерирует что-то новое — то это ближе к тому, как человек учится, читая книги. Но юридически этот аргумент принимается судами не универсально и не однозначно. Есть доктрины вроде "добросовестного использования" (fair use в США) и аналогичные концепции в других странах, которые в некоторых случаях допускают использование защищённых материалов для трансформативных целей — но применение этих доктрин к обучению ИИ-моделей само по себе остаётся предметом спора, а не устоявшимся правилом.

Важно понимать: разные юрисдикции и разные суды дают на этот вопрос разные ответы. Что-то, признанное допустимым использованием в одной стране или одном судебном деле, может быть признано нарушением в другой юрисдикции или другим судом при похожих фактах. Единой мировой нормы здесь нет — и вряд ли появится в ближайшее время, пока законодатели и суды догоняют технологию.

Судебная практика: почему единого ответа пока нет

Тема активно оспаривается в реальных судебных процессах, идущих прямо сейчас в разных странах — авторы, издательства, художники и медиакомпании судятся с разработчиками моделей по поводу использования их материалов в обучающих датасетах. Мы намеренно не приводим здесь конкретные названия дел, номера исков или прогнозы по срокам решений — это область, где ситуация меняется быстрее, чем успевает устареть статья, и любая конкретика рискует оказаться неточной уже к моменту прочтения.

Что можно сказать без риска ошибиться — это структура проблемы, а не её текущий счёт:

  • Истцы обычно утверждают, что копирование защищённых материалов в обучающий датасет само по себе является нарушением — независимо от того, воспроизводит ли модель эти материалы дословно на выходе.
  • Ответчики обычно утверждают, что обучение — трансформативный процесс, извлекающий статистические паттерны, а не хранящий и не воспроизводящий исходные произведения.
  • Суды в разных делах по-разному оценивают, где проходит грань между "выучил паттерн" и "скопировал произведение", особенно если модель при определённых запросах может воспроизвести узнаваемые фрагменты исходника.
  • Регуляторное поле тоже не стоит на месте — в разных странах обсуждаются или принимаются отдельные нормы именно про обучение ИИ на защищённом контенте, отдельно от общего законодательства об авторском праве.

Практический вывод из этой неопределённости простой: если вы разворачиваете дообучение на собственном сервере на датасете, собранном скрапингом из открытого интернета, для коммерческого использования — вы принимаете на себя юридический риск, размер и реальность которого сегодня оценить точно нельзя. Это не значит "нельзя делать" — это значит "нужно осознанно взвешивать риск", желательно с юристом, а не полагаться на "все так делают".

Практический совет: что предпочесть для дообучения на своём сервере

Если вы разворачиваете дообучение на арендованном сервере и хотите избежать головной боли позже, разумный практический подход — не окончательная юридическая гарантия, а способ снизить риск:

  • Предпочитайте явно лицензированные датасеты — с открытой лицензией, прямо разрешающей использование для обучения моделей, или коммерческие датасеты, купленные именно с этим правом.
  • Предпочитайте собственные данные с понятными правами — переписку, документацию и код, которыми компания владеет или на которые имеет права по трудовым договорам с сотрудниками.
  • Относитесь с осторожностью к непроверенным веб-скрапинг датасетам для коммерческого использования — то, что подходит для личного эксперимента или исследования, не обязательно безопасно для модели, встроенной в коммерческий продукт с реальными пользователями.
  • Для данных клиентов — явное отдельное согласие, а не расчёт на то, что общая формулировка про обработку персональных данных покроет и обучение модели.
  • Документируйте происхождение датасета — откуда взят каждый источник, на каких условиях. Если через год-два возникнет вопрос, у вас должна быть возможность объяснить, что и почему вы использовали.

С технической стороны сам процесс дообучения на своём сервере не зависит от происхождения данных — GPU, объём VRAM и параметры обучения одни и те же что для лицензированного корпуса, что для сомнительного скрапинга. Но именно поэтому легко упустить правовую сторону вопроса за технической рутиной — стоит явно проговорить происхождение датасета до начала обучения, а не после.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть ИИ на сервере

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Частые вопросы

Если модель обучена на защищённых текстах, но не воспроизводит их дословно — это нарушение?

Однозначного ответа нет: это именно тот вопрос, по которому идут судебные споры прямо сейчас, и разные суды в разных делах приходят к разным выводам. Не стройте бизнес-план на предположении, что раз "модель не копирует дословно", то риска нет.

Достаточно ли общей политики обработки персональных данных, чтобы использовать переписку клиентов для обучения модели?

Во многих случаях — нет, или как минимум это спорно: согласие на обработку данных для оказания услуги и согласие на использование данных как обучающего материала для модели рассматриваются регуляторами как разные по объёму вещи. Разумнее прописать использование для обучения явно и отдельно.

Можно ли обучать модель на собственном коде и документации компании без риска?

Это самый низкорисковый с точки зрения авторских прав третьих лиц сценарий, если код и документация действительно принадлежат компании. Риск может появиться, если в базе есть чужой код с несовместимой лицензией (например, открытый код с копилефт-лицензией) или персональные данные сотрудников/клиентов внутри переписки.

Есть ли безопасные готовые датасеты для коммерческого дообучения?

Существуют датасеты с явными открытыми или коммерческими лицензиями, прямо разрешающими использование для обучения моделей — их стоит предпочитать непроверенным веб-скрапинг-сборкам именно ради ясности прав. Проверяйте лицензию конкретного датасета перед использованием, а не полагайтесь на репутацию источника.

Отличается ли ситуация для России от других стран?

Да, законодательство и судебная практика различаются по юрисдикциям, и то, что описано выше, — общая структура проблемы, а не конкретная норма конкретной страны. Для точного ответа применительно к вашей юрисдикции и юрисдикции ваших пользователей нужна консультация юриста.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →