На кого распространяется действие Руководства
Руководство распространяется на организации частного сектора, которые собирают персональные данные из внешних источников для обучения или донастройки (fine-tuning) генеративных моделей ИИ — будь то собственными силами, через подрядчика или путем приобретения набора данных, уже собранного другой организацией. Из сферы применения исключены брокеры данных, которые лишь перепродают собранные наборы данных без обучения моделей, обработка организацией собственных данных, а также скрейпинг, осуществляемый органами государственной власти. Такие ситуации в целом остаются подчинены законодательству о защите данных, в том же время они находятся за рамками сферы применения данного документа.
Статус лица, осуществляющего скрейпинг, по GDPR
Субъект, осуществляющий скрейпинг, не становится автоматически контролером данных. Лицо, действующее на основании документированных инструкций разработчика ИИ, является обработчиком данных (processor), а контролером в свою очередь выступает разработчик. Если разработчик повторно использует набор данных, уже собранный другой организацией, каждая из сторон несет ответственность только за собственную обработку — первоначальный сборщик данных не отвечает за последующее использование данных. Совместный контроль (joint controllership) возникает, когда обе стороны совместно определяют цели и средства обработки, например совместно согласовывая критерии сбора данных для набора, который одна сторона будет формировать для обучения модели другой стороны.
Именно от этой классификации зависит, кто подписывает соглашение об обработке данных (data processing agreement), кто отвечает на запросы субъектов данных, и кто несет риск ответственности, если выяснится, что набор данных был собран незаконно.
Три ключевых принципа GDPR
Проект Руководства добавляет рекомендуемое EDPB толкование того, как каждый из основных принципов GDPR применяется к скрейпингу:
Тест законного интереса
Согласие (consent) субъекта персональных данных редко применимо в случае скрейпинга веб-данных: прямая связь с физическим лицом отсутствует, а публикация данных в интернете не означает согласия на их повторное использование. Поэтому законный интерес по статье 6(1)(f) GDPR является основанием, на которое будет опираться большинство частных организаций, при условии соблюдения трех кумулятивных условий.
Нюансы, касающиеся специальных категорий данных
Скрейпинг специальных категорий персональных данных — таких как расовое или этническое происхождение, политические взгляды или данные о состоянии здоровья — запрещен без применения исключения, предусмотренного статьей 9(2) GDPR. Поскольку при скрейпинге часто невозможно избежать таких данных, EDPB применяет подход Суда ЕС, сформулированный в деле GC and Others (C-136/17), изначально разработанный для поисковых систем: запрет, установленный статьей 9, обязывает контролера только в пределах его собственных обязанностей, полномочий и возможностей.
Это применимо только в тех случаях, когда обработка сходна по характеру с деятельностью поисковой системы, сбор данных специальных категорий носит случайный и непреднамеренный характер, его действительно затруднительно предотвратить заранее, а контролер внедрил гарантии на всех этапах жизненного цикла данных — предварительную фильтрацию до сбора, оперативное удаление после выявления, устойчивость к извлечению данных в процессе разработки модели и непрерывный мониторинг выходных данных после развертывания, при необходимости также следует рассмотреть возможность «машинного забывания» (model unlearning).
Рекомендации REVERA
В совокупности Руководство ставит под контроль GDPR весь жизненный цикл разработки ИИ — от выбора источников данных через их сбор и хранение до мер, предотвращающих воспроизведение обученной моделью запомненных персональных данных. Соблюдение требований лишь на одном из этапов этой цепочки не будет удовлетворять требованиям EDPB.
Поскольку статус контролера зависит от того, кто фактически определяет цели и средства обработки, в соглашениях с подрядчиками по скрейпингу и поставщиками наборов данных следует закреплять источники данных, критерии сбора и исключения, права на проведение аудита, а также гарантии в отношении того, как был сформирован приобретаемый набор данных. Поскольку первоначальный сборщик данных не несет ответственности за последующее использование данных разработчиком, именно договорная документация становится для разработчика основным доказательством соблюдения принципа подотчетности, если регулятор задаст вопрос о том, как был сформирован обучающий набор данных.
Сроки
Данное Руководство пока остается проектом. EDPB принял его 7 июля 2026 года для проведения публичных консультаций, а не в окончательном виде: оно не является самостоятельным нормативным актом, а представляет собой необязательные рекомендации Совета о том, как следует толковать и применять действующий GDPR к скрейпингу веб-данных, и текст может еще измениться до его окончательного утверждения.
Консультации продлятся с 8 июля по 30 октября 2026 года, комментарии подаются через онлайн-форму EDPB и, если не заявлен отказ (opt-out), публикуются с указанием имени заявителя, отрасли и страны. У компаний, столкнувшихся с противоречием между потребностью в масштабных обучающих данных и требованиями Руководства о минимизации данных и применении смягчающих мер, есть ограниченное время, чтобы поднять вопросы, связанные с практическим применением, до окончательного утверждения текста.
Практика Arbitration & IT Disputes консультирует разработчиков ИИ, подрядчиков по скрейпингу и компании, внедряющие инструменты генеративного ИИ, по вопросам соответствия источников данных требованиям GDPR, оценки законного интереса и теста на соотношение интересов, а также договорного структурирования отношений в цепочке «сборщик данных — разработчик — оператор».