Четвертый вебинар в рамках серии «ИИ/AI для бизнеса».
Практический вебинар, посвящённый использованию AI, ML-моделей и open-source решений в разработке и управлении продуктом с учётом требований EU AI Act, лицензий моделей и датасетов, а также базовых требований GDPR при работе с данными и ML-pipeline.
Online | YouTube Трансляция
Вебинар проводится на русском языке и рассчитан на международную аудиторию: разработчиков, ML-инженеров, product-менеджеров, технических лидов, архитекторов, юристов и специалистов по комплаенсу, а также всех, кто уже использует или планирует внедрять AI-инструменты, open-source модели и датасеты в разработке цифровых продуктов.
ML и регуляторов (непрозрачность, масштаб, риск дискриминации). Open-source: ответственность за использование несёт deployer. Примеры кейсов/штрафов в ML-контексте (очень кратко). Опрос: «Используете ли open-source модели или датасеты в проде?»
ML-система может считаться high-risk: кредитный скоринг, HR-скрининг, биометрия, критические сервисы и т.п. AI provider и deployer. Что с точки зрения AI Act важно в ML-pipeline: training, fine-tuning, inference, мониторинг.
Opensource и кому принадлежат права на конечный результат, специальные AI-лицензии (типа OpenRAIL), кастомные лицензии датасетов (только исследование, запрет коммерции, гео-ограничения и т.д.). Разделение: лицензия модели ≠ лицензия датасета. Риски: использование данных/модели вне условий лицензии, отсутствие атрибуции, использование «грязного» датасета
Задачи команды: вести реестр используемых моделей/библиотек/датасетов; фиксировать лицензии и ограничения; согласовывать проблемные лицензии (GPL, ограничения по домену) с юристами до внедрения. Роль PM: лицензирование и проверка источников в Definition of Done для ML-фич. Мини-пример: как может выглядеть таблица «Модель/датасет → лицензия → разрешённые сценарии → ответственный».
Какие данные используете для обучения и inference: персональные, псевдонимизированные, агрегированные, special category (здоровье, биометрия и т.п.), ограничения, требования к анонимизации. DPIA как инструмент описания ML-pipeline и оценка рисков для прав субъектов.
Минимальный набор: цели, данные, ограничения, зоны запрета использования; dataset card (происхождение, состав, лицензия, потенциальный bias); описание data flow; описание human-in-the-loop (когда обязательный ручной пересмотр).
Ответы на вопросы:, «Можно ли дообучать модель на пользовательских данных без отдельного согласия?»,
«Что делать, если лицензия датасета непонятна?».
Практические шаги: 1) собрать список всех ML-моделей и датасетов в компании; 2) завести простой реестр лицензий; 3) выбрать одну продовую модель и сделать для неё model card, data flow с указанием, где используется open-source.
В рамках вебинара рассматриваются риски ML и OSS, роли provider и deployer по AI Act, лицензирование моделей и данных, GDPR и DPIA для ML-систем, а также практические подходы к документации и управлению рисками при внедрении ИИ.