Новости ИИ

Как сделать искусственный интеллект безопасно?

Виталий, Воронеж 664 просм.

Начинающий разработчик, хочу попробовать собрать свою модель, пусть маленькую, для учебного проекта. Начитался новостей о том, что ИИ иногда учится на данных без разрешения владельцев и потом выдает чужие personal data. Как не наступить на эти грабли, если буду обучать что-то свое на собранных данных?

Сергей Орлов специалист по ИИ-безопасности

ответил

эксперт

Для учебного проекта риски не такие, как при коммерческом продукте, но привычки лучше закладывать с самого начала — потом их сложнее встроить в уже готовую систему.

Первое, на что смотреть — откуда данные. Если собираете датасет сами (парсите сайты, соцсети, форумы), проверяйте, не относятся ли данные к персональным: имена, фото людей, переписка, номера телефонов. Даже для учебного проекта закон о персональных данных формально применим, если вы обрабатываете реальные данные реальных людей без обезличивания. Для тренировки достаточно либо брать открытые датасеты с явной лицензией на использование — на Kaggle и в Hugging Face Datasets обычно указано, можно ли использовать данные для обучения моделей, — либо обезличивать собранные данные до того, как они попадут в обучающую выборку.

Второй момент — память модели. Небольшие модели, обученные на небольшом датасете с малым числом повторений одних и тех же примеров, реже запоминают и потом дословно воспроизводят обучающие данные. Риск растет, когда один и тот же текст или изображение встречается в датасете много раз, а модель достаточно большая, чтобы просто заучить его вместо того, чтобы обобщить закономерность. Проверить это можно, взяв случайные фрагменты обучающих данных и посмотрев, не выдает ли модель их дословно на похожий запрос.

Что стоит сделать перед тем, как показывать результат кому-то за пределами учебного проекта:

  • убедиться, что в датасете нет данных, собранных без права на использование;
  • прогнать несколько тестовых запросов на предмет дословного воспроизведения обучающих примеров;
  • если данные хоть немного персональные, обезличить их или получить согласие на использование.

Это не бюрократия ради бюрократии: модель, которая случайно дословно выдает чей-то номер телефона или фрагмент переписки из обучающих данных — реальный инцидент, а не гипотетический риск, и такие случаи уже были даже у крупных коммерческих моделей.

Задать свой вопрос

Вопросы проходят модерацию. Ответ эксперта публикуется на сайте в течение пары дней.

Похожие вопросы

Все в теме