Так, ну, что про ИИ? Надо об этом что-то знать DPO или..?
Ленивый не написал про ИИ, про то, как ИИ везде, про то, как ИИ заменит всех, про то как ИИ уже заменил всех, про то, какие опасности таит в себе бездушная RLHF-машина, и так далее...
Но и мы не ленивые, поэтому пока и не писали, думали, сидели, размышляли, как ко всему этому подступиться, и придумали🔥
Решение — принятие! Не пользовательского соглашения, а того факта, что технологии... есть 👤
Вот подумайте сами, уже чего только нет, и чат-боты, ассистенты, и агенты, и мульти-агенты, узкоспециализированные ИИ-сервисы и ИИ-инструменты... Страшно?
Нам — нет.
Данные на вход, данные на выход, статистическое распределение внутри, притворяющийся бестолковым помощник, захвативший внимание всего мира умением угадывать... причем тут, казалось бы, ПД?
Важных моментов, которые важно учесть, не так много, но они правда важные.
1. Где ПД, Зин?
Они идут на вход и на этапе обучения, и на этапе продакшена, в первом случае — в датасетах, во втором — в промтах.
На выход они идут далеко не всегда, но если мы просим преобразовать ПД, в т. ч. проанализировать их, на выходе будут, вероятнее всего ПД, как и при использовании специального функционала, например, поиска в Сети.
Важно помнить, что "ИИ" в 90% практических случаев, с которыми мы сталкиваемся, — это не "голая" LLM-ка, а полноценный сервис, поэтому данные сначала в любом случае пройдут в сервис, построенный по-старинке, с бэком, блэкджеком и... копированием, например.
Нюанс заключается в том, что выдача, ответ ИИ может выглядеть как ПД, но не являться ими. Дело в том, что внутри LLM ПД как таковых нет, есть "взвесь" данных, следы множества обучающих событий, содержащих и не содержащих ПД, расслоенных на веса модели. То, что мы получаем, — не воспоминание, а результат статистического угадывания, поэтому результат типа "Кирилл Зюбанов живёт в Москве" может совпадать с какими-то ПД, но не относится к конкретному физическому лицу в силу архитектуры LLM как таковой.
У EDPB и EDPS, в целом, похожее, хотя и выраженное куда более осторожно мнение: ИИ-сервис может считаться не обрабатывающим ПД, но разработчику необходимо доказать отсутствие или существенное снижение вероятности того, что выдача будет содержать именно те персональные данные, что были использованы для обучения. В остальном коллеги фокусируются на всём, что вокруг: скрэпинг, обучения, датасеты и др.
Наша позиция не значит, что нет вероятности получить буквально "те же" данные, ведь есть training data extraction attacks, которые основаны в т. ч. на том, что модель не всегда может понять закономерность и редкие строки просто "запоминает" целиком [есть интересные исследования, см., например, Carlini]. Тем не менее, даже такая выдача не будет выглядеть для вас иначе, чем другая, поэтому уровень "вероятности" не изменится.
Наконец, для сервисов специального назначения такой вид атаки в принципе будет затруднен. Например, если модель обучена просто искать ПД, вероятно, она просто не сможет выдать ничего, кроме "вот же они", как в известном анекдоте.
2. Что нового под Луной?
Получается, что большая часть вопросов не нова:
— B2C-сервисы уже были, с бэком, блэкджеком и всем остальным, они уже сохраняли данные
— браузеры уже были, они выдавали данные, в т. ч. персональные, по запросу и не краснели
— парсеры и скрэперы уже были, парсили и скрэпили, судились с VK и заключали мировые соглашения
Новая — только технология, а она, как известно, не должна влиять на качество нашей работы, не должна влиять на основные концепции, we stand🔥
3. Что с этим всем делать?
Ответ контринтуитивен, но единственно верен — ис-поль-зо-вать, и точка.
ИИ поможет сделать огромное количество потрясающих вещей, текстов, вайбкод-артефактов, калькуляторов, чек-листов, ботов и чего угодно. Если осторожно, можно...
Ну, и учиться, конечно, учиться!
Тут мы рекомендуем и новую книгу про ИИ для юристов, и новый курс про агентов и вайбкодинг, и множество книг, объясняющих, как это все работает [например, вот].
Дерзайте, ибо вы — естественный интеллект 🦑
Ленивый не написал про ИИ, про то, как ИИ везде, про то, как ИИ заменит всех, про то как ИИ уже заменил всех, про то, какие опасности таит в себе бездушная RLHF-машина, и так далее...
Но и мы не ленивые, поэтому пока и не писали, думали, сидели, размышляли, как ко всему этому подступиться, и придумали🔥
Решение — принятие! Не пользовательского соглашения, а того факта, что технологии... есть 👤
Вот подумайте сами, уже чего только нет, и чат-боты, ассистенты, и агенты, и мульти-агенты, узкоспециализированные ИИ-сервисы и ИИ-инструменты... Страшно?
Нам — нет.
Данные на вход, данные на выход, статистическое распределение внутри, притворяющийся бестолковым помощник, захвативший внимание всего мира умением угадывать... причем тут, казалось бы, ПД?
Важных моментов, которые важно учесть, не так много, но они правда важные.
1. Где ПД, Зин?
Они идут на вход и на этапе обучения, и на этапе продакшена, в первом случае — в датасетах, во втором — в промтах.
На выход они идут далеко не всегда, но если мы просим преобразовать ПД, в т. ч. проанализировать их, на выходе будут, вероятнее всего ПД, как и при использовании специального функционала, например, поиска в Сети.
Важно помнить, что "ИИ" в 90% практических случаев, с которыми мы сталкиваемся, — это не "голая" LLM-ка, а полноценный сервис, поэтому данные сначала в любом случае пройдут в сервис, построенный по-старинке, с бэком, блэкджеком и... копированием, например.
Нюанс заключается в том, что выдача, ответ ИИ может выглядеть как ПД, но не являться ими. Дело в том, что внутри LLM ПД как таковых нет, есть "взвесь" данных, следы множества обучающих событий, содержащих и не содержащих ПД, расслоенных на веса модели. То, что мы получаем, — не воспоминание, а результат статистического угадывания, поэтому результат типа "Кирилл Зюбанов живёт в Москве" может совпадать с какими-то ПД, но не относится к конкретному физическому лицу в силу архитектуры LLM как таковой.
У EDPB и EDPS, в целом, похожее, хотя и выраженное куда более осторожно мнение: ИИ-сервис может считаться не обрабатывающим ПД, но разработчику необходимо доказать отсутствие или существенное снижение вероятности того, что выдача будет содержать именно те персональные данные, что были использованы для обучения. В остальном коллеги фокусируются на всём, что вокруг: скрэпинг, обучения, датасеты и др.
Наша позиция не значит, что нет вероятности получить буквально "те же" данные, ведь есть training data extraction attacks, которые основаны в т. ч. на том, что модель не всегда может понять закономерность и редкие строки просто "запоминает" целиком [есть интересные исследования, см., например, Carlini]. Тем не менее, даже такая выдача не будет выглядеть для вас иначе, чем другая, поэтому уровень "вероятности" не изменится.
Наконец, для сервисов специального назначения такой вид атаки в принципе будет затруднен. Например, если модель обучена просто искать ПД, вероятно, она просто не сможет выдать ничего, кроме "вот же они", как в известном анекдоте.
2. Что нового под Луной?
Получается, что большая часть вопросов не нова:
— B2C-сервисы уже были, с бэком, блэкджеком и всем остальным, они уже сохраняли данные
— браузеры уже были, они выдавали данные, в т. ч. персональные, по запросу и не краснели
— парсеры и скрэперы уже были, парсили и скрэпили, судились с VK и заключали мировые соглашения
Новая — только технология, а она, как известно, не должна влиять на качество нашей работы, не должна влиять на основные концепции, we stand🔥
3. Что с этим всем делать?
Ответ контринтуитивен, но единственно верен — ис-поль-зо-вать, и точка.
ИИ поможет сделать огромное количество потрясающих вещей, текстов, вайбкод-артефактов, калькуляторов, чек-листов, ботов и чего угодно. Если осторожно, можно...
Ну, и учиться, конечно, учиться!
Тут мы рекомендуем и новую книгу про ИИ для юристов, и новый курс про агентов и вайбкодинг, и множество книг, объясняющих, как это все работает [например, вот].
Дерзайте, ибо вы — естественный интеллект 🦑