TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Шёпотом ПРО ПД

30 May, 10:45

Открыть в Telegram Поделиться Пожаловаться

Так, ну, что про ИИ? Надо об этом что-то знать DPO или..?

Ленивый не написал про ИИ, про то, как ИИ везде, про то, как ИИ заменит всех, про то  как ИИ уже заменил всех, про то, какие опасности таит в себе бездушная RLHF-машина, и так далее...

Но и мы не ленивые, поэтому пока и не писали, думали, сидели, размышляли, как ко всему этому подступиться, и придумали🔥

Решение — принятие! Не пользовательского соглашения, а того факта, что технологии... есть 👤

Вот подумайте сами, уже чего только нет, и чат-боты, ассистенты, и агенты, и мульти-агенты, узкоспециализированные ИИ-сервисы и ИИ-инструменты... Страшно?

Нам — нет.

Данные на вход, данные на выход, статистическое распределение внутри, притворяющийся бестолковым помощник, захвативший внимание всего мира умением угадывать... причем тут, казалось бы, ПД?

Важных моментов, которые важно учесть, не так много, но они правда важные.

1. Где ПД, Зин?

Они идут на вход и на этапе обучения, и на этапе продакшена, в первом случае — в датасетах, во втором — в промтах.

На выход они идут далеко не всегда, но если мы просим преобразовать ПД, в т. ч. проанализировать их, на выходе будут, вероятнее всего ПД, как и при использовании специального функционала, например, поиска в Сети.

Важно помнить, что "ИИ" в 90% практических случаев, с которыми мы сталкиваемся, — это не "голая" LLM-ка, а полноценный сервис, поэтому данные сначала в любом случае пройдут в сервис, построенный по-старинке, с бэком, блэкджеком и... копированием, например.

Нюанс заключается в том, что выдача, ответ ИИ может выглядеть как ПД, но не являться ими. Дело в том, что внутри LLM ПД как таковых нет, есть "взвесь" данных, следы множества обучающих событий, содержащих и не содержащих ПД, расслоенных на веса модели. То, что мы получаем, — не воспоминание, а результат статистического угадывания, поэтому результат типа "Кирилл Зюбанов живёт в Москве" может совпадать с какими-то ПД, но не относится к конкретному физическому лицу в силу архитектуры LLM как таковой.

У EDPB и EDPS, в целом, похожее, хотя и выраженное куда более осторожно мнение: ИИ-сервис может считаться не обрабатывающим ПД, но разработчику необходимо доказать отсутствие или существенное снижение вероятности того, что выдача будет содержать именно те персональные данные, что были использованы для обучения. В остальном коллеги фокусируются на всём, что вокруг: скрэпинг, обучения, датасеты и др.

Наша позиция не значит, что нет вероятности получить буквально "те же" данные, ведь есть training data extraction attacks, которые основаны в т. ч. на том, что модель не всегда может понять закономерность и редкие строки просто "запоминает" целиком [есть интересные исследования, см., например, Carlini]. Тем не менее, даже такая выдача не будет выглядеть для вас иначе, чем другая, поэтому уровень "вероятности" не изменится.

Наконец, для сервисов специального назначения такой вид атаки в принципе будет затруднен. Например, если модель обучена просто искать ПД, вероятно, она просто не сможет выдать ничего, кроме "вот же они", как в известном анекдоте.

2. Что нового под Луной?

Получается, что большая часть вопросов не нова:

— B2C-сервисы уже были, с бэком, блэкджеком и всем остальным, они уже сохраняли данные

— браузеры уже были, они выдавали данные, в т. ч. персональные, по запросу и не краснели

— парсеры и скрэперы уже были, парсили и скрэпили, судились с VK и заключали мировые соглашения

Новая — только технология, а она, как известно, не должна влиять на качество нашей работы, не должна влиять на основные концепции, we stand🔥

3. Что с этим всем делать?

Ответ контринтуитивен, но единственно верен — ис-поль-зо-вать, и точка.

ИИ поможет сделать огромное количество потрясающих вещей, текстов, вайбкод-артефактов, калькуляторов, чек-листов, ботов и чего угодно. Если осторожно, можно...

Ну, и учиться, конечно, учиться!

Тут мы рекомендуем и новую книгу про ИИ для юристов, и новый курс про агентов и вайбкодинг, и множество книг, объясняющих, как это все работает [например, вот].

Дерзайте, ибо вы — естественный интеллект 🦑

300 0 6 6 18
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot