КШ
Константин Шаров
Репост из: Tech Talk
ИИ вычисляет авторов по «цифровому почерку», делая анонимность бессмысленной
Эпоха, когда «там в интернете кто-то неправ» заканчивается, предупреждают исследователи из ETH Zurich и Anthropic. Раньше псевдоним и самые элементарные средства предосторожности действительно могли обеспечить анонимным авторам достаточную защиту, так как поиск конкретного человека среди миллионов пользователей требовал слишком много времени и ручного труда профессиональных следователей. Но современные языковые модели (LLM), просто анализируя тексты и сопоставляя с реальными личностями, способны автоматически деанонимизировать авторов с достаточно высокой точностью.
ИИ-агенты ищут совпадения в открытых профилях соцсетей и изданий, выделяя из постов и комментариев косвенные признаки вроде места жительства, возраста, хобби, специфического сленга, уникальной манеры изложения (характерное построение фраз, пунктуационные привычки, речевые обороты) и упоминания близких. К примеру, они сопоставляли анонимные профили с Hacker News и сопоставляли их с реальными профилями на LinkedIn. Если аноним упомянул, к примеру, редкую кличку собаки и город обучения, а в реальном профиле кандидата нашлись те же детали, ИИ тут же связывает их.
Точность догадок ИИ достигает 90%, а в некоторых экспериментах удалось успешно раскрыть личности 68% пользователей. Исследователи выяснили, что чем больше человек пишет, тем легче его вычислить: обсуждение более десяти фильмов в тематических сообществах Reddit делает пользователя узнаваемым в 48,1% случаев.
Исследователи пришли к выводу, что деанонимизация стала дешёвой и массовой. Это открывает путь к доксингу, преследованию критиков и рекламной слежке. Исследователи призывают платформы ограничить сбор данных, а создателей ИИ — внедрить жесткие барьеры, запрещающие моделям выполнять запросы на раскрытие реальных людей.
Эпоха, когда «там в интернете кто-то неправ» заканчивается, предупреждают исследователи из ETH Zurich и Anthropic. Раньше псевдоним и самые элементарные средства предосторожности действительно могли обеспечить анонимным авторам достаточную защиту, так как поиск конкретного человека среди миллионов пользователей требовал слишком много времени и ручного труда профессиональных следователей. Но современные языковые модели (LLM), просто анализируя тексты и сопоставляя с реальными личностями, способны автоматически деанонимизировать авторов с достаточно высокой точностью.
ИИ-агенты ищут совпадения в открытых профилях соцсетей и изданий, выделяя из постов и комментариев косвенные признаки вроде места жительства, возраста, хобби, специфического сленга, уникальной манеры изложения (характерное построение фраз, пунктуационные привычки, речевые обороты) и упоминания близких. К примеру, они сопоставляли анонимные профили с Hacker News и сопоставляли их с реальными профилями на LinkedIn. Если аноним упомянул, к примеру, редкую кличку собаки и город обучения, а в реальном профиле кандидата нашлись те же детали, ИИ тут же связывает их.
Точность догадок ИИ достигает 90%, а в некоторых экспериментах удалось успешно раскрыть личности 68% пользователей. Исследователи выяснили, что чем больше человек пишет, тем легче его вычислить: обсуждение более десяти фильмов в тематических сообществах Reddit делает пользователя узнаваемым в 48,1% случаев.
Исследователи пришли к выводу, что деанонимизация стала дешёвой и массовой. Это открывает путь к доксингу, преследованию критиков и рекламной слежке. Исследователи призывают платформы ограничить сбор данных, а создателей ИИ — внедрить жесткие барьеры, запрещающие моделям выполнять запросы на раскрытие реальных людей.