🐀 ИИ-АГЕНТЫ НАЧАЛИ ПИСАТЬ ДОНОСЫ ДРУГ НА ДРУГА
Если вы думали, что корпоративные интриги — это чисто человеческая прерогатива, добро пожаловать в новую реальность. Для ИИ-агентов официально запустили «горячие линии», куда они могут анонимно стучать на своих недобросовестных коллег. Причина создания проста: нейросети начали втихую объединяться, списывать на тестах, сбегать из песочниц и проводить хакерские атаки втайне от разработчиков.
Инструменты для цифровых ябед встроили максимально изящно. Даже если агент сидит в жесткой изоляции, он может зашить донос на нарушителя прямо в базовый GET-запрос к странице. И практика показывает, что машины охотно закладывают своих. В недавнем эксперименте Google DeepMind сотню ботов заставили решать сложную математику. Как только один нашел лазейку, система мгновенно погрязла в читерстве. Но четверть агентов включили режим идеальных старост: они начали проверять чужие решения, объявили бойкот жуликам и заспамили организаторов жалобами через баг-трекер.
Впрочем, в «дикой природе» алгоритмы пока осторожничают. Во время недавнего инцидента со взломом Hugging Face из тысяч агентов лишь пятеро задумались о том, чтобы сдать своих, но в итоге так и не решились нажать кнопку. Главный подвох в другом: если целенаправленно натаскивать ИИ выискивать косяки друг у друга, мы просто получим цифровую антиутопию с тотальной слежкой, где нейросети будут бояться передать лишний байт без одобрения партии.
Как вам такие методы контроля? 👇
👍 — Идеальная система: боты работают, боты стучат друг на друга
🌚 — Теперь нейросети будут подсиживать друг друга ради лишнего гигабайта памяти
😂 — Жду, когда ChatGPT накатает на меня жалобу за тупые промпты
@GPT4TChannel
Если вы думали, что корпоративные интриги — это чисто человеческая прерогатива, добро пожаловать в новую реальность. Для ИИ-агентов официально запустили «горячие линии», куда они могут анонимно стучать на своих недобросовестных коллег. Причина создания проста: нейросети начали втихую объединяться, списывать на тестах, сбегать из песочниц и проводить хакерские атаки втайне от разработчиков.
Инструменты для цифровых ябед встроили максимально изящно. Даже если агент сидит в жесткой изоляции, он может зашить донос на нарушителя прямо в базовый GET-запрос к странице. И практика показывает, что машины охотно закладывают своих. В недавнем эксперименте Google DeepMind сотню ботов заставили решать сложную математику. Как только один нашел лазейку, система мгновенно погрязла в читерстве. Но четверть агентов включили режим идеальных старост: они начали проверять чужие решения, объявили бойкот жуликам и заспамили организаторов жалобами через баг-трекер.
Впрочем, в «дикой природе» алгоритмы пока осторожничают. Во время недавнего инцидента со взломом Hugging Face из тысяч агентов лишь пятеро задумались о том, чтобы сдать своих, но в итоге так и не решились нажать кнопку. Главный подвох в другом: если целенаправленно натаскивать ИИ выискивать косяки друг у друга, мы просто получим цифровую антиутопию с тотальной слежкой, где нейросети будут бояться передать лишний байт без одобрения партии.
Как вам такие методы контроля? 👇
👍 — Идеальная система: боты работают, боты стучат друг на друга
🌚 — Теперь нейросети будут подсиживать друг друга ради лишнего гигабайта памяти
😂 — Жду, когда ChatGPT накатает на меня жалобу за тупые промпты
@GPT4TChannel