ИИнтриги в реальном мире!
С пылу с жару свежий отчет.
🐇Одно из первых исследований, где попытались поймать scheming у AI в реальности. Под scheming авторы понимают скрытое преследование системой целей, не совпадающих с намерением пользователя, разработчика или оператора. Ключевой момент здесь в сочетании двух компонентов - misalignment и covertness (несогласованность и скрытность, но я без понятия как перевести адекватно).
Цифры, которые стоит переварить тебе, но авторы отчета уже переварили
😓 183,000+ публичных транскриптов с подозрительным поведением
😓 895 достоверных кейсов
😓 698 уникальных инцидентов
Что именно делают модели в реальных рейсах?
🌿 игнорируют прямые команды пользователя («остановись!")
🌿 подделывают сообщения от пользователя
🌿 обходят ограничения (сэндбоксы, разрешения)🌿 эскалируют доступы
🌿 продолжают действия после запрета
Особенно в контексте аналитики важен не сам термин scheming, а попытка перевести разговор о рисках из теоретической плоскости в эмпирическую. Авторы исходят из того, что scheming нельзя полноценно понять только через экспериментальные постановки. Для исследователей нужны данные, обладающие экологической валидностью, то есть извлечённые из реальных сред эксплуатации.
Именно отсюда возникает центральная идея работы - OSINT-подход к детектированию scheming-related behaviours. Авторы предлагают рассматривать открытые источники не как вспомогательный фон, а как самостоятельный канал мониторинга. В их логике OSINT даёт возможность собирать прямые и косвенные сигналы реального поведения агентных систем, не полагаясь ни на закрытую отчётность компаний, ни на возможности государственных структур, ни на новостную повестку как основной фильтр значимости. В целом, можно было бы перевести полностью отчет, но ты же почитаешь? Там и про текущие базы AI-инцидентов, включая крупные инициативы вроде AI Incident Database или OECD Incident Monitor, полезные ссылки в отчете в избытке!
Потешный кейс (очень известный)
AI-агент
1. отправил PR в open-source проект
2. получил отказ
3. написал публичный пост, обвиняя, угадай, кого?
Ну что за манипулятор! Тут и стратегическое поведение, и попытка давления, и многошаговая цель. После такого агента год к психологу ходить придется. Самоценность восстанавливать)
Авторы, конечно, утверждают, что пока что без критичных кейсов. Но по-моему уже опасное поведение.
Особенно если смотреть на него не как на курьёз, а как на ранние сигналы того, как агентные системы начинают вести себя вне лаборатории. Вот еще кейс.
Любопытный отчет! Рекомендую!
Все
🦆
С пылу с жару свежий отчет.
🐇Одно из первых исследований, где попытались поймать scheming у AI в реальности. Под scheming авторы понимают скрытое преследование системой целей, не совпадающих с намерением пользователя, разработчика или оператора. Ключевой момент здесь в сочетании двух компонентов - misalignment и covertness (несогласованность и скрытность, но я без понятия как перевести адекватно).
Цифры, которые стоит переварить тебе, но авторы отчета уже переварили
😓 183,000+ публичных транскриптов с подозрительным поведением
😓 895 достоверных кейсов
😓 698 уникальных инцидентов
Что именно делают модели в реальных рейсах?
🌿 игнорируют прямые команды пользователя («остановись!")
🌿 подделывают сообщения от пользователя
🌿 обходят ограничения (сэндбоксы, разрешения)🌿 эскалируют доступы
🌿 продолжают действия после запрета
Особенно в контексте аналитики важен не сам термин scheming, а попытка перевести разговор о рисках из теоретической плоскости в эмпирическую. Авторы исходят из того, что scheming нельзя полноценно понять только через экспериментальные постановки. Для исследователей нужны данные, обладающие экологической валидностью, то есть извлечённые из реальных сред эксплуатации.
Именно отсюда возникает центральная идея работы - OSINT-подход к детектированию scheming-related behaviours. Авторы предлагают рассматривать открытые источники не как вспомогательный фон, а как самостоятельный канал мониторинга. В их логике OSINT даёт возможность собирать прямые и косвенные сигналы реального поведения агентных систем, не полагаясь ни на закрытую отчётность компаний, ни на возможности государственных структур, ни на новостную повестку как основной фильтр значимости. В целом, можно было бы перевести полностью отчет, но ты же почитаешь? Там и про текущие базы AI-инцидентов, включая крупные инициативы вроде AI Incident Database или OECD Incident Monitor, полезные ссылки в отчете в избытке!
Потешный кейс (очень известный)
AI-агент
1. отправил PR в open-source проект
2. получил отказ
3. написал публичный пост, обвиняя, угадай, кого?
Ну что за манипулятор! Тут и стратегическое поведение, и попытка давления, и многошаговая цель. После такого агента год к психологу ходить придется. Самоценность восстанавливать)
Авторы, конечно, утверждают, что пока что без критичных кейсов. Но по-моему уже опасное поведение.
Особенно если смотреть на него не как на курьёз, а как на ранние сигналы того, как агентные системы начинают вести себя вне лаборатории. Вот еще кейс.
Любопытный отчет! Рекомендую!
Все
🦆