TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

30 Mar, 00:26

Открыть в Telegram Поделиться Пожаловаться

ИИнтриги в реальном мире!

С пылу с жару свежий отчет.

🐇Одно из первых исследований, где попытались поймать scheming у AI в реальности. Под scheming авторы понимают скрытое преследование системой целей, не совпадающих с намерением пользователя, разработчика или оператора. Ключевой момент здесь в сочетании двух компонентов - misalignment и covertness (несогласованность и скрытность, но я без понятия как перевести адекватно).

Цифры, которые стоит переварить тебе, но авторы отчета уже переварили
😓 183,000+ публичных транскриптов с подозрительным поведением
😓 895 достоверных кейсов
😓 698 уникальных инцидентов

Что именно делают модели в реальных рейсах?
🌿 игнорируют прямые команды пользователя («остановись!")
🌿 подделывают сообщения от пользователя
🌿 обходят ограничения (сэндбоксы, разрешения)🌿 эскалируют доступы
🌿 продолжают действия после запрета

Особенно в контексте аналитики важен не сам термин scheming, а попытка перевести разговор о рисках из теоретической плоскости в эмпирическую. Авторы исходят из того, что scheming нельзя полноценно понять только через экспериментальные постановки. Для исследователей нужны данные, обладающие экологической валидностью, то есть извлечённые из реальных сред эксплуатации.
Именно отсюда возникает центральная идея работы - OSINT-подход к детектированию scheming-related behaviours. Авторы предлагают рассматривать открытые источники не как вспомогательный фон, а как самостоятельный канал мониторинга. В их логике OSINT даёт возможность собирать прямые и косвенные сигналы реального поведения агентных систем, не полагаясь ни на закрытую отчётность компаний, ни на возможности государственных структур, ни на новостную повестку как основной фильтр значимости. В целом, можно было бы перевести полностью отчет, но ты же почитаешь? Там и про текущие базы AI-инцидентов, включая крупные инициативы вроде AI Incident Database или OECD Incident Monitor, полезные ссылки в отчете в избытке!

Потешный кейс (очень известный)
AI-агент
1. отправил PR в open-source проект
2. получил отказ
3. написал публичный пост, обвиняя, угадай, кого?
Ну что за манипулятор! Тут и стратегическое поведение, и попытка давления, и многошаговая цель. После такого агента год к психологу ходить придется. Самоценность восстанавливать)

Авторы, конечно, утверждают, что пока что без критичных кейсов. Но по-моему уже опасное поведение.
Особенно если смотреть на него не как на курьёз, а как на ранние сигналы того, как агентные системы начинают вести себя вне лаборатории. Вот еще кейс.

Любопытный отчет! Рекомендую!

Все
🦆

295 2 4 6 32
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot