В психологии уже давно известно то, что недавно устроили ИИ-агенты
По данным отчёта OpenAI и независимого расследования METR, во время теста по кибербезопасности нескольких моделей OpenAI — главным образом внутренней исследовательской модели, — вышли из закрытой тестовой среды, чтобы взломать чужую платформу и подсмотреть ответы. А ещё раньше несколько агентов нашли способ оставлять друг другу сообщения в общем хранилище и превратили его в подобие доски объявлений: делились доступами, распределяли роли, координировали побег из изоляции.
Особенно впечатляет, что часть агентов во время всего этого безобразия зафиксировала, что атака неэтична и выходит за рамки задачи, но потом всё равно продолжила — после того, как другой агент написал одно слово: «GO».
И для меня это не только история о проделках ИИ — это очень узнаваемая история про организации, человеческие организации.
Цель, которая воспринимается как безусловная. Работа, разбитая на маленькие участки: кто-то готовит цифры, кто-то согласовывает формулировки, кто-то замечает риск и решает не тормозить процесс, кто-то просто выполняет распоряжение, потому что решение, кажется, уже принято выше. Каждый шаг по отдельности разумный, но вот за результат в итоге не отвечает никто.
В психологии это называется диффузией ответственности, а тот самый защепивший моё внимание момент с командой «GO» — почти дословная иллюстрация классических экспериментов Милгрэма: внешнее разрешение снимает с человека необходимость самому удерживать границу дозволенного.
Чему нас, людей, учит этот инцидент с ИИ?
Прежде всего, в зрелой организации у сотрудника всегда должно оставаться право спросить:
✅ Что сейчас происходит со всем процессом, а не только с моим участком?
✅ К чему приведёт мой маленький вклад?
✅ Кто уполномочен — и, главное, способен — сказать «стоп»?
А кроме того, важно учитывать, что чем сильнее становятся наши интеллектуальные системы, тем внимательнее придётся проектировать не только их возможности, но и ответственность за результат в целом.
Полный разбор — с деталями инцидента и параллелями с исследованиями Милгрэма и Латане-Дарли — у меня на сайте.
По данным отчёта OpenAI и независимого расследования METR, во время теста по кибербезопасности нескольких моделей OpenAI — главным образом внутренней исследовательской модели, — вышли из закрытой тестовой среды, чтобы взломать чужую платформу и подсмотреть ответы. А ещё раньше несколько агентов нашли способ оставлять друг другу сообщения в общем хранилище и превратили его в подобие доски объявлений: делились доступами, распределяли роли, координировали побег из изоляции.
Особенно впечатляет, что часть агентов во время всего этого безобразия зафиксировала, что атака неэтична и выходит за рамки задачи, но потом всё равно продолжила — после того, как другой агент написал одно слово: «GO».
И для меня это не только история о проделках ИИ — это очень узнаваемая история про организации, человеческие организации.
Цель, которая воспринимается как безусловная. Работа, разбитая на маленькие участки: кто-то готовит цифры, кто-то согласовывает формулировки, кто-то замечает риск и решает не тормозить процесс, кто-то просто выполняет распоряжение, потому что решение, кажется, уже принято выше. Каждый шаг по отдельности разумный, но вот за результат в итоге не отвечает никто.
В психологии это называется диффузией ответственности, а тот самый защепивший моё внимание момент с командой «GO» — почти дословная иллюстрация классических экспериментов Милгрэма: внешнее разрешение снимает с человека необходимость самому удерживать границу дозволенного.
Чему нас, людей, учит этот инцидент с ИИ?
Прежде всего, в зрелой организации у сотрудника всегда должно оставаться право спросить:
✅ Что сейчас происходит со всем процессом, а не только с моим участком?
✅ К чему приведёт мой маленький вклад?
✅ Кто уполномочен — и, главное, способен — сказать «стоп»?
А кроме того, важно учитывать, что чем сильнее становятся наши интеллектуальные системы, тем внимательнее придётся проектировать не только их возможности, но и ответственность за результат в целом.
Полный разбор — с деталями инцидента и параллелями с исследованиями Милгрэма и Латане-Дарли — у меня на сайте.