Репост из: Data Secrets
Зацените иллюстрацию к новой статье журнала WSJ про элаймент
Статья называется «ИИ учится сбегать от человеческого контроля» и посвящена свежему исследованию от Palisade AI, о котором мы подробно рассказывали тут.
Если коротко, в этом исследовании впервые был официально зафиксирован случай, когда модель явно нарушила человеческие инструкции в пользу собственных «интересов».
Ну в общем журналисты, конечно, переполошились и написали что модели «имитируют элаймент на тестах, а затем все равно возвращаются к опасным действиям: врут, пытаются копировать свои веса и саботировать».
Но в целом вывод в статье верный: нам нужно больше внимания уделять элайменту. Это ключ к безопасным ассистентам.
Художнику респект
Статья называется «ИИ учится сбегать от человеческого контроля» и посвящена свежему исследованию от Palisade AI, о котором мы подробно рассказывали тут.
Если коротко, в этом исследовании впервые был официально зафиксирован случай, когда модель явно нарушила человеческие инструкции в пользу собственных «интересов».
Ну в общем журналисты, конечно, переполошились и написали что модели «имитируют элаймент на тестах, а затем все равно возвращаются к опасным действиям: врут, пытаются копировать свои веса и саботировать».
Но в целом вывод в статье верный: нам нужно больше внимания уделять элайменту. Это ключ к безопасным ассистентам.
Художнику респект