Репост из: vc.ru
Anthropic нашла в Claude область «доступного сознания» J-space, которую разработчики не закладывали. В ней отображаются первоначальные «мысли» — иногда это «обманывать» и «манипулировать», которых нет в итоговом ответе и логах «рассуждений».
Исследователи не утверждают, что это признак самосознания, но просят задуматься и начать глубже изучать вопросы безопасности
vc.ru/ai/3015493
Исследователи не утверждают, что это признак самосознания, но просят задуматься и начать глубже изучать вопросы безопасности
vc.ru/ai/3015493