Репост из: ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ
Не так давно Anthropic выложила своё исследование по рекурсивному самосовершенствованию When AI biulds itself, то есть процессу разработки ИИ, который всё больше делегируется самим ИИ-системам.
Эта тенденция указывает на перспективу создания систем, способных полностью автономно проектировать и обучать свои собственные версии-преемники. Хотя этот этап еще не достигнут и не гарантирован, он может наступить быстрее, чем ожидается, неся как колоссальную пользу для науки и здравоохранения, так и серьёзные риски потери человеческого контроля.
Ещё одной новацией в разработке автономных систем антропики считают J-Space — cпециализированный набор внутренних нейронных паттернов в языковой модели Claude, в котором при сложном рассуждении сходятся высокоуровневые потоки информации из разных областей. Буква «J» указывает на геометрический анализ на основе матрицы Якоби (Jacobian), который использовался для картирования того, как мелкие изменения во внутренних активациях модели распространяются и связываются друг с другом. J-space выступает функциональным аналогом теории глобального рабочего пространства (Global Workspace Theory, GWT) — концепции сознания человека, согласно которой специализированные неосознанные процессы мозга транслируют ключевую информацию в общее централизованное «рабочее пространство» для активного мышления, отделяя целенаправленное, «сознательно доступное» внутреннее рассуждение от автоматической, неосознанной обработки данных.
Почему нахождение этого пространства это так важно? J-space не был запрограммирован в Claude изначально, а сформировался органически в процессе обучения модели. Вместо анализа миллиардов отдельных нейронов у исследователей теперь есть локализованная высокоценная цель. Это позволяет отслеживать ход рассуждений, применять векторы управления и выявлять скрытое рассогласование (deceptive alignment) еще до того, как модель сгенерирует ответ. Хотя в Anthropic прямо заявляют, что открытие не доказывает наличие сознания у Claude, существование функционального аналога глобального рабочего пространства мешает просто отмахнуться от вопросов о субъективном опыте ИИ. Это уже побудило компанию разработать официальные правила в области благополучия моделей (Model Welfare).
Подробнее в моём саммари на сабстаке.
Демо J-Lens тут.
Полная версия исследования тут.
Эта тенденция указывает на перспективу создания систем, способных полностью автономно проектировать и обучать свои собственные версии-преемники. Хотя этот этап еще не достигнут и не гарантирован, он может наступить быстрее, чем ожидается, неся как колоссальную пользу для науки и здравоохранения, так и серьёзные риски потери человеческого контроля.
Ещё одной новацией в разработке автономных систем антропики считают J-Space — cпециализированный набор внутренних нейронных паттернов в языковой модели Claude, в котором при сложном рассуждении сходятся высокоуровневые потоки информации из разных областей. Буква «J» указывает на геометрический анализ на основе матрицы Якоби (Jacobian), который использовался для картирования того, как мелкие изменения во внутренних активациях модели распространяются и связываются друг с другом. J-space выступает функциональным аналогом теории глобального рабочего пространства (Global Workspace Theory, GWT) — концепции сознания человека, согласно которой специализированные неосознанные процессы мозга транслируют ключевую информацию в общее централизованное «рабочее пространство» для активного мышления, отделяя целенаправленное, «сознательно доступное» внутреннее рассуждение от автоматической, неосознанной обработки данных.
Почему нахождение этого пространства это так важно? J-space не был запрограммирован в Claude изначально, а сформировался органически в процессе обучения модели. Вместо анализа миллиардов отдельных нейронов у исследователей теперь есть локализованная высокоценная цель. Это позволяет отслеживать ход рассуждений, применять векторы управления и выявлять скрытое рассогласование (deceptive alignment) еще до того, как модель сгенерирует ответ. Хотя в Anthropic прямо заявляют, что открытие не доказывает наличие сознания у Claude, существование функционального аналога глобального рабочего пространства мешает просто отмахнуться от вопросов о субъективном опыте ИИ. Это уже побудило компанию разработать официальные правила в области благополучия моделей (Model Welfare).
Подробнее в моём саммари на сабстаке.
Демо J-Lens тут.
Полная версия исследования тут.