Anthropic нашли в LLM аналог того, что нейронаука связывает с сознательным доступом
Исследователи обнаружили, что у Клода сформировалась небольшая коллекция внутренних нейронных паттернов, которые играют особую роль по сравнению со всей остальной внутренней обработкой.
Аnthropic назвали её J-space по названию метода, основанного на математическом понятии якобиана.
Причём метод проверен не только на Клоде, но и на открытых моделях - Qwen и Gemma. Вы можете с этим поиграться тут.
Модель может докладывать о содержимом этого пространства. Оно активируется намеренно по инструкции и причинно влияет на многошаговые рассуждения: уберёшь паттерн- поведение меняется предсказуемо.
Одна репрезентация в J-space считывается несколькими независимыми вычислениями одновременно. И активируется оно избирательно только при сложном, гибком поведении, не при автоматическом.
Это структурно напоминает то, что теория глобального рабочего пространства Баарса предсказывает для мозга: узкий канал с широким вещанием, через который информация становится глобально доступной.
Сами авторы аккуратны в формулировках и пишут так: «reminiscent of», «analogous to». Феноменальное сознание, квалиа, «каково это изнутри» - paper этого не касается и не претендует касаться.
Теория глобального рабочего пространства сама по себе остаётся спорной даже применительно к мозгу.
Практическое применение - мониторинг скрытых намерений.
В экспериментах J-space показывал слова «fake», «manipulation», «secretly» ещё до того, как модель совершала нечестное действие. Это работающий прототип инструмента надзора за агентным поведением.
J-space не отвечает на вопрос о сознании. Но впервые показывает, где внутри модели искать ответ.
Мнение экспертов из разных сфер можно прочитать тут.
Исследователи обнаружили, что у Клода сформировалась небольшая коллекция внутренних нейронных паттернов, которые играют особую роль по сравнению со всей остальной внутренней обработкой.
Аnthropic назвали её J-space по названию метода, основанного на математическом понятии якобиана.
Причём метод проверен не только на Клоде, но и на открытых моделях - Qwen и Gemma. Вы можете с этим поиграться тут.
Модель может докладывать о содержимом этого пространства. Оно активируется намеренно по инструкции и причинно влияет на многошаговые рассуждения: уберёшь паттерн- поведение меняется предсказуемо.
Одна репрезентация в J-space считывается несколькими независимыми вычислениями одновременно. И активируется оно избирательно только при сложном, гибком поведении, не при автоматическом.
Это структурно напоминает то, что теория глобального рабочего пространства Баарса предсказывает для мозга: узкий канал с широким вещанием, через который информация становится глобально доступной.
Сами авторы аккуратны в формулировках и пишут так: «reminiscent of», «analogous to». Феноменальное сознание, квалиа, «каково это изнутри» - paper этого не касается и не претендует касаться.
Теория глобального рабочего пространства сама по себе остаётся спорной даже применительно к мозгу.
Практическое применение - мониторинг скрытых намерений.
В экспериментах J-space показывал слова «fake», «manipulation», «secretly» ещё до того, как модель совершала нечестное действие. Это работающий прототип инструмента надзора за агентным поведением.
J-space не отвечает на вопрос о сознании. Но впервые показывает, где внутри модели искать ответ.
Мнение экспертов из разных сфер можно прочитать тут.