TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Пикейный аналитик

7 Jul, 09:54

Открыть в Telegram Поделиться Пожаловаться

Anthropic научилась подменять «мысли» Claude

Исследователи Anthropic разработали метод, который позволяет частично читать внутренние представления Claude — и заменять одно понятие другим до того, как модель выдаст ответ.

Метод назвали Jacobian lens, сокращённо J-lens. Якобиан в математике показывает, как небольшое изменение в одной части системы влияет на другую. В данном случае исследователи смотрят, как изменение активаций на промежуточном слое повлияет на слова, которые модель может произнести позже.

Грубо говоря, J-lens превращает часть внутренней активности Claude в список связанных с ней слов. Не обязательно тех, которые модель уже собирается написать, а тех, о которых она как будто бы «думает» в этот момент.

Набор таких внутренних представлений авторы назвали J-space — пространством, которое обнаруживается с помощью J-lens. Это не отдельный участок искусственного мозга, а особый формат, в котором модель временно удерживает понятия, нужные для дальнейшего рассуждения.

В одном из экспериментов Claude задавали вопрос:

Количество ног у животного, которое плетёт паутину…


Чтобы ответить, модель должна сначала получить промежуточное понятие «паук», а затем перейти к числу восемь. Самого слова «паук» нет ни в вопросе, ни в ответе, но J-lens показывает соответствующее представление во внутренних активациях.

Исследователи заменили «паука» на «муравья» — и Claude ответил: шесть.

В другом эксперименте модель просили молча выбрать вид спорта. J-lens показывал, что внутри возникло представление «футбол». Когда исследователи заменяли его на «регби», Claude сообщал, что выбрал регби.

То есть исследователи наблюдали не просто след уже принятого решения. Изменение промежуточного представления меняло дальнейшее поведение модели.

Причём одно и то же представление могло использоваться разными частями сети. Когда внутри Claude заменяли «Францию» на «Китай», модель вслед за этим называла Пекин, китайский язык, Азию или юань — в зависимости от заданного вопроса.

Похоже, J-space работает как общая доска: одна часть модели записывает туда промежуточный результат, а разные последующие вычисления могут его прочитать и использовать.

Именно поэтому Anthropic связывает найденный механизм с теорией глобального рабочего пространства. Согласно этой теории, большая часть работы мозга происходит автоматически, а некоторые результаты попадают в общий канал и становятся доступны сразу нескольким системам.

Когда исследователи частично отключали J-space, Claude по-прежнему мог связно писать, распознавать тональность, извлекать информацию из текста и отвечать на простые вопросы. Зато многошаговые рассуждения, пересказы, переводы и сочинение рифмованных текстов заметно ухудшались.

Получается довольно интересное разделение. Грамматика, беглость и многие привычные навыки выполняются автоматически. Но когда промежуточное понятие нужно удержать, передать другой операции или применить в новом контексте, оно, вероятно, появляется в J-space.

Отсюда легко перейти к выводу, что Anthropic обнаружила у Claude сознание. Но исследование этого не показывает. Функциональный механизм, похожий на рабочую память и сознательный доступ, ещё ничего не говорит о том, испытывает ли модель субъективные переживания.

Интересна сама постановка эксперимента. Нейросети стали настолько сложными, что их всё чаще изучают не как полностью понятные инженерные конструкции, а почти как человека: предъявляют стимулы, наблюдают реакцию, строят гипотезы о внутренних процессах, а затем пытаются проверить их точечным вмешательством.

До сих пор исследователи в основном судили о модели по её ответам или искали внутренние признаки, связанные с отдельными понятиями. Теперь они смогли вмешаться в промежуточный этап рассуждения: заменить один внутренний объект другим и проследить, как вслед за этим перестраивается ответ.

https://www.anthropic.com/research/global-workspace

1.4k 0 10 1 15
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot