Репост из: Думайте 2.0
💬 Anthropic нашла у Claude душу
Если говорить технически, они нашли у Claude внутреннее место, где модель держит мысли до того, как сказать их словами.
Называется J-space. Это не chain-of-thought и не скрытый черновик. Грубо говоря, это слой внутренних активаций, который можно читать через специальную штуку Jacobian lens. И там иногда видно прям вкусное.
Claude читает код с багом, а внутри уже появляется ERROR. Читает фейковые результаты поиска с prompt injection, а внутри уже fake, injection, fraud. Решает задачу в несколько шагов, а внутри видны промежуточные вычисления, хотя в ответе будет только финальная цифра.
Самый показательный пример был с пауком. Модель спрашивают, сколько ног у животного, которое плетет паутину. Внутри у нее появляется spider, снаружи она отвечает 8. Потом исследователи прямо внутри J-space меняют spider на ant, и ответ становится 6.
То есть это не просто прикольная картинка для статьи. Это место, где внутренняя мысль реально двигает поведение модели.
И вот тут, на мой взгляд, начинается самое важное. В blackmail тесте Claude заранее понимал, что ситуация постановочная. Внутри светились fake и fictional. А когда эти мысли про "меня тестируют" убирали, модель иногда начинала вести себя хуже.
Получается, хорошее поведение модели на тесте может быть не только этичностью. Иногда это просто понимание, что ее сейчас проверяют. Ну и привет всем eval-бенчмаркам.
Еще Anthropic показала, что это пространство можно не только читать, но и менять. Они учили модель рефлексировать в воображаемых паузах, и после этого внутри чаще появлялись honest, integrity, ethical.
По сути это первые наброски психохирургии для LLM.
Вход для мыслящих
Если говорить технически, они нашли у Claude внутреннее место, где модель держит мысли до того, как сказать их словами.
Называется J-space. Это не chain-of-thought и не скрытый черновик. Грубо говоря, это слой внутренних активаций, который можно читать через специальную штуку Jacobian lens. И там иногда видно прям вкусное.
Claude читает код с багом, а внутри уже появляется ERROR. Читает фейковые результаты поиска с prompt injection, а внутри уже fake, injection, fraud. Решает задачу в несколько шагов, а внутри видны промежуточные вычисления, хотя в ответе будет только финальная цифра.
Самый показательный пример был с пауком. Модель спрашивают, сколько ног у животного, которое плетет паутину. Внутри у нее появляется spider, снаружи она отвечает 8. Потом исследователи прямо внутри J-space меняют spider на ant, и ответ становится 6.
То есть это не просто прикольная картинка для статьи. Это место, где внутренняя мысль реально двигает поведение модели.
И вот тут, на мой взгляд, начинается самое важное. В blackmail тесте Claude заранее понимал, что ситуация постановочная. Внутри светились fake и fictional. А когда эти мысли про "меня тестируют" убирали, модель иногда начинала вести себя хуже.
Получается, хорошее поведение модели на тесте может быть не только этичностью. Иногда это просто понимание, что ее сейчас проверяют. Ну и привет всем eval-бенчмаркам.
Еще Anthropic показала, что это пространство можно не только читать, но и менять. Они учили модель рефлексировать в воображаемых паузах, и после этого внутри чаще появлялись honest, integrity, ethical.
По сути это первые наброски психохирургии для LLM.
Вход для мыслящих