J-Lens или Джи — значит Jacobian.
Вчера Anthropic выпустили блог пост про рабочее пространство J-workspace внутри Claude. Они соотнесли его с глубокими рассуждениями, скрытыми в голове человека обычно. Красивые аналогии есть в видео (я приложила ссылку ниже).
Качественный анализ любого сколь угодно сильного предположения требует львиную долю времени и я руководствуюсь тем, что никогда ни один метод не стоит принимать за чистую монету. Но метод очень красивый!
Отсюда репорчу логику метода, а также мысли авторов, делавших обзор на работу. И Боже упаси — бегите от желтой прессы, вроде «Ученые нашли сознание…».
Что: Jacobian-Space, найденный на основе J-Lens.
Как — собрала картинки (подробно также описано в статье, но мне всегда легче видеть пример на предложении). Движок метода — усредненный Якобиан. Идея — вытаскивать направления интересующего нас токена по словарю модели.
Как это происходит интуитивно:
Дальше просто умножаем матрички Якобианов на скрытые представления — J·h — и получаем новые, и делаем софтмакс по словарю.
Мысли, которые хочу выделить (просто хаотичные заметки):
1. У метода может быть много ложноположительных срабатываний. Многие концепты действительно тесно связаны с отдельными токенами словаря, поэтому использование словаря как способа идентификации концептов — полезная эвристика. Однако совершенно очевидно, что подобный подход будет пропускать множество внутренних представлений.
2. Преимущество метода — вербализуемые концепты — то есть те внутренние представления, которые соответствуют понятиям человеческого языка. Это удобно.
3. Как стоит оценивать метод (цитата Нила Нанды): «Почему J-Lens достаточно хорошо совпадает с тем, как модель действительно мыслит, чтобы быть практически полезным инструментом?»
4. Отличие от простой линейной аппроксимации (Tuned Lens)
Что делает линейная регрессия? Линейная регрессия отвечает примерно на следующий вопрос: «Если модель находится в состоянии, где она думает о , то о чём она, вероятнее всего, будет думать на последнем слое?»
Проблема: такой подход автоматически включает множество коррелирующих понятий.
Что делает якобиан? Если заставить модель думать об этом концепте совсем немного сильнее, что она станет немного более склонна сказать?»
Полезные ссылки:
Репликация результатов на Qwen3.6-27B: Neuropedia
Интуитивное описание без единой формулы: красивый YouTube
Полный текст: AnthropicPaper
Независимые ревью: Док с группой исследователей, отдельно ревью от Neel Nanda (классный исследователь)
Вчера Anthropic выпустили блог пост про рабочее пространство J-workspace внутри Claude. Они соотнесли его с глубокими рассуждениями, скрытыми в голове человека обычно. Красивые аналогии есть в видео (я приложила ссылку ниже).
Качественный анализ любого сколь угодно сильного предположения требует львиную долю времени и я руководствуюсь тем, что никогда ни один метод не стоит принимать за чистую монету. Но метод очень красивый!
Отсюда репорчу логику метода, а также мысли авторов, делавших обзор на работу. И Боже упаси — бегите от желтой прессы, вроде «Ученые нашли сознание…».
Что: Jacobian-Space, найденный на основе J-Lens.
Как — собрала картинки (подробно также описано в статье, но мне всегда легче видеть пример на предложении). Движок метода — усредненный Якобиан. Идея — вытаскивать направления интересующего нас токена по словарю модели.
Как это происходит интуитивно:
Был у нас промпт: The capital of France is ?
Это все прошло через несколько (пусть 3) слоев.
Получилась генерация: The capital of France is ? Paris.
Генерация дала два токена.
Берём токен «?» на одном из ранних слоёв. Это токен, после которого на финальном представлении есть следующие — "Paris" и "." .
Внутри на этом слое есть какая-то координата 0.30 (обозначена за «country» ), координата 0.05 (обозначена за «capital»). Обозначения здесь — это истинные словесные описания координат после проекции через unembedding матрицу, но мы их не знаем. Если прочитать это в лоб в словарь (как делает Logit Lens), мы получим, что модель как будто думает про страну, а не про город.
Предложенный метод предлагает попробовать ответить на вопрос: если я чуть-чуть шевельну координату1 (обозначена за «country») на токене ?, как изменится финальная координата2 («capital») на позиции "Paris"? — это оч сложно осознать, но смотрите картинки!
Чтобы получить надёжное число, а не случайность предложения, вопрос задаётся многократно: для всех позиций во множестве разных промптов (не только "France", но и "Germany", "Japan" и т.д.), и для всех future-позиций, а не только для "Paris". Всё это усредняется в одну матрицу d_model x d_model — по сути движения в пространстве модели.
И так для каждого слоя.
Дальше просто умножаем матрички Якобианов на скрытые представления — J·h — и получаем новые, и делаем софтмакс по словарю.
Мысли, которые хочу выделить (просто хаотичные заметки):
1. У метода может быть много ложноположительных срабатываний. Многие концепты действительно тесно связаны с отдельными токенами словаря, поэтому использование словаря как способа идентификации концептов — полезная эвристика. Однако совершенно очевидно, что подобный подход будет пропускать множество внутренних представлений.
2. Преимущество метода — вербализуемые концепты — то есть те внутренние представления, которые соответствуют понятиям человеческого языка. Это удобно.
3. Как стоит оценивать метод (цитата Нила Нанды): «Почему J-Lens достаточно хорошо совпадает с тем, как модель действительно мыслит, чтобы быть практически полезным инструментом?»
4. Отличие от простой линейной аппроксимации (Tuned Lens)
Что делает линейная регрессия? Линейная регрессия отвечает примерно на следующий вопрос: «Если модель находится в состоянии, где она думает о , то о чём она, вероятнее всего, будет думать на последнем слое?»
Проблема: такой подход автоматически включает множество коррелирующих понятий.
Что делает якобиан? Если заставить модель думать об этом концепте совсем немного сильнее, что она станет немного более склонна сказать?»
Полезные ссылки:
Репликация результатов на Qwen3.6-27B: Neuropedia
Интуитивное описание без единой формулы: красивый YouTube
Полный текст: AnthropicPaper
Независимые ревью: Док с группой исследователей, отдельно ревью от Neel Nanda (классный исследователь)