TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Data Blog

7 Jul, 21:44

Открыть в Telegram Поделиться Пожаловаться

J-Lens или Джи — значит Jacobian.

Вчера Anthropic выпустили блог пост про рабочее пространство J-workspace внутри Claude. Они соотнесли его с глубокими рассуждениями, скрытыми в голове человека обычно. Красивые аналогии есть в видео (я приложила ссылку ниже).

Качественный анализ любого сколь угодно сильного предположения требует львиную долю времени и я руководствуюсь тем, что никогда ни один метод не стоит принимать за чистую монету. Но метод очень красивый!

Отсюда репорчу логику метода, а также мысли авторов, делавших обзор на работу. И Боже упаси — бегите от желтой прессы, вроде «Ученые нашли сознание…».

Что: Jacobian-Space, найденный на основе J-Lens.

Как — собрала картинки (подробно также описано в статье, но мне всегда легче видеть пример на предложении). Движок метода — усредненный Якобиан. Идея — вытаскивать направления интересующего нас токена по словарю модели.

Как это происходит интуитивно:

Был у нас промпт: The capital of France is ?
Это все прошло через несколько (пусть 3) слоев.
Получилась генерация: The capital of France is ? Paris.
Генерация дала два токена.

Берём токен «?» на одном из ранних слоёв. Это токен, после которого на финальном представлении есть следующие — "Paris" и "." .

Внутри на этом слое есть какая-то координата 0.30 (обозначена за «country» ), координата 0.05 (обозначена за «capital»). Обозначения здесь — это истинные словесные описания координат после проекции через unembedding матрицу, но мы их не знаем. Если прочитать это в лоб в словарь (как делает Logit Lens), мы получим, что модель как будто думает про страну, а не про город.

Предложенный метод предлагает попробовать ответить на вопрос: если я чуть-чуть шевельну координату1 (обозначена за «country») на токене ?, как изменится финальная координата2 («capital») на позиции "Paris"? — это оч сложно осознать, но смотрите картинки!

Чтобы получить надёжное число, а не случайность предложения, вопрос задаётся многократно: для всех позиций во множестве разных промптов (не только "France", но и "Germany", "Japan" и т.д.), и для всех future-позиций, а не только для "Paris". Всё это усредняется в одну матрицу d_model x d_model — по сути движения в пространстве модели.

И так для каждого слоя.



Дальше просто умножаем матрички Якобианов на скрытые представления — J·h — и получаем новые, и делаем софтмакс по словарю.

Мысли, которые хочу выделить (просто хаотичные заметки):

1. У метода может быть много ложноположительных срабатываний. Многие концепты действительно тесно связаны с отдельными токенами словаря, поэтому использование словаря как способа идентификации концептов — полезная эвристика. Однако совершенно очевидно, что подобный подход будет пропускать множество внутренних представлений.

2. Преимущество метода — вербализуемые концепты — то есть те внутренние представления, которые соответствуют понятиям человеческого языка. Это удобно.

3. Как стоит оценивать метод (цитата Нила Нанды): «Почему J-Lens достаточно хорошо совпадает с тем, как модель действительно мыслит, чтобы быть практически полезным инструментом?»

4. Отличие от простой линейной аппроксимации (Tuned Lens)

Что делает линейная регрессия? Линейная регрессия отвечает примерно на следующий вопрос: «Если модель находится в состоянии, где она думает о , то о чём она, вероятнее всего, будет думать на последнем слое?»

Проблема: такой подход автоматически включает множество коррелирующих понятий.

Что делает якобиан? Если заставить модель думать об этом концепте совсем немного сильнее, что она станет немного более склонна сказать?»

Полезные ссылки:

Репликация результатов на Qwen3.6-27B: Neuropedia
Интуитивное описание без единой формулы: красивый YouTube
Полный текст: AnthropicPaper
Независимые ревью: Док с группой исследователей, отдельно ревью от Neel Nanda (классный исследователь)
Якобиан
определитель матрицы Якоби

1.6k 1 26 3 15
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot