Новое пространство рассуждений или новый инструмент для AI safety
▫️ 6 июля Anthropic выпустили работу про J-Space — внутреннее пространство вербализуемых (то есть — переводимых в слова) представлений в Claude, которое можно частично читать. Пространство названо в честь нового метода, который и является движком нахождения этого пространства — J-Lens.
Верхнеуровнево идея в том, чтобы вместо вопроса: «На какой токен похож hidden state сейчас?» — как делают некоторые другие Lens-подобные методы, а смотреть на очень маленькую динамику: если немного изменить внутреннее состояние модели сейчас, какие будущие слова и концепты изменятся потом?
▫️И если слово «очень маленький» вызвало у вас воспоминание о школьной производной — да! Для ответа на вопрос используется усреднённый якобиан — матрица локальных производных, показывающая, как изменения в одном слое влияют на будущие выходы.
Мы не могли упустить это, ибо и авторы подсветили — метод важен для safety.
Модель может не писать явно (а зачем ей это делать?), что распознала prompt injection, что считает контекст подозрительным, что заметила evaluation setting или что удерживает некоторый план. Но такие представления могут быть видны в J-Space — ведь бесконечно малые отражают динамику. Грубо говоря, «что трясется внутри модели быстрее всего».
В работе приводятся примеры, где J-Lens помогает обнаруживать внутренние концепты (представленные в виде токенов—слов) вроде:
fake
injection
deception
blackmail
self-preservation
evaluation
Конечно, это не значит, что появление токена и то, что мы его увидели, доказывает намерение модели. Например, deception может означать, что модель распознала обман в задаче, а не что она сама собирается обманывать. Поэтому J-Lens нельзя воспринимать как «детектор злых намерений», но можно — как инструмент генерации гипотез для аудита моделей.
▫️Читать технические детали AnthropicPaper
◾️Видео-тизер от Anthropic: YouTube
▫️Технические детали коротко с математикой метода, формулами и интуицией: в канале R&D Lead Research направления — Сабрины
▫️ 6 июля Anthropic выпустили работу про J-Space — внутреннее пространство вербализуемых (то есть — переводимых в слова) представлений в Claude, которое можно частично читать. Пространство названо в честь нового метода, который и является движком нахождения этого пространства — J-Lens.
Верхнеуровнево идея в том, чтобы вместо вопроса: «На какой токен похож hidden state сейчас?» — как делают некоторые другие Lens-подобные методы, а смотреть на очень маленькую динамику: если немного изменить внутреннее состояние модели сейчас, какие будущие слова и концепты изменятся потом?
▫️И если слово «очень маленький» вызвало у вас воспоминание о школьной производной — да! Для ответа на вопрос используется усреднённый якобиан — матрица локальных производных, показывающая, как изменения в одном слое влияют на будущие выходы.
Мы не могли упустить это, ибо и авторы подсветили — метод важен для safety.
Модель может не писать явно (а зачем ей это делать?), что распознала prompt injection, что считает контекст подозрительным, что заметила evaluation setting или что удерживает некоторый план. Но такие представления могут быть видны в J-Space — ведь бесконечно малые отражают динамику. Грубо говоря, «что трясется внутри модели быстрее всего».
В работе приводятся примеры, где J-Lens помогает обнаруживать внутренние концепты (представленные в виде токенов—слов) вроде:
fake
injection
deception
blackmail
self-preservation
evaluation
Конечно, это не значит, что появление токена и то, что мы его увидели, доказывает намерение модели. Например, deception может означать, что модель распознала обман в задаче, а не что она сама собирается обманывать. Поэтому J-Lens нельзя воспринимать как «детектор злых намерений», но можно — как инструмент генерации гипотез для аудита моделей.
▫️Читать технические детали AnthropicPaper
◾️Видео-тизер от Anthropic: YouTube
▫️Технические детали коротко с математикой метода, формулами и интуицией: в канале R&D Lead Research направления — Сабрины