Репост из: DLStories
В июне, перед тем как уехать на ICML, а потом на подготовку к IOAI, я была учеником на школе ARENA (Alignment Research Engineer Accelerator). Это что-то вроде технической программы по AI Safety. Как я писала выше, я занимаюсь AI interpretability, что довольно сильно связано с AI Safety. Поэтому я пошла на ARENA, чтобы получше понять, что там происходит внутри AI Safety коммьюнити, познакомиться с людьми, которые делают рисерч по теме interpretability, и, возможно, найти себе fellowship или работу.
В итоге у меня сложилось довольно неоднозначное впечатление про коммьюнити AI Safety, но об этом как-нибудь потом. Пока что хотела написать вот о чем: ARENA длилась 5 недель, и в последнюю неделю мы в парах делали небольшие рисерч проекты. В итоге у меня и моего коллеги проект получился достаточно хорошим, с явными результатами, и поэтому мы решили немного его доделать и написать статью на воркшоп.
Ниже кратко опишу, о чем статья, а еще дам ссылку на HF daily papers, куда я ее сегодня выложила и теперь хочу лайки 🙂
Итак, статья: When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles
Activation Oracles (AO) — это языковые модели, обученные отвечать на вопросы о внутренних активациях другой модели на естественном языке. То есть, это один из подходов анализа активаций моделей, который выдает инфу в виде текста на естественном языке. У модели AO по сути спрашивают "о чём это скрытое состояние?", и AO генерирует ответ. Теперь: пусть у вас есть LLM, в которой есть какая-то скрытая информация — например, backdoor, скрытая цель или знание. Тогда естественно было бы предположить, что если обучить AO на активациях именно этой модели, то он хорошо научится считывать ее внутренние состояния и сможет легко найти эту скрытую информацию.
Так вот, в нашей статье мы показываем, что в реальности может получиться ровно наоборот. Мы взяли пять разных концептов и дообучили LLM скрывать эти концепты. Потом обучили AO на активациях этих моделей. Оказалось, что AO, обученный на активациях модели X, начинает хуже "видеть" именно тот концепт, который скрывала модель X. При этом если этому же AO скормить активации другой модели Y, то он хорошо распознает концепт, который скрывает Y.
Короче, вывод: в некоторых случаях обучение инструмента интерпретации (например, AO) на данных той самой модели, которую он должен интерпретировать, может сделать его систематически слепым именно к той информации, которая содержится в этой модели.
Ссылки:
Статья
HF daily papers (вот тут можно поставить лайк!)
В итоге у меня сложилось довольно неоднозначное впечатление про коммьюнити AI Safety, но об этом как-нибудь потом. Пока что хотела написать вот о чем: ARENA длилась 5 недель, и в последнюю неделю мы в парах делали небольшие рисерч проекты. В итоге у меня и моего коллеги проект получился достаточно хорошим, с явными результатами, и поэтому мы решили немного его доделать и написать статью на воркшоп.
Ниже кратко опишу, о чем статья, а еще дам ссылку на HF daily papers, куда я ее сегодня выложила и теперь хочу лайки 🙂
Итак, статья: When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles
Activation Oracles (AO) — это языковые модели, обученные отвечать на вопросы о внутренних активациях другой модели на естественном языке. То есть, это один из подходов анализа активаций моделей, который выдает инфу в виде текста на естественном языке. У модели AO по сути спрашивают "о чём это скрытое состояние?", и AO генерирует ответ. Теперь: пусть у вас есть LLM, в которой есть какая-то скрытая информация — например, backdoor, скрытая цель или знание. Тогда естественно было бы предположить, что если обучить AO на активациях именно этой модели, то он хорошо научится считывать ее внутренние состояния и сможет легко найти эту скрытую информацию.
Так вот, в нашей статье мы показываем, что в реальности может получиться ровно наоборот. Мы взяли пять разных концептов и дообучили LLM скрывать эти концепты. Потом обучили AO на активациях этих моделей. Оказалось, что AO, обученный на активациях модели X, начинает хуже "видеть" именно тот концепт, который скрывала модель X. При этом если этому же AO скормить активации другой модели Y, то он хорошо распознает концепт, который скрывает Y.
Короче, вывод: в некоторых случаях обучение инструмента интерпретации (например, AO) на данных той самой модели, которую он должен интерпретировать, может сделать его систематически слепым именно к той информации, которая содержится в этой модели.
Ссылки:
Статья
HF daily papers (вот тут можно поставить лайк!)