Я периодически упоминаю в своих постах такую штуку как «mechanistic interpretability» – механистическая (механическая?) интерпретируемость. Термин звучит кошмарно, но приличного перевода на русский язык я не нашла. «Mechanistic interpretation» переводится как «механический смысл», и по аналогии, пожалуй, можно перевести «mechanistic interpretability» как «выявление механического смысла». Это область исследований, в которой ИИ разбирают на компоненты, чтобы понять, что конкретно в его архитектуре и каким образом влияет на результат его работы. Интерпретируемости в общем виде мы касались вот в этом посте.
Как это часто бывает в области ИИ, в этом термине есть некоторая неопределённость. Его много кто использует, причём в разных контекстах, и в итоге никто уже толком не может сказать, где механическая интерпретируемость, а где не механическая. Рассортировать этот словесный винегрет попытались авторы статьи «Mechanistic?», опубликованной в 2024 году.
Вот что они пишут.
«Механизм» здесь – это механизм причинно-следственных связей, поэтому в узком смысле механистическая интерпретируемость – это поиск закономерностей, по которым нейросеть преобразует входные данные в выходные данные. Пример использования механистической интерпретируемости в таком смысле – статья про «биологию языковых моделей». Там авторы используют специальные графы, чтобы проследить, как конкретное слово на входе возвращает конкретное слово на выходе.
Но есть и другие подходы, в рамках которых мы не лезем прям внутрь архитектуры, а, например, даём разные данные на вход и сравниваем выход. Тогда в более широком смысле механистическая интерпретируемость – это любое исследование работы внутренних компонентов модели, даже если оно не подразумевает «вскрытие».
Считается, что первым термин использовал Крис Ола (Chris Olah) с коллегами в цикле работ про модели машинного зрения, а потом он (термин, не исследователь) мигрировал в обработку естественного языка и попал к языковым моделям. И так вышло, что те, кто изучал языковые модели, и те, кто изучал машинное зрение, пошли разными путями – с одной стороны. С другой стороны, они независимо друг от друга переизобрели или друг у друга заимствовали некоторые методы.
Кроме того, сама идея проследить, что происходит с данными внутри моделей привлекла многих людей за пределами научного сообщества. Некоторое время эти люди собирались на отдельных форумах, чтобы обсуждать свои находки, и не публиковались в журналах. А те, кто публиковался в журналах, не знали про форумы. Когда они встретились, оказалось, что уже просто смысла нет выяснять, кто что изначально имел в виду, когда сказал «механистическая интерпретируемость».
Так что сейчас, когда люди используют этот термин, они обычно имеют в виду что-то вроде: «Я понимаю, что ИИ несёт в себе много рисков, и хочу подходить к его разработке и использованию ответственно,» – вот и всё.
В приложении к статье авторы отмечают: сейчас многие спорят про то, что значит «механистическая», но мы ещё не решили, что значит «интерпретируемость». И не только: конкретно в этой области с терминологией просто беда.
У меня ещё отдельно глаз дёргается от того, что «интерпретируемость» («interpretability») определяется как «поиск» или «выявление», то есть, действие. А это свойство, а действие – «интерпретация» («interpretation»). Впрочем, на фоне всего остального это уже мелочь.
Хорошенько подумав, я решила пока избегать вообще этого термина и других подобных с неопределённым содержанием. Буду стараться писать более конкретно: что взяли, что сделали. Хватит с нас вот этой всей путаницы
(Изображение сгенерировано с использованием ChatGPT)
Как это часто бывает в области ИИ, в этом термине есть некоторая неопределённость. Его много кто использует, причём в разных контекстах, и в итоге никто уже толком не может сказать, где механическая интерпретируемость, а где не механическая. Рассортировать этот словесный винегрет попытались авторы статьи «Mechanistic?», опубликованной в 2024 году.
Вот что они пишут.
«Механизм» здесь – это механизм причинно-следственных связей, поэтому в узком смысле механистическая интерпретируемость – это поиск закономерностей, по которым нейросеть преобразует входные данные в выходные данные. Пример использования механистической интерпретируемости в таком смысле – статья про «биологию языковых моделей». Там авторы используют специальные графы, чтобы проследить, как конкретное слово на входе возвращает конкретное слово на выходе.
Но есть и другие подходы, в рамках которых мы не лезем прям внутрь архитектуры, а, например, даём разные данные на вход и сравниваем выход. Тогда в более широком смысле механистическая интерпретируемость – это любое исследование работы внутренних компонентов модели, даже если оно не подразумевает «вскрытие».
Считается, что первым термин использовал Крис Ола (Chris Olah) с коллегами в цикле работ про модели машинного зрения, а потом он (термин, не исследователь) мигрировал в обработку естественного языка и попал к языковым моделям. И так вышло, что те, кто изучал языковые модели, и те, кто изучал машинное зрение, пошли разными путями – с одной стороны. С другой стороны, они независимо друг от друга переизобрели или друг у друга заимствовали некоторые методы.
Кроме того, сама идея проследить, что происходит с данными внутри моделей привлекла многих людей за пределами научного сообщества. Некоторое время эти люди собирались на отдельных форумах, чтобы обсуждать свои находки, и не публиковались в журналах. А те, кто публиковался в журналах, не знали про форумы. Когда они встретились, оказалось, что уже просто смысла нет выяснять, кто что изначально имел в виду, когда сказал «механистическая интерпретируемость».
Так что сейчас, когда люди используют этот термин, они обычно имеют в виду что-то вроде: «Я понимаю, что ИИ несёт в себе много рисков, и хочу подходить к его разработке и использованию ответственно,» – вот и всё.
В приложении к статье авторы отмечают: сейчас многие спорят про то, что значит «механистическая», но мы ещё не решили, что значит «интерпретируемость». И не только: конкретно в этой области с терминологией просто беда.
У меня ещё отдельно глаз дёргается от того, что «интерпретируемость» («interpretability») определяется как «поиск» или «выявление», то есть, действие. А это свойство, а действие – «интерпретация» («interpretation»). Впрочем, на фоне всего остального это уже мелочь.
Хорошенько подумав, я решила пока избегать вообще этого термина и других подобных с неопределённым содержанием. Буду стараться писать более конкретно: что взяли, что сделали. Хватит с нас вот этой всей путаницы
(Изображение сгенерировано с использованием ChatGPT)