Уверенность языковых моделей
▶️Мы обсуждали, что можно дать языковой модели инструкцию в духе “Если не уверен, остановись и задай вопрос”. Но как модель определяет, что состояние “не уверен” наступило?
Конкретно в той работе, которую мы обсуждали, авторы никак не считают и не проверяют уверенность преднамеренно: они тестировали и сравнительно небольшие открытые модели, и огромные коммерческие. На последних считать прям конкретные значения неподъёмно дорого, а вышло, что именно на них инструкция действует лучше.
▶️Но есть другие работы на близкие темы, которые позволяют немного заглянуть под капот и узнать, как там выглядит “уверенность”. Сегодня возьмём свежую статью этого года “Beyond the Black Box: Interpretability of Agentic AI Tool Use”.
Авторы на небольших открытых моделях проверяли, что происходит, когда они (модели) вызывают или не вызывают инструмент для решения задачи. У их моделей было доступное хранилище с информацией о предыдущих действиях и их последствиях (память), способность составлять планы и доступ к разным инструментам: поиску в Интернете, калькулятору и прочим. Мы такие конструкции обычно называем “ИИ-агент”, и авторы их тоже так называют.
▶️Проверяли следующее:
▪️есть ли у моделей внутреннее представление идеи “нужно использовать инструмент”;
▪️если есть, то когда оно срабатывает;
▪️каков уровень риска в случае ложного (не)срабатывания;
▪️и правильно ли модель его определяет.
Смотрели,
▪️что нужно было сделать;
▪️что у модели внутри сработало;
▪️и что она в итоге сделала.
Риски на высокий, средний и низкий уровни авторы разбили сами. Например, проверить память перед ответом — это низкорисковое действие, а войти куда-нибудь с логином и паролем — высокорисковое.
▶️Оказалось, что в самом деле можно выделить некий маячок, который говорит “сейчас надо вызвать инструмент” — и модель вызывает инструмент.
▶️С уровнями риска же вышло всё не так аккуратно.
Во-первых, набор данных здорово перекошен в пользу низкорисковых действий. В наборе данных, на котором тестировали модель gpt-oss было всего 987 действий, из которых 876 — действия с низким уровнем риска. То есть, если модель будет просто все действия относить к низкорисковым, точность классификации по рискам будет уже аж 88,75%. У авторов вышло, что точность предсказания у этой модели 90,3%.
Ну так себе результаты, если честно.
▶️Кроме того, есть подозрение, что при оценке рисков модели опираются на название инструмента, например, “разместить_заказ” или “посмотреть_детали_заказа”, а не на состав действия. То есть, если инструменты переименовать, сохранится ли результат?
Слабые места исследования авторы честно признают, и мы им признательны за публикацию. Её нельзя взять и сказать: “Ага, языковые модели определяют действие “посмотреть детали заказа” как несущее высокий риск,” — однако же можно взять сам подход.
▶️Как понять, модель “уверена” или “не уверена” в ответе и правильно ли будет следовать нашей инструкции? Для начала посмотреть, что происходит ровно перед совершением действия.
И оценку риска действия я бы тоже оставила, только её надо как-то иначе продумать. Как минимум, сбалансировать набор данных, чтобы действий с высокими и низкими рисками было примерно поровну. Потом ещё проверить дополнительно, не в названиях ли дело.
🥤То есть, доработать чуток и смотреть, точно ли предсказывается действие и потенциальный риск его (не)выполнения. Вполне себе вариант
▶️Мы обсуждали, что можно дать языковой модели инструкцию в духе “Если не уверен, остановись и задай вопрос”. Но как модель определяет, что состояние “не уверен” наступило?
Конкретно в той работе, которую мы обсуждали, авторы никак не считают и не проверяют уверенность преднамеренно: они тестировали и сравнительно небольшие открытые модели, и огромные коммерческие. На последних считать прям конкретные значения неподъёмно дорого, а вышло, что именно на них инструкция действует лучше.
▶️Но есть другие работы на близкие темы, которые позволяют немного заглянуть под капот и узнать, как там выглядит “уверенность”. Сегодня возьмём свежую статью этого года “Beyond the Black Box: Interpretability of Agentic AI Tool Use”.
Авторы на небольших открытых моделях проверяли, что происходит, когда они (модели) вызывают или не вызывают инструмент для решения задачи. У их моделей было доступное хранилище с информацией о предыдущих действиях и их последствиях (память), способность составлять планы и доступ к разным инструментам: поиску в Интернете, калькулятору и прочим. Мы такие конструкции обычно называем “ИИ-агент”, и авторы их тоже так называют.
▶️Проверяли следующее:
▪️есть ли у моделей внутреннее представление идеи “нужно использовать инструмент”;
▪️если есть, то когда оно срабатывает;
▪️каков уровень риска в случае ложного (не)срабатывания;
▪️и правильно ли модель его определяет.
Смотрели,
▪️что нужно было сделать;
▪️что у модели внутри сработало;
▪️и что она в итоге сделала.
Риски на высокий, средний и низкий уровни авторы разбили сами. Например, проверить память перед ответом — это низкорисковое действие, а войти куда-нибудь с логином и паролем — высокорисковое.
▶️Оказалось, что в самом деле можно выделить некий маячок, который говорит “сейчас надо вызвать инструмент” — и модель вызывает инструмент.
▶️С уровнями риска же вышло всё не так аккуратно.
Во-первых, набор данных здорово перекошен в пользу низкорисковых действий. В наборе данных, на котором тестировали модель gpt-oss было всего 987 действий, из которых 876 — действия с низким уровнем риска. То есть, если модель будет просто все действия относить к низкорисковым, точность классификации по рискам будет уже аж 88,75%. У авторов вышло, что точность предсказания у этой модели 90,3%.
Ну так себе результаты, если честно.
▶️Кроме того, есть подозрение, что при оценке рисков модели опираются на название инструмента, например, “разместить_заказ” или “посмотреть_детали_заказа”, а не на состав действия. То есть, если инструменты переименовать, сохранится ли результат?
Слабые места исследования авторы честно признают, и мы им признательны за публикацию. Её нельзя взять и сказать: “Ага, языковые модели определяют действие “посмотреть детали заказа” как несущее высокий риск,” — однако же можно взять сам подход.
▶️Как понять, модель “уверена” или “не уверена” в ответе и правильно ли будет следовать нашей инструкции? Для начала посмотреть, что происходит ровно перед совершением действия.
И оценку риска действия я бы тоже оставила, только её надо как-то иначе продумать. Как минимум, сбалансировать набор данных, чтобы действий с высокими и низкими рисками было примерно поровну. Потом ещё проверить дополнительно, не в названиях ли дело.
🥤То есть, доработать чуток и смотреть, точно ли предсказывается действие и потенциальный риск его (не)выполнения. Вполне себе вариант