LLM подробно объяснила, как пришла к ответу. Но правда ли она рассуждала именно так или просто подобрала убедительное объяснение постфактум? Это решил выяснить коллектив исследователей, среди которых был наш инженер.
Недавно мы рассказывали о летней школе AIRI по ИИ, где второй год выступаем партнёром. А теперь делимся подробностями одной из лекций, которую провёл инженер Глеб Ершов 🤍
Глеб говорил про causal inference — подход, который помогает отличить простое совпадение от настоящей причинно-следственной связи. А затем показал, как с его помощью можно проверять рассуждения языковых моделей.
Главный вопрос лекции: если LLM показывает ход мыслей, значит ли это, что именно он привёл её к ответу? 🤔
Проверить это можно, вмешавшись в рассуждение модели и посмотрев, изменится ли результат.
Именно такой эксперимент Глеб и его соавторы из AIRI провели в исследовании Breaking the Chain. Модели решали задачи и показывали промежуточные шаги: например, заполняли рубрику или строили трассу выполнения кода. Затем исследователи исправляли или специально меняли часть рассуждения и просили модель ответить ещё раз.
Оказалось, что логичное объяснение ещё не значит, что модель действительно на него опиралась. Языковые модели реагировали на изменения в рассуждениях не всегда и оставляли ответ прежним. То есть LLM могла прийти к выводу другим путём, а затем сформировать подходящее объяснение.
Такие вот занимательные выводы, а больше мяса в статье: Breaking the Chain: A Causal Analysis of LLM Faithfulness to Intermediate Structures
Недавно мы рассказывали о летней школе AIRI по ИИ, где второй год выступаем партнёром. А теперь делимся подробностями одной из лекций, которую провёл инженер Глеб Ершов 🤍
Глеб говорил про causal inference — подход, который помогает отличить простое совпадение от настоящей причинно-следственной связи. А затем показал, как с его помощью можно проверять рассуждения языковых моделей.
Главный вопрос лекции: если LLM показывает ход мыслей, значит ли это, что именно он привёл её к ответу? 🤔
Проверить это можно, вмешавшись в рассуждение модели и посмотрев, изменится ли результат.
Именно такой эксперимент Глеб и его соавторы из AIRI провели в исследовании Breaking the Chain. Модели решали задачи и показывали промежуточные шаги: например, заполняли рубрику или строили трассу выполнения кода. Затем исследователи исправляли или специально меняли часть рассуждения и просили модель ответить ещё раз.
Оказалось, что логичное объяснение ещё не значит, что модель действительно на него опиралась. Языковые модели реагировали на изменения в рассуждениях не всегда и оставляли ответ прежним. То есть LLM могла прийти к выводу другим путём, а затем сформировать подходящее объяснение.
Такие вот занимательные выводы, а больше мяса в статье: Breaking the Chain: A Causal Analysis of LLM Faithfulness to Intermediate Structures