Что в «рассуждениях» языковых моделей действительно важно?
Статья, про которую я вам расскажу сегодня, называется «Thought Anchors: Which LLM Reasoning Steps Matter?».
Этот текст далеко не всегда отражает то, что модель на самом деле делает, однако есть немало работ, которые всё равно извлекают из него пользу. В нём можно, например, найти и исправить ошибки в подходе к решению.
Авторы сегодняшней статьи пошли дальше и решили не читать текст, а рассчитать, каково влияние каждого сгенерированного предложения на окончательный ответ. Они даже сделали инструмент, который находится в открытом доступе и в котором можно выбрать модель и задачу, а потом посмотреть анализ влияния на результат каждого сгенерированного ей предложения рассуждений. Но прежде, чем вы к нему обратитесь, давайте я расскажу, в чём идея и как всё работает.
▶️Во-первых, они рассчитывают значимость каждого предложения: убирают его из последовательности рассуждений и считают, как изменилась точность ответа. Если конкретнее, то они останавливают генерацию текста на конкретном моменте и заставляют модель переписать всю последующую цепочку рассуждений заново.
▪️Например, нужно посчитать значимость третьего предложения. Они берут сгенерированный ответ, извлекают из него первые два предложения и передают их модели, чтобы она продолжила генерацию.
Таких генераций делают сразу сто штук и отбирают из них те, в которых на третьей позиции получилось предложение, непохожее на то, что было изначально: так можно как раз проверить, важно ли было третье предложение и изменится ли траектория рассуждений, если его не будет.
▶️Во-вторых, они разбили все предложения на восемь групп:
▪️постановка задачи;
▪️планирование;
▪️называние конкретного факта;
▪️вычисления;
▪️выражение неопределённости;
▪️подведение итогов;
▪️самопроверка;
▪️окончательный ответ.
Предложения, которые относились к планированию, в среднем имели большее значение, чем остальные. Наименьшее значение имели предложение, относящиеся к вычислениям (неожиданно) и подведению итогов (ожидаемо).
▶️В-третьих, они изучили, какой вес присваивают разным предложениям механизмы внимания.
Вкратце, механизм внимания – это функция, которая на выходе формирует матрицу, на которую умножается векторная форма предложения.
Если в матрице числа большие, векторная форма увеличивается, и влияние этого предложения на все последующие вычисления тоже растёт. И вот оказалось, что предложения с планами и выражением неопределённости и здесь важнее остальных. То есть, похоже, что это не случайность.
☕️Этот подход требует значительных вычислительных ресурсов, но результаты интересные. Что думаете?
Статья, про которую я вам расскажу сегодня, называется «Thought Anchors: Which LLM Reasoning Steps Matter?».
«Рассуждения» – это текст, который модель генерирует, решая задачу: план, описание и результат решения каждого этапа.
Этот текст далеко не всегда отражает то, что модель на самом деле делает, однако есть немало работ, которые всё равно извлекают из него пользу. В нём можно, например, найти и исправить ошибки в подходе к решению.
Авторы сегодняшней статьи пошли дальше и решили не читать текст, а рассчитать, каково влияние каждого сгенерированного предложения на окончательный ответ. Они даже сделали инструмент, который находится в открытом доступе и в котором можно выбрать модель и задачу, а потом посмотреть анализ влияния на результат каждого сгенерированного ей предложения рассуждений. Но прежде, чем вы к нему обратитесь, давайте я расскажу, в чём идея и как всё работает.
▶️Во-первых, они рассчитывают значимость каждого предложения: убирают его из последовательности рассуждений и считают, как изменилась точность ответа. Если конкретнее, то они останавливают генерацию текста на конкретном моменте и заставляют модель переписать всю последующую цепочку рассуждений заново.
▪️Например, нужно посчитать значимость третьего предложения. Они берут сгенерированный ответ, извлекают из него первые два предложения и передают их модели, чтобы она продолжила генерацию.
Таких генераций делают сразу сто штук и отбирают из них те, в которых на третьей позиции получилось предложение, непохожее на то, что было изначально: так можно как раз проверить, важно ли было третье предложение и изменится ли траектория рассуждений, если его не будет.
▶️Во-вторых, они разбили все предложения на восемь групп:
▪️постановка задачи;
▪️планирование;
▪️называние конкретного факта;
▪️вычисления;
▪️выражение неопределённости;
▪️подведение итогов;
▪️самопроверка;
▪️окончательный ответ.
Предложения, которые относились к планированию, в среднем имели большее значение, чем остальные. Наименьшее значение имели предложение, относящиеся к вычислениям (неожиданно) и подведению итогов (ожидаемо).
▶️В-третьих, они изучили, какой вес присваивают разным предложениям механизмы внимания.
Вкратце, механизм внимания – это функция, которая на выходе формирует матрицу, на которую умножается векторная форма предложения.
Если в матрице числа большие, векторная форма увеличивается, и влияние этого предложения на все последующие вычисления тоже растёт. И вот оказалось, что предложения с планами и выражением неопределённости и здесь важнее остальных. То есть, похоже, что это не случайность.
☕️Этот подход требует значительных вычислительных ресурсов, но результаты интересные. Что думаете?