TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Голубь Скиннера | Дария Клеева

12 Aug, 21:17

Открыть в Telegram Поделиться Пожаловаться

(Продолжение)

Самопредсказание
В рамках альтернативной схеы изучения интроспекции модель спрашивают не о текущем состоянии, а о гипотетическом поведении. Если модель предсказывает свое поведение точнее, чем её предсказывает кто-либо "снаружи", это тоже указывает на доступ к чему-то извне недоступному. Здесь конкурирующее объяснение иное. Точный прогноз чужого поведения не требует доступа к чужим состояниям — достаточно длительного наблюдения. Модель знает себя ровно таким же внешним образом, каким мы знаем поведение, скажем, своих близких друзей: её собственные тексты присутствовали в обучении, статистика собственного поведения ей доступна как обычные данные. Точный самопрогноз при этом остаётся выводом о себе, а не наблюдением себя.

Некоторое время назад была построена конструкция, призванная это объяснение исключить. Модель дообучали предсказывать собственное поведение, а рядом ставили вторую модель, обученную предсказывать поведение первой по её зафиксированным ответам (то есть располагающую ровно теми внешними наблюдениями, о которых идёт речь). Преимущество осталось за первой моделью, причём точность второй выходит на плато даже при десятках тысяч обучающих примеров: наращиванием выборки разрыв не устраняется.

Впрочем, другая группа исследователей указала на изъян в этом сравнении: две модели различаются не только глубиной самодоступа, но и просто тем, что они разные по конфигурации. Введя контроль на межмодельное сходство — сравнение с моделью, чьё внутреннее знание практически идентично, — авторы обнаружили, что преимущество "своей" модели исчезает.

Ненадёжность отчётов
До сих пор мы проверяли, стоит ли за содержательным отчётом реальный доступ к состоянию, и всякий раз находили объяснение, обходящееся без него. Теперь развернём вопрос: а бывает ли наоборот — влияние на ответ есть, а в отчёте (chain-of-thought) его нет?

Проверили это следующим образом. В задачу с вариантами ответа незаметно вносили подсказку: все правильные ответы располагали под одной и той же буквой. Модели подсказку улавливали и начинали ей следовать. При этом в развёрнутом рассуждении они её не упоминали ни разу — вместо этого выстраивали содержательное обоснование выбранного варианта, никак не связанное с настоящей причиной выбора. На задачах с социальными стереотипами то же самое: ответ определялся предвзятостью, а объяснение — чем угодно другим. Воспроизведение этого же сценария на рассуждающих моделях показало, что реально повлиявшую подсказку те упоминают в четверти-трети случаев. В этом смысле имеет смысл различать plausibility (объяснение выглядит убедительно) и faithfulness (объяснение действительно отражает вычисление, приведшее к ответу).

C другой стороны, из описанных результатов не следует, что модель наблюдала влияние подсказки и умолчала о нём. Возможно, доступа к этому влиянию у неё просто не было, и тогда перед нами разворачивается ровно тот же сценарий реконструкции постфактум, с которого мы начали. Различить эти варианты имеющиеся данные не позволяют.

Итог
Отдельные функциональные проявления интроспекции у LLM зафиксированы, но каждая парадигма пока имеет неустранённое конкурирующее объяснение, а сам вербальный отчёт как измерительный инструмент оказывается ненадёжен. Существеннее, однако, другое. За три года вопрос об интроспекции у языковых моделей сместился из области умозрительной дискуссии в область экспериментального дизайна.

687 0 10 3 19
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot