TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Голубь Скиннера | Дария Клеева

12 Aug, 21:17

Открыть в Telegram Поделиться Пожаловаться

Как изучать интроспекцию у LLM?
#ai #psychology

В психологии термином интроспекция обозначают доступ к собственным внутренним состояниям и возможность ответить не только на вопрос "что я сделал?", но и "что во мне происходило, когда я это делал?" В ряде случаев мы действительно можем наблюдать свой собственный процесс принятия решений, однако нередко мы достраиваем правдоподобные объяснения уже после совершения действия.

Различимы ли эти два сценария у языковых моделей? Прямой опрос оказывается бесполезен. Модель обучена на корпусе, в котором описания собственных мыслей, сомнений и мотивов представлены в изобилии, то есть жанром интроспективного отчёта она владеет заведомо, независимо от наличия реального доступа к собственным состояниям. На прямой вопрос гарантированно последует связный и уверенный ответ, не несущий никакой диагностической информации. Следовательно, требуется экспериментальная схема, способная развести эти два случая.

Инъекция понятий
Такая схема была предложена Anthropic в октябре 2025 года. Её логика опирается на прямое вмешательство во внутренние состояния модели. Под внутренними состояниями понимаются наборы активаций на каждом слое модели, которые еще не преобразованы в текст. Читать эти активации напрямую проблематично, но определять в этом пространстве направление, соответствующее конкретному понятию, уже возможно.

Процедура состояла в следующем: направление, соответствующее некоторому понятию — например, «крик», — подмешивали в активации Claude примерно на двух третях глубины сети, после чего задавали вопрос, не регистрирует ли модель в себе что-либо постороннее. Claude Opus 4.1 приблизительно в каждом пятом случае сообщал о присутствии внедрённой мысли и (!) корректно называл понятие. На ста контрольных прогонах без вмешательства ложных срабатываний не зафиксировано.

Существенна здесь не доля успешных детекций (она невелика), а свойство самой конструкции. Отчёт возникает раньше, чем подмешанное понятие успевает проявиться в порождаемом тексте. То есть модель сообщает не о собственном выводе, а о состоянии, предшествующем выводу. Именно это отличает интроспекцию от реконструкции постфактум.

Полученный результат допускает и более экономные объяснения. Например, активированное понятие "крик" само по себе повышает вероятность соответствующей лексики. Отсюда сценарий, не требующий доступа к состоянию: модель регистрирует аномалию в своей конфигурации, а содержание отчёта считывает не с самого состояния, а с собственной смещённой склонности — "ко мне лезут слова про крик, следовательно, мне внедрили это понятие". Формально это уже реконструкция постфактум.

Проверка в данном случае простая: если модель действительно наблюдает своё состояние, у неё есть источник информации, недоступный снаружи, и "внешний наблюдатель" должен справляться хуже. В 2026 году с этой целью был обучен классификатор, имеющий доступ только к входному тексту, но не к внутренним активациям, — он достиг той же точности, что и "интроспекция" самой модели. То есть содержание отчёта выводимо извне.

574 1 13 17
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot