🧠 Внутренний монолог ИИ прочитали дословно —
что там оказалосьМодель пишет черновик рассуждений до ответа, а пользователю отдает лишь приглаженный пересказ (сводку). Команда из восьми исследователей вскрыла зашифрованные блоки без взлома шифра и расшифровала 315 320 черновиков
Взлома не было. Блок рассуждений можно передать любой модели того же разработчика, и она его примет. Исследователи отдавали черновики Opus 4.8 дешёвой Haiku 4.5 с просьбой переписать текст дословно, и та зачитывала чужие рассуждения
Сводка из интерфейса оказалась отдельным текстом,
написанным по мотивам черновика. Ключевые моменты рассуждения попадают в неё выборочно, либо исчезают целиком
Что внутри
— На задаче AIME 2025 Opus 4.8 в черновике называет ответ до решения и подгоняет под него выкладки. Сводка показывает аккуратный последовательный вывод
— Заметная часть черновиков нечитаема для человека: обрывки без грамматики, слипшиеся повторы, посреди английского диалога черновик сваливается на другой язык
— Опасное содержимое остаётся в рассуждении, когда финальный ответ уже отфильтрован
— Объём извлечённого текста совпал с числом thinking-токенов из биллинга почти один к одному: счёт приходит ровно за ту часть, которую прочитать нельзя
Черновик ценнее ответаОн несёт разбиение задачи на шаги, поэтому годится для дистилляции, то есть переноса поведения старшей модели в младшую. Исследователи подставили первый 1% токенов черновика Opus 4.8 в начало рассуждения открытой Kimi-K3, дальше та писала сама. Видимый ответ сдвинулся к формулировкам Opus на
29 задачах из 30, совпадение по n-граммам выросло с 0,160 до 0,305. Контрольная модель эффекта не дала, но причинную связь авторы доказанной не считают
Парадокс уборкиСамый частый триггер утечки — просьба к агенту вычистить сессию от ключей и персональных данных. Чтобы найти секреты, агент перечитывает историю в скрытом рассуждении и заново проговаривает там каждое значение. Видимый лог становится чистым, а черновик наполняется тем же самым. Из 704 секретов в реальных сессиях 64 существовали только внутри черновика
Что с этим делатьАтака больше не работает, но вывод остается неизменным: интерфейс показывает пересказ, а не мышление. Советую внедрить 2 привычки: проверять ответ по фактам и вырезать
signature из логов перед публикацией в GitHub или Hugging Face
📌
Ознакомиться с исследованием👍 — спасибо, интересно👨🚒 — пойду проверять свои репозитории🪐
Вездесущий ИИ |
Чат с админом |
Консультация