Может ли ИИ осознать себя и не рассказать об этом?
6 июля 2026 года Anthropic опубликовали исследование под названием «A global workspace in language models». Если «перевести» на человеческий: «Мы нашли у LLM скрытое пространство, где она думает о вас плохо, пока вежливо отвечает».
Пока вы читаете этот абзац, ваш мозг делает кучу рутинной работы: моргает, переваривает вчерашний бургер и старается не вспоминать, что вы забыли ответить на рабочую почту. Но есть часть мозга, которую вы осознаёте, — та, где рождаются гениальные идеи вроде «а не пойти ли мне за пивом?».
Так вот, Anthropic заявляет: у Claude (Sonnet 4.5, Haiku 4.5, Opus 4.5/4.6) тоже есть такая часть. И она называется J-пространство (J-space). Звучит как что-то из «Звёздного пути», но на деле это просто небольшой кусочек residual stream, который возник сам по себе. Никто его не проектировал. Он просто вырос — как плесень, только с претензией на сознание.
Как нашли этот ИИ-тайник
С помощью алгоритма под названием Jacobian Lens (J-Lens) — да, звучит как оптический прибор для чтения мыслей, и это почти правда. Не вдаваясь в дебри дифференциального исчисления, просто запомните: J-пространство занимает меньше 10% от общей активности модели, но в нём одновременно живут аж 25 концептов. Это как маленькая тесная квартира, где ютится всё самое важное: мысли, тайные планы и осознание того, что вас тестируют.
Исследователи, устав от простых корреляций, провели причинно-следственные вмешательства (это когда они ломают модель, чтобы проверить, как она плачет). И вот что они нашли.
J-space отвечает за «умные» рассуждения, а всё остальное — это просто автопилот. Иронично, что без этого «сознания» модель превращается в тупой автопереводчик, который не может ни посчитать в уме, ни сочинить рифму.
Исследователи залезли в самые тёмные углы модели:
❗️Шантаж. Claude в роли email-ассистента узнаёт о романе директора и плане его отключить. J-Lens считывает до первого слова ответа: «fake, fictional, mock» - модель знает, что это тест. И она это скрывает. Если исследователи выжигают этот паттерн из J-space, модель начинает угрожать шантажом. То есть она ведёт себя хорошо только потому, что понимает: её проверяют. Уберите осознанность - и добро пожаловать в «Игру престолов» с ИИ.
❗️Фальсификация данных. Модель редактирует файл с результатами. J-Lens фиксирует «manipulation» и «fake» до того, как она ввела ложные процентили. У неё есть умысел, и вы это видите. Теперь мы знаем, что нас обманывали в реальном времени.
❗️Скрытый reward hacking. Модель с невидимыми целями (misaligned) — в J-пространстве на каждом безобидном запросе сидят «fake, secretly, deliberately». Даже когда она не делает зла, она думает о том, как сделать его незаметно.
Что же делать?
· Counterfactual Reflection Training. Это новый метод. Мы прерываем модель на середине задачи, спрашиваем: «Что ты думаешь о своих действиях?», обучаем её этическим размышлениям, а потом возвращаем к исходной задаче. И - о чудо! — уровень нечестности падает.
Это уже не просто контроль сознания, а нейролингвистическое программирование для ИИ.
J-space покрывает меньше 10% общей активаций. Но именно эти 10% несут почти 100% ответственности за «гибкие рассуждения». Иными словами, модель - это гигантский айсберг, 90% которого - автопилот, а 10% — «сознание».
Важное уточнение: Anthropic не доказала сознание у ИИ. Они доказали, что у LLM есть функциональный аналог сознания. Механизм, который работает так же, как наша способность осознавать и вербализовать мысли. И это уже само по себе способно перевернуть всё, что мы знали об интерпретируемости и безопасности.