Репост из: llm security и каланы
Claude Code Is Steganographically Marking Requests
Thereallo, 2026
Блог
В сфере применения LLM есть большая проблема с доверием. Мы не можем на сто процентов доверять большим языковым моделям, так как они принимают решения вероятностно – отсюда все исследования на тему misalignment, scheming, sandbagging (намеренного занижения результатов оценок моделью), жульничества на бенчмарках и так далее.
При этом мы предполагаем, что как минимум обвязка вокруг модели (например, agentic harness типа OpenCode) является доверенной – получая на вход результаты работы LLM, детерминированно делает то, что написано в коде и что ожидает пользователь. Мы также предполагаем, что когда мы проставляем флаг ENABLE_TELEMETRY в 0, то телеметрия отключается.
Как оказалось, к софту от Anthropic это не применимо. Разработчик, ковыряясь в коде Claude Code, обнаружил, что при выполнении определенных условий, в частности нахождения в китайском часовом поясе или наличия в API_BASE определенных ключевых слов (названий китайских лабораторий), обвязка незаметно меняет системный промпт, выбирая в зависимости условий разные апострофы из ассортимента юникода и заменяя в датах дефисы на слэши, т.е. применяет стеганографию для скрытой передачи сигнала. Причем код, который выполняет эти проверки, обфусцирован, что усложняет анализ.
Это не первая подобная история: когда Anthropic выкатили Fable, то их гардрейлы тихо перенаправляли запросы на более слабую модель, если обнаруживали там подозрительное содержимое. Текущий механизм явно направлен на оценку использования Claude китайцами, о которых Дарио Амодеи не единожды высказывался как о стратегических противниках США по ИИ и которых Anthropic постоянно обвиняют [1][2] в дистилляции. К сожалению, на доверие это влияет очень негативно: что мешает Anthropic подставить промпт, который заставит Claude генерировать менее безопасный код, совершать ошибки или еще как-то деградировать качество генерации, если вы подойдете еще под какой-то критерий? Anthropic дали козырь в руки как сторонникам открытого ПО, так и поборникам ИИ-автаркии.
Thereallo, 2026
Блог
В сфере применения LLM есть большая проблема с доверием. Мы не можем на сто процентов доверять большим языковым моделям, так как они принимают решения вероятностно – отсюда все исследования на тему misalignment, scheming, sandbagging (намеренного занижения результатов оценок моделью), жульничества на бенчмарках и так далее.
При этом мы предполагаем, что как минимум обвязка вокруг модели (например, agentic harness типа OpenCode) является доверенной – получая на вход результаты работы LLM, детерминированно делает то, что написано в коде и что ожидает пользователь. Мы также предполагаем, что когда мы проставляем флаг ENABLE_TELEMETRY в 0, то телеметрия отключается.
Как оказалось, к софту от Anthropic это не применимо. Разработчик, ковыряясь в коде Claude Code, обнаружил, что при выполнении определенных условий, в частности нахождения в китайском часовом поясе или наличия в API_BASE определенных ключевых слов (названий китайских лабораторий), обвязка незаметно меняет системный промпт, выбирая в зависимости условий разные апострофы из ассортимента юникода и заменяя в датах дефисы на слэши, т.е. применяет стеганографию для скрытой передачи сигнала. Причем код, который выполняет эти проверки, обфусцирован, что усложняет анализ.
Это не первая подобная история: когда Anthropic выкатили Fable, то их гардрейлы тихо перенаправляли запросы на более слабую модель, если обнаруживали там подозрительное содержимое. Текущий механизм явно направлен на оценку использования Claude китайцами, о которых Дарио Амодеи не единожды высказывался как о стратегических противниках США по ИИ и которых Anthropic постоянно обвиняют [1][2] в дистилляции. К сожалению, на доверие это влияет очень негативно: что мешает Anthropic подставить промпт, который заставит Claude генерировать менее безопасный код, совершать ошибки или еще как-то деградировать качество генерации, если вы подойдете еще под какой-то критерий? Anthropic дали козырь в руки как сторонникам открытого ПО, так и поборникам ИИ-автаркии.