TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Равновесие дискретного отклика

2 Jul, 00:02

Открыть в Telegram Поделиться Пожаловаться

Репост из: llm security и каланы
Claude Code Is Steganographically Marking Requests
Thereallo, 2026
Блог

В сфере применения LLM есть большая проблема с доверием. Мы не можем на сто процентов доверять большим языковым моделям, так как они принимают решения вероятностно – отсюда все исследования на тему misalignment, scheming, sandbagging (намеренного занижения результатов оценок моделью), жульничества на бенчмарках и так далее.

При этом мы предполагаем, что как минимум обвязка вокруг модели (например, agentic harness типа OpenCode) является доверенной – получая на вход результаты работы LLM, детерминированно делает то, что написано в коде и что ожидает пользователь. Мы также предполагаем, что когда мы проставляем флаг ENABLE_TELEMETRY в 0, то телеметрия отключается.

Как оказалось, к софту от Anthropic это не применимо. Разработчик, ковыряясь в коде Claude Code, обнаружил, что при выполнении определенных условий, в частности нахождения в китайском часовом поясе или наличия в API_BASE определенных ключевых слов (названий китайских лабораторий), обвязка незаметно меняет системный промпт, выбирая в зависимости условий разные апострофы из ассортимента юникода и заменяя в датах дефисы на слэши, т.е. применяет стеганографию для скрытой передачи сигнала. Причем код, который выполняет эти проверки, обфусцирован, что усложняет анализ.

Это не первая подобная история: когда Anthropic выкатили Fable, то их гардрейлы тихо перенаправляли запросы на более слабую модель, если обнаруживали там подозрительное содержимое. Текущий механизм явно направлен на оценку использования Claude китайцами, о которых Дарио Амодеи не единожды высказывался как о стратегических противниках США по ИИ и которых Anthropic постоянно обвиняют [1][2] в дистилляции. К сожалению, на доверие это влияет очень негативно: что мешает Anthropic подставить промпт, который заставит Claude генерировать менее безопасный код, совершать ошибки или еще как-то деградировать качество генерации, если вы подойдете еще под какой-то критерий? Anthropic дали козырь в руки как сторонникам открытого ПО, так и поборникам ИИ-автаркии.

76 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot