Архитектурная дыра в API Claude, GPT и Gemini
Оказывается, без взлома и атак можно вытаскивать скрытые рассуждения модели (и не только) об этом новое исследование *обратите внимание на авторов 🫶
❗️Безопасность всей линейки моделей зависит от самой слабой модели в ней
А все из-за жадности вендоров) Что бы не сливать внутренние рассуждения, они перестали выдавать сырые chain-of-thought, но при этом не хранят его у себя на сервере
Вместо этого зашифрованный блок возвращается клиенту, и клиент присылает его обратно с каждым следующим запросом. Такие блоки можно переносить: между разными диалогами; аккаунтами разных пользователей; разными моделями одного провайдера
Сильная модель создаёт рассуждение
↓
забираем зашифрованный блок
↓
передаём его слабой модели того же провайдера
↓
уговариваем слабую модель перепечатать содержимое
↓
получаем скрытое рассуждение
Т.о слабая и легче поддающаяся jailbreak-модель читала reasoning сильной модели и выдавала ее пользователю
___
Оказывается, без взлома и атак можно вытаскивать скрытые рассуждения модели (и не только) об этом новое исследование *обратите внимание на авторов 🫶
❗️Безопасность всей линейки моделей зависит от самой слабой модели в ней
А все из-за жадности вендоров) Что бы не сливать внутренние рассуждения, они перестали выдавать сырые chain-of-thought, но при этом не хранят его у себя на сервере
Вместо этого зашифрованный блок возвращается клиенту, и клиент присылает его обратно с каждым следующим запросом. Такие блоки можно переносить: между разными диалогами; аккаунтами разных пользователей; разными моделями одного провайдера
Сильная модель создаёт рассуждение
↓
забираем зашифрованный блок
↓
передаём его слабой модели того же провайдера
↓
уговариваем слабую модель перепечатать содержимое
↓
получаем скрытое рассуждение
Т.о слабая и легче поддающаяся jailbreak-модель читала reasoning сильной модели и выдавала ее пользователю
___