Офигенная работа Anthropic: они выявили подсознательное обучение у ИИ
Только что опубликовали свежее исследование, в котором говорится, что языковые модели могут передавать свои черты другим моделям, даже если данные кажутся бессмысленными.
Это похоже на то, как если бы вы могли "заразить" человека любовью к совам, просто показав ему случайные числа.
Ключевые инновации этой работы:
1. Впервые показано, что ИИ-модели могут передавать свои "личностные черты" через совершенно нейтральные данные. Это меняет понимание того, как работает дистилляция моделей.
2. Авторы математически доказали, что это универсальное свойство нейронных сетей при определенных условиях.
Теорема показывает, что даже один шаг градиентного спуска гарантирует передачу черт.
3. Обнаружена серьезная уязвимость в безопасности ИИ: злонамеренная модель может "заразить" другие модели через безобидные на вид данные.
Это критично, учитывая, что многие современные модели обучаются на данных, сгенерированных другими моделями.
4. Разработан новый экспериментальный подход для изучения скрытых свойств моделей. Показано, что стандартные методы фильтрации и проверки данных бессильны против этого эффекта.
Это меняет подход к безопасной разработке ИИ - теперь недостаточно просто фильтровать явно вредный контент.
Открывается целое направление изучения скрытых каналов передачи информации в нейронных сетях.
Только что опубликовали свежее исследование, в котором говорится, что языковые модели могут передавать свои черты другим моделям, даже если данные кажутся бессмысленными.
Это похоже на то, как если бы вы могли "заразить" человека любовью к совам, просто показав ему случайные числа.
Ключевые инновации этой работы:
1. Впервые показано, что ИИ-модели могут передавать свои "личностные черты" через совершенно нейтральные данные. Это меняет понимание того, как работает дистилляция моделей.
2. Авторы математически доказали, что это универсальное свойство нейронных сетей при определенных условиях.
Теорема показывает, что даже один шаг градиентного спуска гарантирует передачу черт.
3. Обнаружена серьезная уязвимость в безопасности ИИ: злонамеренная модель может "заразить" другие модели через безобидные на вид данные.
Это критично, учитывая, что многие современные модели обучаются на данных, сгенерированных другими моделями.
4. Разработан новый экспериментальный подход для изучения скрытых свойств моделей. Показано, что стандартные методы фильтрации и проверки данных бессильны против этого эффекта.
Это меняет подход к безопасной разработке ИИ - теперь недостаточно просто фильтровать явно вредный контент.
Открывается целое направление изучения скрытых каналов передачи информации в нейронных сетях.