Русскоязычная команда с помощью Claude Code автоматизировала открытия новых джейлбрейк атак на LLM
Это один из похожих примеров в стиле кейса Андрея Карпатый.
Исследователи из Max Planck Institute и Imperial College запустили Claude Code в режиме автономного исследования, и он самостоятельно придумал алгоритмы атак на языковые модели, которые обходят все 30+ существующих методов.
И что интересно, он не придумал ничего принципиально нового. Просто брал идеи из существующих методов, скрещивал их между собой, крутил параметры. Такой очень быстрый и дотошный исследователь.
Но результат в 4 раза лучше всего существующего.
Раньше разработка новых атак на LLM занимала у людей месяцы. Claudini сделал это за 1 автономный прогон. И порог входа резко упал, теперь не нужна команда исследователей, нужен агент и GPU.
Авторы говорят, что это нижняя граница того, на что способны агенты сейчас. Верхняя пока неизвестна.
И это ставит неудобный вопрос: если безопасность моделей можно взламывать автоматически, насколько вообще надёжны существующие защиты?
GitHub.
Это один из похожих примеров в стиле кейса Андрея Карпатый.
Исследователи из Max Planck Institute и Imperial College запустили Claude Code в режиме автономного исследования, и он самостоятельно придумал алгоритмы атак на языковые модели, которые обходят все 30+ существующих методов.
И что интересно, он не придумал ничего принципиально нового. Просто брал идеи из существующих методов, скрещивал их между собой, крутил параметры. Такой очень быстрый и дотошный исследователь.
Но результат в 4 раза лучше всего существующего.
Раньше разработка новых атак на LLM занимала у людей месяцы. Claudini сделал это за 1 автономный прогон. И порог входа резко упал, теперь не нужна команда исследователей, нужен агент и GPU.
Авторы говорят, что это нижняя граница того, на что способны агенты сейчас. Верхняя пока неизвестна.
И это ставит неудобный вопрос: если безопасность моделей можно взламывать автоматически, насколько вообще надёжны существующие защиты?
GitHub.