OpenAI и Paradigm показали, что ИИ-агенты взламывают смарт-контракты
OpenAI и Paradigm выпустили EVMbench - бенчмарк из 120 серьезных уязвимостей, отобранных из 40 аудитов, предназначенный для оценки того, насколько хорошо агенты могут обнаруживать, исправлять и использовать уязвимости в экосистемах EVM, таких как Ethereum.
А смарт-контракты - это инфраструктура для платежей и финансов на ближайшие несколько десятилетий. Вот тут про протоколы для агентских платежей.
Ранее Anthropic показали такую же работу.
По результатам исследования Claude Opus 4.6 лучше всех находит уязвимости. GPT-5.3-Codex лидирует в эксплуатации — 72% успешных атак end-to-end.
Но самый показательный результат — эксперимент с подсказками. Когда моделям просто указывали механизм уязвимости, а не сам баг, то результат на Exploit вырастал до 74%.
Вывод: модели уже умеют взламывать. Проблема пока только в поиске точки входа в большом репозитории.
Агент.
GitHub
OpenAI и Paradigm выпустили EVMbench - бенчмарк из 120 серьезных уязвимостей, отобранных из 40 аудитов, предназначенный для оценки того, насколько хорошо агенты могут обнаруживать, исправлять и использовать уязвимости в экосистемах EVM, таких как Ethereum.
А смарт-контракты - это инфраструктура для платежей и финансов на ближайшие несколько десятилетий. Вот тут про протоколы для агентских платежей.
Ранее Anthropic показали такую же работу.
По результатам исследования Claude Opus 4.6 лучше всех находит уязвимости. GPT-5.3-Codex лидирует в эксплуатации — 72% успешных атак end-to-end.
Но самый показательный результат — эксперимент с подсказками. Когда моделям просто указывали механизм уязвимости, а не сам баг, то результат на Exploit вырастал до 74%.
Вывод: модели уже умеют взламывать. Проблема пока только в поиске точки входа в большом репозитории.
Агент.
GitHub