Berkeley предлагает оценивать AI-агентов для поиска уязвимостей не по числу найденных багов, а по покрытию классов CWE.
Ключевые метрики: критичность, эксплуатируемость, подтвержденный PoC, широта покрытия классов уязвимостей и слепые зоны.
Ценность агента в способности валидировать уязвимость. Хорошая карта покрытия показывает, где агент силен, а где пока бесполезен (например, поиск вредоносной функциональности). Одна тут стоит обратить внимание на возможную проблему в том, как формировалось выборка, что настораживает с интерпретацией.
По данным также видно, что агенты от разных организаций наиболее успешны в своей области (например, Memory-Safety уязвимости у Google и Microsoft)
https://vuln.cs.berkeley.edu
Ключевые метрики: критичность, эксплуатируемость, подтвержденный PoC, широта покрытия классов уязвимостей и слепые зоны.
Ценность агента в способности валидировать уязвимость. Хорошая карта покрытия показывает, где агент силен, а где пока бесполезен (например, поиск вредоносной функциональности). Одна тут стоит обратить внимание на возможную проблему в том, как формировалось выборка, что настораживает с интерпретацией.
По данным также видно, что агенты от разных организаций наиболее успешны в своей области (например, Memory-Safety уязвимости у Google и Microsoft)
https://vuln.cs.berkeley.edu