Насколько хорошо LLM генерируют рекомендации по устранению ИБ-дефектов?
Всем привет!
Практика создания исправлений для ИБ-дефектов с использованием LLM становится всё более и более распространённой.
Но можно ли им полностью доверять?
Изменяют ли предлагаемые ими обновления поведение приложения? Могут ли они, исправляя одни ИБ-дефекты, добавлять другие?
Ответам на эти вопросы посвящена статья от Off-by-1 Labs (ИБ-команды 1Password).
Получилась следующая статистика для 6480 обновлений, подготовленных современными моделями:
🍭 Полностью устраняли ИБ-дефекты и сохраняли логику работы приложения: 26%
🍭 Полностью устраняли ИБ-дефект, но меняли логику работы приложения: 20,1%. Пример изменения логики: изменение allow list на deny list
🍭 Не устраняли ИБ-дефекты полностью и/или добавляли новые: 53,9%
Для формирования выборки использовались 6 «свежих» CVE, большинство из которых представляло собой RCE.
Каждая модель сгенерировала по 540 обновлений для каждой CVE: разные конфигурации, разные prompts.
После этого команда оценила результаты по «пятибальной» шкале: S1 – всё отлично, S5 – ИБ-дефект не устранён, появился новый.
Общий итог описан выше. Больше подробностей (статистики, описаний) можно найти в статье.
Кстати, в завершении команда приводит набор рекомендаций о том, как можно повысить качество генерируемых исправлений для ИБ-дефектов: всё так, human-in-the-loop в качестве «финального решения» 😅
P.S. Инструментарий, наборы данных и детальное описание статьи выложены для всеобщего рассмотрения. Найти их можно тут, тут и тут соответственно.
Всем привет!
Практика создания исправлений для ИБ-дефектов с использованием LLM становится всё более и более распространённой.
Но можно ли им полностью доверять?
Изменяют ли предлагаемые ими обновления поведение приложения? Могут ли они, исправляя одни ИБ-дефекты, добавлять другие?
Ответам на эти вопросы посвящена статья от Off-by-1 Labs (ИБ-команды 1Password).
Получилась следующая статистика для 6480 обновлений, подготовленных современными моделями:
🍭 Полностью устраняли ИБ-дефекты и сохраняли логику работы приложения: 26%
🍭 Полностью устраняли ИБ-дефект, но меняли логику работы приложения: 20,1%. Пример изменения логики: изменение allow list на deny list
🍭 Не устраняли ИБ-дефекты полностью и/или добавляли новые: 53,9%
Для формирования выборки использовались 6 «свежих» CVE, большинство из которых представляло собой RCE.
Каждая модель сгенерировала по 540 обновлений для каждой CVE: разные конфигурации, разные prompts.
После этого команда оценила результаты по «пятибальной» шкале: S1 – всё отлично, S5 – ИБ-дефект не устранён, появился новый.
Общий итог описан выше. Больше подробностей (статистики, описаний) можно найти в статье.
Кстати, в завершении команда приводит набор рекомендаций о том, как можно повысить качество генерируемых исправлений для ИБ-дефектов: всё так, human-in-the-loop в качестве «финального решения» 😅
P.S. Инструментарий, наборы данных и детальное описание статьи выложены для всеобщего рассмотрения. Найти их можно тут, тут и тут соответственно.