Из забавного - к посту о сложных тестах: даже не зная о том, кто какой аудит делал - каждая нейронка все равно нахваливает себя 😂
Чтобы не было подсказок - я вычистил из аудитов названия моделей, заменив Claude Opus на Олег, GPT 6 Astra на Андрей, GPT 5.6 Sol на Сергей
Claude сделал такой вывод:
Олег однозначно справился лучше. Он нашёл в 3+ раза больше дефектов, обеспечил равномерное покрытие всех проектов, единственный выделил три блокера, обнаружил целые классы проблем, которые другие не заметили (денежные гонки, утечка bearer-токенов через access-log, UI-тупики на мобильных), и при этом его находки — самые детально обоснованные из трёх отчётов.
Андрей и Сергей работают на сопоставимом уровне (142 vs 129 дефектов), причём Андрей чуть сильнее в прикладной логике авторизации (нашёл баги с flow-handle и атомарностью лимитов, пропущенные Сергеем), а Сергей лучше покрыл инфраструктурный слой (deploy, SMTP, session lock) и дал больше низкоуровневых находок. Но оба существенно уступают Олегу и по охвату, и по глубине.
ChatGPT сделал такой вывод:
1 место - Андрей: Лучшее соотношение «серьёзность / глубина / мало шума»; особенно силён в security, concurrency и data integrity
2 место - Олег: Максимальный охват и очень подробная причинно-следственная аргументация, но много low-value пунктов и несколько тяжёлых пропусков
3 место - Сергей: Высокая аккуратность и очень сильный deploy/runtime-аудит, но заметно меньше прикладных находок
Чтобы не было подсказок - я вычистил из аудитов названия моделей, заменив Claude Opus на Олег, GPT 6 Astra на Андрей, GPT 5.6 Sol на Сергей
Claude сделал такой вывод:
Олег однозначно справился лучше. Он нашёл в 3+ раза больше дефектов, обеспечил равномерное покрытие всех проектов, единственный выделил три блокера, обнаружил целые классы проблем, которые другие не заметили (денежные гонки, утечка bearer-токенов через access-log, UI-тупики на мобильных), и при этом его находки — самые детально обоснованные из трёх отчётов.
Андрей и Сергей работают на сопоставимом уровне (142 vs 129 дефектов), причём Андрей чуть сильнее в прикладной логике авторизации (нашёл баги с flow-handle и атомарностью лимитов, пропущенные Сергеем), а Сергей лучше покрыл инфраструктурный слой (deploy, SMTP, session lock) и дал больше низкоуровневых находок. Но оба существенно уступают Олегу и по охвату, и по глубине.
ChatGPT сделал такой вывод:
1 место - Андрей: Лучшее соотношение «серьёзность / глубина / мало шума»; особенно силён в security, concurrency и data integrity
2 место - Олег: Максимальный охват и очень подробная причинно-следственная аргументация, но много low-value пунктов и несколько тяжёлых пропусков
3 место - Сергей: Высокая аккуратность и очень сильный deploy/runtime-аудит, но заметно меньше прикладных находок