На канале @nlp_daily прочёл про бенчмарк SlopCodeBench (arxiv:2603.24755) в свеженьком посте.
Данный бенчмарк симулирует работу пользователя над некоей кодовой базой и тестирует слопность (переусложнённость и раздутость) кода который генерят модельки через свои кодовые агенты.
Циферки оригинальной работы есть на сайте лидерборда бенча, а вот тут можно про более свежие модели почитать, из всех имеющихся материалов я собрал для вас сводную инфографику одной картинкой.
Лучший результат у GPT 5.5, это 14% в строгом зачёте и 28% в изолированном, и ни одна модель не довела до конца ни одной задачи из двадцати. Свежие муравьиные модельки проблему не сильно исправили, на 17 чекпоинтах Opus 5 решает заметно больше соседей, 24% против 6%, но платит за это тройным объёмом кода, 29 тысяч строк против 9, и впятеро большим числом функций, при этом 93% строк всё равно триггерят слоп-правила.
Любопытный разрез по вендорам виден на левой нижней диаграмме. GPT и Codex занимают верхушку и в среднем меньше слопят код (эрозируют), а Opus и Sonnet решают прилично, но переусложняют код сильнее всех, вероятно в этом нюансе и сокрыта причина почти что религиозного противостояния между адептус клодкодус и хранителями кодекса.
Вполне ожидаемый вывод в том, что если дать агенту кодовую базу, над которой тот будет итеративно работать, решая проблему не сразу, а маленькими шажками, и вносить правки самостоятельно, ваша кодовая база, сюрприз, сюрприз, превратится в разбухшую кашу из лапшы и повторов, я конечно не кулинар, но аналогию думаю вы поняли.
Так что разговоры про агента, который сам хозяйничает в вашем репозитории длительное время без присмотра человека, это пока что сказки в пользу бедных.
Данный бенчмарк симулирует работу пользователя над некоей кодовой базой и тестирует слопность (переусложнённость и раздутость) кода который генерят модельки через свои кодовые агенты.
Циферки оригинальной работы есть на сайте лидерборда бенча, а вот тут можно про более свежие модели почитать, из всех имеющихся материалов я собрал для вас сводную инфографику одной картинкой.
Лучший результат у GPT 5.5, это 14% в строгом зачёте и 28% в изолированном, и ни одна модель не довела до конца ни одной задачи из двадцати. Свежие муравьиные модельки проблему не сильно исправили, на 17 чекпоинтах Opus 5 решает заметно больше соседей, 24% против 6%, но платит за это тройным объёмом кода, 29 тысяч строк против 9, и впятеро большим числом функций, при этом 93% строк всё равно триггерят слоп-правила.
Любопытный разрез по вендорам виден на левой нижней диаграмме. GPT и Codex занимают верхушку и в среднем меньше слопят код (эрозируют), а Opus и Sonnet решают прилично, но переусложняют код сильнее всех, вероятно в этом нюансе и сокрыта причина почти что религиозного противостояния между адептус клодкодус и хранителями кодекса.
Вполне ожидаемый вывод в том, что если дать агенту кодовую базу, над которой тот будет итеративно работать, решая проблему не сразу, а маленькими шажками, и вносить правки самостоятельно, ваша кодовая база, сюрприз, сюрприз, превратится в разбухшую кашу из лапшы и повторов, я конечно не кулинар, но аналогию думаю вы поняли.
Так что разговоры про агента, который сам хозяйничает в вашем репозитории длительное время без присмотра человека, это пока что сказки в пользу бедных.