Andrey Kamin
Репост из: Open Source AI
OpenAI РАЗГРОМИЛИ главный бенчмарк ИИ-кодеров — SWE-bench Verified официально признан бесполезным
Высокие баллы нейросетей оказались не признаком «ума», а результатом банальной зубрежки
В чем проблема:
— 59% сложных задач из тестов содержат баги — они требуют того, чего нет в условии;
— Ответы на них были в общем доступе, модели просто выучили решения из GitHub. GPT и Claude цитируют код и комментарии из тестов дословно по памяти.
Open Source AI
Высокие баллы нейросетей оказались не признаком «ума», а результатом банальной зубрежки
В чем проблема:
— 59% сложных задач из тестов содержат баги — они требуют того, чего нет в условии;
— Ответы на них были в общем доступе, модели просто выучили решения из GitHub. GPT и Claude цитируют код и комментарии из тестов дословно по памяти.
Open Source AI