LLM уже решает реальные рабочие задачи, как человек? Бенчмарк от OpenAI
Недавно OpenAI опубликовала бенчмарк GDPval, в котором модели проверяют на способность выполнять экономически важные задачи, которые регулярно возникают в работе. Модели часто показывают паритет с человеком, а в некоторых задачах и сильно превосходят.
Как OpenAI проводили этот замер, пора ли хантить AI-сотрудников, поговорим в этом посте. Поехали.
Как замеряли модели
Взяли 44 цифровых профессии, на которые приходится больше всего денежных выплат в США. Эти профессии зарабатывают 3 триллиона $ в год.
Дальше рекрутировали экспертов в каждой профессии. Эксперт предлагал реальную задачу из своей практики. Задача это не только текст, но и картинка/видео/excel-файл и тд.
Оценивали LLM парным сравнением: эксперт видел ответ LLM и ответ человека и определял, какой нравится ему больше. На практике такая метрика самая чувствительная в задачах, где нет эталонного ответа. Подробнее про метрики читайте тут.
Результаты
- На 1-м месте Claude Opus 4.1 с винрейтом 47.6 % против человека.
- На втором GPT-5, которая побеждает человека в 38.8 % случаев.
- Дальше ризонинг-модели от OpenAI с чудовищным неймингом, и на 5-м месте Gemini 2.5 Pro. Маск даже не в пятерке :(
В бенчмарке есть много задач, с которыми LLM справляется лучше человека. Это, например, задачи из разработки, поддержки клиентов, продаж.
У вас могла возникнуть идея…
Пора переходить на AI-сотрудников?
Не пора. В эту ловушку попадал сам Джеффри Хинтон в 2016 году, когда сказал, что рентгенологи не нужны, ведь AI находит на снимках болезни лучше. С тех пор спрос на рентгенологов только растет. Почему?
AI действительно уже сейчас решает некоторые задачи лучше человека. И чем более узкая задача, тем проще ему (см. прошлый пост). AI может даже некоторые сложные задачи рентгенологов решать лучше самих рентгенологов.
Но работа рентгенолога целиком это огроменная композиция этих задач и постоянное переключение между ними в зависимости от текущей ситуации. Кстати, именно по этой причине мне нравится copilot режим — рутинные задачи отдаются в AI, но проверяет их решение и склеивает все воедино эксперт.
Резюме
Такие статичные бенчмарки отражают только решение одной узкой задачи, но вообще непонятно, как модель будет вести себя в реальном мире, где задач сразу куча и все они всегда в движении.
Здесь нужны агентские динамические бенчмарки, где модель работает со средой. В них модель сможет уточнить задачу, спросить совета, переделать решение. А среда может в любой момент внести коррективы. Такие бенчмарки мы должны будем с вами построить.
Значит, работаем дальше. Пока работаем, не доверяем хайпу про ИИ-сотрудников и читаем этот канал.
Недавно OpenAI опубликовала бенчмарк GDPval, в котором модели проверяют на способность выполнять экономически важные задачи, которые регулярно возникают в работе. Модели часто показывают паритет с человеком, а в некоторых задачах и сильно превосходят.
Как OpenAI проводили этот замер, пора ли хантить AI-сотрудников, поговорим в этом посте. Поехали.
Как замеряли модели
Взяли 44 цифровых профессии, на которые приходится больше всего денежных выплат в США. Эти профессии зарабатывают 3 триллиона $ в год.
Дальше рекрутировали экспертов в каждой профессии. Эксперт предлагал реальную задачу из своей практики. Задача это не только текст, но и картинка/видео/excel-файл и тд.
Оценивали LLM парным сравнением: эксперт видел ответ LLM и ответ человека и определял, какой нравится ему больше. На практике такая метрика самая чувствительная в задачах, где нет эталонного ответа. Подробнее про метрики читайте тут.
Результаты
- На 1-м месте Claude Opus 4.1 с винрейтом 47.6 % против человека.
- На втором GPT-5, которая побеждает человека в 38.8 % случаев.
- Дальше ризонинг-модели от OpenAI с чудовищным неймингом, и на 5-м месте Gemini 2.5 Pro. Маск даже не в пятерке :(
В бенчмарке есть много задач, с которыми LLM справляется лучше человека. Это, например, задачи из разработки, поддержки клиентов, продаж.
У вас могла возникнуть идея…
Пора переходить на AI-сотрудников?
Не пора. В эту ловушку попадал сам Джеффри Хинтон в 2016 году, когда сказал, что рентгенологи не нужны, ведь AI находит на снимках болезни лучше. С тех пор спрос на рентгенологов только растет. Почему?
AI действительно уже сейчас решает некоторые задачи лучше человека. И чем более узкая задача, тем проще ему (см. прошлый пост). AI может даже некоторые сложные задачи рентгенологов решать лучше самих рентгенологов.
Но работа рентгенолога целиком это огроменная композиция этих задач и постоянное переключение между ними в зависимости от текущей ситуации. Кстати, именно по этой причине мне нравится copilot режим — рутинные задачи отдаются в AI, но проверяет их решение и склеивает все воедино эксперт.
Резюме
Такие статичные бенчмарки отражают только решение одной узкой задачи, но вообще непонятно, как модель будет вести себя в реальном мире, где задач сразу куча и все они всегда в движении.
Здесь нужны агентские динамические бенчмарки, где модель работает со средой. В них модель сможет уточнить задачу, спросить совета, переделать решение. А среда может в любой момент внести коррективы. Такие бенчмарки мы должны будем с вами построить.
Значит, работаем дальше. Пока работаем, не доверяем хайпу про ИИ-сотрудников и читаем этот канал.