🤖
Почему каждый новый ИИ — «самый умный в мире»?Наверняка вы видели такие таблицы. Выходит новая нейросеть — и разработчики тут же показывают десяток загадочных названий, процентов и
результатов, которые должны продемонстрировать преимущества новой модели. На днях такую таблицу
опубликовали вместе с Grok 4.6. Там есть CursorBench, DeepSWE, APEX-Agents, Harvey LAB и ещё полдесятка названий, которые без подготовки
мало о чём говорят.
❓
Так что вообще такое ИИ-бенчмарки?Если совсем просто — это экзамены для нейросетей. Только вместо ЕГЭ существует множество
отдельных контрольных, каждая из которых проверяет свой навык:
➖
GDPVal проверяет, как ИИ справляется с реальными профессиональными задачами из десятков профессий, а
AA-Briefcase — с длинными офисными проектами: анализирует документы, собирает информацию, делает таблицы, презентации и другие рабочие материалы. Например, AA-Briefcase включает
проекты с тысячами исходных файлов
➖
CursorBench и DeepSWE проверяют программирование. CursorBench, например, дает ИИ сложные задачи на основе реальных
рабочих сессий в Cursor, где нужно разбираться сразу в нескольких файлах и исправлять код
➖
Terminal-Bench проверяет уже не просто написание кода, а способность самостоятельно работать за компьютером через
командную строку: устанавливать программы, менять файлы, настраивать системы и решать многошаговые задачи
➖ А
Harvey LAB вообще экзаменует ИИ в роли помощника юриста: модель получает документы по делу и должна подготовить
юридическую записку, анализ договора или другой полноценный результат работы
Поэтому вопрос «какая нейросеть самая умная?» примерно такой же, как вопрос «кто самый талантливый человек?». Один отлично программирует, другой лучше анализирует документы, третий — работает с инструментами. Даже на таблице Grok видно: Fable 5 лидирует в общем индексе и нескольких агентских тестах, GPT-5.6 Sol лучше справляется с DeepSWE и Terminal-Bench, а Grok 4.6 выигрывает в ряде других испытаний.
😎
И здесь есть еще одна важная детальКомпании сами выбирают, какие результаты показать на презентации. А итог зависит не только от самой модели, но и от версии теста, доступных
инструментов, настроек, количества попыток и вычислительных ресурсов. В таблице xAI отдельно оговаривается, что результаты сторонних моделей взяты из лучших опубликованных или заявленных самими разработчиками показателей.
Поэтому одна красивая таблица еще не отвечает на
вопрос, какая модель «самая умная». Смотреть лучше на несколько независимых тестов — и прежде всего на те, которые похожи на ваши реальные задачи.
⏺
«Богатырева о цифре» в Максе