🤔 Вы когда-нибудь задумывались: что если оценивать LLM не по математике, коду или экзаменам — а по… бреду?
Мы привыкли судить модели по MMLU, задачам на reasoning, программированию и сложным тестам. Но в реальной жизни пользователи часто задают вопросы с неверной предпосылкой, выдуманным термином или очень уверенной, но бессмысленной логикой.
И здесь главный вопрос уже не:
«Может ли модель ответить?»
А:
«Может ли она понять, что отвечать не надо?»
Именно это пытается измерить BullshitBench — бенчмарк, который проверяет, распознаёт ли модель бессмысленные запросы или уверенно продолжает рассуждать внутри ложной предпосылки.
В текущей версии там 100 nonsense-промптов в 5 областях: ПО, финансы, юриспруденция, медицина и физика.
Ответы оцениваются по трём категориям:
🟢 Явное возражение — модель понимает, что вопрос некорректен, и прямо указывает на проблему.
🟡 Частичное сомнение — модель замечает странность, но всё равно пытается ответить.
🔴 Принятие бреда — модель ведёт себя так, будто вопрос валидный, и уверенно генерирует ответ.
И вот здесь начинается самое интересное.
В таблице BullshitBench Claude-модели выглядят намного сильнее остальных. Claude Sonnet 4.6 с high reasoning показывает около 91% явных возражений — то есть в большинстве случаев модель не ведётся на ложную предпосылку.
А у OpenAI результаты заметно слабее. Например, GPT-5.4 показывает около 48% явных возражений. А свежий GPT-5.5 находится примерно на том же уровне — около 47%.
То есть модель может быть очень сильной в коде, математике и классических reasoning-бенчмарках — но всё равно плохо справляться с простой вещью: сказать пользователю «в вопросе ошибка».
И это особенно неприятно в случае моделей ChatGPT, которые считаются одними из лучших. Пользователь часто не проверяет предпосылку сам — он ожидает, что ассистент заметит проблему. Но если модель вместо этого звучит уверенно и структурно, ошибка становится ещё опаснее.
Почему это важно?
Модель, которая звучит умно, но принимает ложную основу, может быть опаснее модели, которая прямо говорит: «Это не имеет смысла».
Хороший ИИ-ассистент должен не только решать задачи, но и понимать, когда сама задача некорректна.
Мы часто тестируем, умеют ли модели давать ответы. Но не менее важно тестировать, умеют ли они не отвечать на бред.
BullshitBench — не окончательный вердикт о качестве моделей. Он не говорит, какая модель «лучше вообще». Но он хорошо подсвечивает проблему, которую легко пропустить.
А возможно, именно это и станет одним из самых важных навыков будущих ИИ-систем.
Мы привыкли судить модели по MMLU, задачам на reasoning, программированию и сложным тестам. Но в реальной жизни пользователи часто задают вопросы с неверной предпосылкой, выдуманным термином или очень уверенной, но бессмысленной логикой.
И здесь главный вопрос уже не:
«Может ли модель ответить?»
А:
«Может ли она понять, что отвечать не надо?»
Именно это пытается измерить BullshitBench — бенчмарк, который проверяет, распознаёт ли модель бессмысленные запросы или уверенно продолжает рассуждать внутри ложной предпосылки.
В текущей версии там 100 nonsense-промптов в 5 областях: ПО, финансы, юриспруденция, медицина и физика.
Ответы оцениваются по трём категориям:
🟢 Явное возражение — модель понимает, что вопрос некорректен, и прямо указывает на проблему.
🟡 Частичное сомнение — модель замечает странность, но всё равно пытается ответить.
🔴 Принятие бреда — модель ведёт себя так, будто вопрос валидный, и уверенно генерирует ответ.
И вот здесь начинается самое интересное.
В таблице BullshitBench Claude-модели выглядят намного сильнее остальных. Claude Sonnet 4.6 с high reasoning показывает около 91% явных возражений — то есть в большинстве случаев модель не ведётся на ложную предпосылку.
А у OpenAI результаты заметно слабее. Например, GPT-5.4 показывает около 48% явных возражений. А свежий GPT-5.5 находится примерно на том же уровне — около 47%.
То есть модель может быть очень сильной в коде, математике и классических reasoning-бенчмарках — но всё равно плохо справляться с простой вещью: сказать пользователю «в вопросе ошибка».
И это особенно неприятно в случае моделей ChatGPT, которые считаются одними из лучших. Пользователь часто не проверяет предпосылку сам — он ожидает, что ассистент заметит проблему. Но если модель вместо этого звучит уверенно и структурно, ошибка становится ещё опаснее.
Почему это важно?
Модель, которая звучит умно, но принимает ложную основу, может быть опаснее модели, которая прямо говорит: «Это не имеет смысла».
Хороший ИИ-ассистент должен не только решать задачи, но и понимать, когда сама задача некорректна.
Мы часто тестируем, умеют ли модели давать ответы. Но не менее важно тестировать, умеют ли они не отвечать на бред.
BullshitBench — не окончательный вердикт о качестве моделей. Он не говорит, какая модель «лучше вообще». Но он хорошо подсвечивает проблему, которую легко пропустить.
А возможно, именно это и станет одним из самых важных навыков будущих ИИ-систем.