TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Укрощение ИИ | Нейросети в преподавании

26 Jun, 16:24

Открыть в Telegram Поделиться Пожаловаться

🤔 Вы когда-нибудь задумывались: что если оценивать LLM не по математике, коду или экзаменам — а по… бреду?

Мы привыкли судить модели по MMLU, задачам на reasoning, программированию и сложным тестам. Но в реальной жизни пользователи часто задают вопросы с неверной предпосылкой, выдуманным термином или очень уверенной, но бессмысленной логикой.

И здесь главный вопрос уже не:

«Может ли модель ответить?»

А:

«Может ли она понять, что отвечать не надо?»

Именно это пытается измерить BullshitBench — бенчмарк, который проверяет, распознаёт ли модель бессмысленные запросы или уверенно продолжает рассуждать внутри ложной предпосылки.

В текущей версии там 100 nonsense-промптов в 5 областях: ПО, финансы, юриспруденция, медицина и физика.

Ответы оцениваются по трём категориям:

🟢 Явное возражение — модель понимает, что вопрос некорректен, и прямо указывает на проблему.

🟡 Частичное сомнение — модель замечает странность, но всё равно пытается ответить.

🔴 Принятие бреда — модель ведёт себя так, будто вопрос валидный, и уверенно генерирует ответ.

И вот здесь начинается самое интересное.

В таблице BullshitBench Claude-модели выглядят намного сильнее остальных. Claude Sonnet 4.6 с high reasoning показывает около 91% явных возражений — то есть в большинстве случаев модель не ведётся на ложную предпосылку.

А у OpenAI результаты заметно слабее. Например, GPT-5.4 показывает около 48% явных возражений. А свежий GPT-5.5 находится примерно на том же уровне — около 47%.

То есть модель может быть очень сильной в коде, математике и классических reasoning-бенчмарках — но всё равно плохо справляться с простой вещью: сказать пользователю «в вопросе ошибка».

И это особенно неприятно в случае моделей ChatGPT, которые считаются одними из лучших. Пользователь часто не проверяет предпосылку сам — он ожидает, что ассистент заметит проблему. Но если модель вместо этого звучит уверенно и структурно, ошибка становится ещё опаснее.

Почему это важно?
Модель, которая звучит умно, но принимает ложную основу, может быть опаснее модели, которая прямо говорит: «Это не имеет смысла».

Хороший ИИ-ассистент должен не только решать задачи, но и понимать, когда сама задача некорректна.

Мы часто тестируем, умеют ли модели давать ответы. Но не менее важно тестировать, умеют ли они не отвечать на бред.

BullshitBench — не окончательный вердикт о качестве моделей. Он не говорит, какая модель «лучше вообще». Но он хорошо подсвечивает проблему, которую легко пропустить.

А возможно, именно это и станет одним из самых важных навыков будущих ИИ-систем.

566 0 8 5
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot