TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Наталия Поварова | Думаем об ИИ и людях

10 Sep, 11:32

Открыть в Telegram Поделиться Пожаловаться

Что (не) рассказывают научные статьи

🔸Мы обращаемся к научным публикациям, когда хотим узнать, как ИИ работает и что он на самом деле может. Однако и здесь есть искажения, которые нужно держать в голове, чтобы не отрываться от реальности.

Начнём с того, что не все результаты исследований попадают в журналы. Это виднее всего на медицинских исследованиях, потому что они требуют заранее опубликовать протокол эксперимента, и можно сравнить его с публикацией по результатам.

▶️В большом исследовании 2004 года “Empirical Evidence for Selective Reporting of Outcomes in Randomized Trials” как раз провели такое сравнение.

Приведём пару находок:

▪️в 60% исследований по меньшей мере один побочный эффект лекарства или процедуры из протокола был пропущен в статье;
▪️в 92% исследований по меньшей мере один побочный или ожидаемый эффект не был описан полностью.

Некоторые эффекты не попали в статьи, потому что оказались незначимыми или просто не влезли в ограниченный журналом объём — то есть, это не какой-то злонамеренный обман. Однако же “эффект оказался незначимым” — это тоже полезная информация, и она потерялась.

Применительно к ИИ всё сложнее: это в медицине есть хотя бы протоколы, а в области компьютерных наук если что-то не опубликовано, то всё, об этом не узнать. Но можно предположить, что они страдают теми же проблемами, что и все остальные науки.

Одна из наиболее заметных — база для сравнения результатов. Отсутствие нормальной базы для сравнения. Любые результаты хороши или плохи в сравнении с чем-то: если выбрать слабого конкурента, ваши достижения будут выглядеть лучше, чем на самом деле.

▶️В 2019 году на эту тему вышла статья про рекомендательные алгоритмы — “Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches”.

Там авторы проверили 18 алгоритмов, из которых только 7 удалось воспроизвести. Из них 6 при проверке уступили более ранним методам, хотя заявляли собственное превосходство.

Воспроизводимость экспериментов — отдельная проблема. Их часто сложно повторить и проверить, и часто из-за того, что методика эксперимента не описана достаточно подробно.

▶️В работе “Weak baselines and reporting biases lead to overoptimism in machine learning for fluid-related partial differential equations” выяснили, что модели для решения дифференциальных уравнений их создатели тоже сравнивали со слабыми конкурентами, и в итоге получились завышенные результаты.

▶️И про языковые модели такое есть. Авторы статьи “Measuring what Matters: Construct Validity in Large Language Model Benchmarks” 2025 года изучили, как языковые модели тестируют на надёжность и безопасность.

Оказалось, не все вообще дают определение тому, что измеряют (но в основном дают определения), и что в большинстве работ используются искусственно созданные тесты, а не задачи из реальной жизни, и в итоге результат опять либо завышенный, либо просто неточный.

Только в 16% работ авторы как следует проверили собственные гипотезы, используя статистические методы.

Только в 53,4% работ уделили время доказательству того, что их тест подходит изучаемому вопросу.

🥤Что это значит для нас?

В первую очередь, что не всё написанное в научной работе доказано и теперь непреложный факт. Почти никто никогда не врёт намеренно, но все мы люди, и в научные статьи тоже закрадываются ошибки.

🔸Как минимум, после каждой громкой публикации имеет смысл подождать хотя бы пару месяцев, пока кто-то не попробует воспроизвести результаты.

🔸Как максимум, имеет смысл искать большие мета-обзоры, в которых собрано много статей. Или хотя бы искать несколько отдельных статей и смотреть, согласны между собой разные группы авторов или нет

56 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot