Что (не) рассказывают научные статьи
🔸Мы обращаемся к научным публикациям, когда хотим узнать, как ИИ работает и что он на самом деле может. Однако и здесь есть искажения, которые нужно держать в голове, чтобы не отрываться от реальности.
Начнём с того, что не все результаты исследований попадают в журналы. Это виднее всего на медицинских исследованиях, потому что они требуют заранее опубликовать протокол эксперимента, и можно сравнить его с публикацией по результатам.
▶️В большом исследовании 2004 года “Empirical Evidence for Selective Reporting of Outcomes in Randomized Trials” как раз провели такое сравнение.
Приведём пару находок:
▪️в 60% исследований по меньшей мере один побочный эффект лекарства или процедуры из протокола был пропущен в статье;
▪️в 92% исследований по меньшей мере один побочный или ожидаемый эффект не был описан полностью.
Некоторые эффекты не попали в статьи, потому что оказались незначимыми или просто не влезли в ограниченный журналом объём — то есть, это не какой-то злонамеренный обман. Однако же “эффект оказался незначимым” — это тоже полезная информация, и она потерялась.
Применительно к ИИ всё сложнее: это в медицине есть хотя бы протоколы, а в области компьютерных наук если что-то не опубликовано, то всё, об этом не узнать. Но можно предположить, что они страдают теми же проблемами, что и все остальные науки.
Одна из наиболее заметных — база для сравнения результатов. Отсутствие нормальной базы для сравнения. Любые результаты хороши или плохи в сравнении с чем-то: если выбрать слабого конкурента, ваши достижения будут выглядеть лучше, чем на самом деле.
▶️В 2019 году на эту тему вышла статья про рекомендательные алгоритмы — “Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches”.
Там авторы проверили 18 алгоритмов, из которых только 7 удалось воспроизвести. Из них 6 при проверке уступили более ранним методам, хотя заявляли собственное превосходство.
Воспроизводимость экспериментов — отдельная проблема. Их часто сложно повторить и проверить, и часто из-за того, что методика эксперимента не описана достаточно подробно.
▶️В работе “Weak baselines and reporting biases lead to overoptimism in machine learning for fluid-related partial differential equations” выяснили, что модели для решения дифференциальных уравнений их создатели тоже сравнивали со слабыми конкурентами, и в итоге получились завышенные результаты.
▶️И про языковые модели такое есть. Авторы статьи “Measuring what Matters: Construct Validity in Large Language Model Benchmarks” 2025 года изучили, как языковые модели тестируют на надёжность и безопасность.
Оказалось, не все вообще дают определение тому, что измеряют (но в основном дают определения), и что в большинстве работ используются искусственно созданные тесты, а не задачи из реальной жизни, и в итоге результат опять либо завышенный, либо просто неточный.
Только в 16% работ авторы как следует проверили собственные гипотезы, используя статистические методы.
Только в 53,4% работ уделили время доказательству того, что их тест подходит изучаемому вопросу.
🥤Что это значит для нас?
В первую очередь, что не всё написанное в научной работе доказано и теперь непреложный факт. Почти никто никогда не врёт намеренно, но все мы люди, и в научные статьи тоже закрадываются ошибки.
🔸Как минимум, после каждой громкой публикации имеет смысл подождать хотя бы пару месяцев, пока кто-то не попробует воспроизвести результаты.
🔸Как максимум, имеет смысл искать большие мета-обзоры, в которых собрано много статей. Или хотя бы искать несколько отдельных статей и смотреть, согласны между собой разные группы авторов или нет
🔸Мы обращаемся к научным публикациям, когда хотим узнать, как ИИ работает и что он на самом деле может. Однако и здесь есть искажения, которые нужно держать в голове, чтобы не отрываться от реальности.
Начнём с того, что не все результаты исследований попадают в журналы. Это виднее всего на медицинских исследованиях, потому что они требуют заранее опубликовать протокол эксперимента, и можно сравнить его с публикацией по результатам.
▶️В большом исследовании 2004 года “Empirical Evidence for Selective Reporting of Outcomes in Randomized Trials” как раз провели такое сравнение.
Приведём пару находок:
▪️в 60% исследований по меньшей мере один побочный эффект лекарства или процедуры из протокола был пропущен в статье;
▪️в 92% исследований по меньшей мере один побочный или ожидаемый эффект не был описан полностью.
Некоторые эффекты не попали в статьи, потому что оказались незначимыми или просто не влезли в ограниченный журналом объём — то есть, это не какой-то злонамеренный обман. Однако же “эффект оказался незначимым” — это тоже полезная информация, и она потерялась.
Применительно к ИИ всё сложнее: это в медицине есть хотя бы протоколы, а в области компьютерных наук если что-то не опубликовано, то всё, об этом не узнать. Но можно предположить, что они страдают теми же проблемами, что и все остальные науки.
Одна из наиболее заметных — база для сравнения результатов. Отсутствие нормальной базы для сравнения. Любые результаты хороши или плохи в сравнении с чем-то: если выбрать слабого конкурента, ваши достижения будут выглядеть лучше, чем на самом деле.
▶️В 2019 году на эту тему вышла статья про рекомендательные алгоритмы — “Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches”.
Там авторы проверили 18 алгоритмов, из которых только 7 удалось воспроизвести. Из них 6 при проверке уступили более ранним методам, хотя заявляли собственное превосходство.
Воспроизводимость экспериментов — отдельная проблема. Их часто сложно повторить и проверить, и часто из-за того, что методика эксперимента не описана достаточно подробно.
▶️В работе “Weak baselines and reporting biases lead to overoptimism in machine learning for fluid-related partial differential equations” выяснили, что модели для решения дифференциальных уравнений их создатели тоже сравнивали со слабыми конкурентами, и в итоге получились завышенные результаты.
▶️И про языковые модели такое есть. Авторы статьи “Measuring what Matters: Construct Validity in Large Language Model Benchmarks” 2025 года изучили, как языковые модели тестируют на надёжность и безопасность.
Оказалось, не все вообще дают определение тому, что измеряют (но в основном дают определения), и что в большинстве работ используются искусственно созданные тесты, а не задачи из реальной жизни, и в итоге результат опять либо завышенный, либо просто неточный.
Только в 16% работ авторы как следует проверили собственные гипотезы, используя статистические методы.
Только в 53,4% работ уделили время доказательству того, что их тест подходит изучаемому вопросу.
🥤Что это значит для нас?
В первую очередь, что не всё написанное в научной работе доказано и теперь непреложный факт. Почти никто никогда не врёт намеренно, но все мы люди, и в научные статьи тоже закрадываются ошибки.
🔸Как минимум, после каждой громкой публикации имеет смысл подождать хотя бы пару месяцев, пока кто-то не попробует воспроизвести результаты.
🔸Как максимум, имеет смысл искать большие мета-обзоры, в которых собрано много статей. Или хотя бы искать несколько отдельных статей и смотреть, согласны между собой разные группы авторов или нет