🔥
Традиционные научные новости (но непривычные!)
Soil Data Extraction from Scientific Publications Using Large Language Models (
M. A. Soldatkina, V. V. Klyueva, M. V. Timofeeva, M. A. Kochneva, and D. S. Fomin) — новая статья коллаборации нашей лаборатории и
лаб. цифровых двойников агроланшафтов ФИЦ "Почвенный институт им. В.В. Докучаева", вышедшая в журнале
Eurasian Soil Science.
📌 В этом исследовании рассматривается
возможность применения больших языковых моделей для автоматического извлечения данных из научных статей в области почвоведения на основе корпуса русскоязычных статей из журнала «Почвоведение» (2019–2020 г.г.).
📝
Качество извлечения данных оценивалось по ответам GPT-4 Turbo на перечень из 58 вопросов, касающихся характеристик объектов и условий исследования, типов почв, методов и результатов измерений. Сравнивались автоматизированный и экспертный подходы к оценке корректности ответов модели.
📣 Цель исследования состояла в том, чтобы оценить, насколько качественно большие языковые модели могут извлекать и проверять данные из научных статей.
📌
Результаты работы базовой модели сравнивались с эталонной разметкой, составленной экспертами, детерминированными метриками, основанными на лексическом перекрытии, а также с оценками нескольких альтернативных языковых моделей, выступающих в качестве независимых «судей». Интегрированный показатель F1 для отдельных вопросов составил не менее 0,73, а средние значения по тематическим группам вопросов достигли 0,91–0,99. Корреляция между наиболее согласованной моделью оценки Gemini 2.5 Flash и оценками экспертов достигла 0,8 и объяснила около 60 % вариаций в экспертных оценках, в то время как классические n-граммные метрики оказались значительно менее информативными.
🟪
Эти результаты показывают, что большие языковые модели могут стать основой масштабируемого конвейера для автоматического создания баз данных о свойствах почвы и сокращения ручного труда при анализе научных текстов.
#physlab_papers