🔥 Традиционные научные новости (но непривычные!)
Soil Data Extraction from Scientific Publications Using Large Language Models (M. A. Soldatkina, V. V. Klyueva, M. V. Timofeeva, M. A. Kochneva, and D. S. Fomin) — новая статья коллаборации нашей лаборатории и лаб. цифровых двойников агроланшафтов ФИЦ "Почвенный институт им. В.В. Докучаева", вышедшая в журнале Eurasian Soil Science.
📌 В этом исследовании рассматривается возможность применения больших языковых моделей для автоматического извлечения данных из научных статей в области почвоведения на основе корпуса русскоязычных статей из журнала «Почвоведение» (2019–2020 г.г.).
📝 Качество извлечения данных оценивалось по ответам GPT-4 Turbo на перечень из 58 вопросов, касающихся характеристик объектов и условий исследования, типов почв, методов и результатов измерений.
Сравнивались автоматизированный и экспертный подходы к оценке корректности ответов модели.
📣 Цель исследования состояла в том, чтобы оценить, насколько качественно большие языковые модели могут извлекать и проверять данные из научных статей.
📌 Результаты работы базовой модели сравнивались с эталонной разметкой, составленной экспертами, детерминированными метриками, основанными на лексическом перекрытии, а также с оценками нескольких альтернативных языковых моделей, выступающих в качестве независимых «судей».
Интегрированный показатель F1 для отдельных вопросов составил не менее 0,73, а средние значения по тематическим группам вопросов достигли 0,91–0,99. Корреляция между наиболее согласованной моделью оценки Gemini 2.5 Flash и оценками экспертов достигла 0,8 и объяснила около 60 % вариаций в экспертных оценках, в то время как классические n-граммные метрики оказались значительно менее информативными.
🟪 Эти результаты показывают, что большие языковые модели могут стать основой масштабируемого конвейера для автоматического создания баз данных о свойствах почвы и сокращения ручного труда при анализе научных текстов.
#physlab_papers
Soil Data Extraction from Scientific Publications Using Large Language Models (M. A. Soldatkina, V. V. Klyueva, M. V. Timofeeva, M. A. Kochneva, and D. S. Fomin) — новая статья коллаборации нашей лаборатории и лаб. цифровых двойников агроланшафтов ФИЦ "Почвенный институт им. В.В. Докучаева", вышедшая в журнале Eurasian Soil Science.
📌 В этом исследовании рассматривается возможность применения больших языковых моделей для автоматического извлечения данных из научных статей в области почвоведения на основе корпуса русскоязычных статей из журнала «Почвоведение» (2019–2020 г.г.).
📝 Качество извлечения данных оценивалось по ответам GPT-4 Turbo на перечень из 58 вопросов, касающихся характеристик объектов и условий исследования, типов почв, методов и результатов измерений.
Сравнивались автоматизированный и экспертный подходы к оценке корректности ответов модели.
📣 Цель исследования состояла в том, чтобы оценить, насколько качественно большие языковые модели могут извлекать и проверять данные из научных статей.
📌 Результаты работы базовой модели сравнивались с эталонной разметкой, составленной экспертами, детерминированными метриками, основанными на лексическом перекрытии, а также с оценками нескольких альтернативных языковых моделей, выступающих в качестве независимых «судей».
Интегрированный показатель F1 для отдельных вопросов составил не менее 0,73, а средние значения по тематическим группам вопросов достигли 0,91–0,99. Корреляция между наиболее согласованной моделью оценки Gemini 2.5 Flash и оценками экспертов достигла 0,8 и объяснила около 60 % вариаций в экспертных оценках, в то время как классические n-граммные метрики оказались значительно менее информативными.
🟪 Эти результаты показывают, что большие языковые модели могут стать основой масштабируемого конвейера для автоматического создания баз данных о свойствах почвы и сокращения ручного труда при анализе научных текстов.
#physlab_papers