TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Dokuchaev PhysLab

21 May, 15:34

Открыть в Telegram Поделиться Пожаловаться

🔥 Традиционные научные новости (но непривычные!)

Soil Data Extraction from Scientific Publications Using Large Language Models (M. A. Soldatkina, V. V. Klyueva, M. V. Timofeeva, M. A. Kochneva, and D. S. Fomin) — новая статья коллаборации нашей лаборатории и лаб. цифровых двойников агроланшафтов ФИЦ "Почвенный институт им. В.В. Докучаева", вышедшая в журнале Eurasian Soil Science.

📌 В этом исследовании рассматривается возможность применения больших языковых моделей для автоматического извлечения данных из научных статей в области почвоведения на основе корпуса русскоязычных статей из журнала «Почвоведение» (2019–2020 г.г.).

📝 Качество извлечения данных оценивалось по ответам GPT-4 Turbo на перечень из 58 вопросов, касающихся характеристик объектов и условий исследования, типов почв, методов и результатов измерений.
Сравнивались автоматизированный и экспертный подходы к оценке корректности ответов модели.

📣 Цель исследования состояла в том, чтобы оценить, насколько качественно большие языковые модели могут извлекать и проверять данные из научных статей.

📌 Результаты работы базовой модели сравнивались с эталонной разметкой, составленной экспертами, детерминированными метриками, основанными на лексическом перекрытии, а также с оценками нескольких альтернативных языковых моделей, выступающих в качестве независимых «судей».
Интегрированный показатель F1 для отдельных вопросов составил не менее 0,73, а средние значения по тематическим группам вопросов достигли 0,91–0,99. Корреляция между наиболее согласованной моделью оценки Gemini 2.5 Flash и оценками экспертов достигла 0,8 и объяснила около 60 % вариаций в экспертных оценках, в то время как классические n-граммные метрики оказались значительно менее информативными.

🟪 Эти результаты показывают, что большие языковые модели могут стать основой масштабируемого конвейера для автоматического создания баз данных о свойствах почвы и сокращения ручного труда при анализе научных текстов.

#physlab_papers
Soil Data Extraction from Scientific Publications Using Large Language Models
Eurasian Soil Science - This study examines the applicability of large language models for automated data extraction from soil-science research papers, using a corpus of Russian-language articles...

218 0 2 13
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot