🔴 Прямое включение с полей конгресса DH-2026 ✨
💬 В эфире Маргарита Кирина, преподаватель департамента филологии, младший научный сотрудник Лаборатории языковой конвергенции НИУ ВШЭ — Санкт-Петербург:
🙂 «DH-конференция традиционно объединяла исследователей из различных областей гуманитарного (и не только) знания, и этот год не исключение. На мой взгляд, можно выделить два основных вектора вопросов, которые сейчас особенно волнуют исследователей и часто освещаются в докладах на конференции: большие языковые модели и цифровое сохранение культурного наследия.
🔜Организаторы отмечают, что с развитием искусственного интеллекта возрастает ценность качественно аннотированных, даже в небольшом количестве, данных, причем для разных языков и специальных доменов. Этому же посвящено и отдельное направление конференции — “Annotating | Beyond Patterns: Interpretation with Small Data”.
❗️ Интересный пример — один из прозвучавших докладов от исследователей из Гронингенского университета. Их проект посвящен разработке многоязычной методологии аннотирования персонажей на материале фанфиков. Большинство существующих инструментов для анализа литературных текстов англоцентричны, а инструкции по разметке — недостаточно прозрачны. Чтобы преодолеть этот разрыв, команда проекта создает датасет на основе 7 языков. Аннотирование охватывает четыре задачи: выделение упоминаний персонажей и кореференции, определение говорящего и адресата в диалогах, разметку характеристик персонажей и отношений между ними.
🎁 Одним из ключевых результатов авторы называют процесс разработки рекомендаций с включенным фидбэком от аннотаторов: так, аннотаторы регулярно обсуждали спорные случаи, уточняли правила и документировали принятые решения. Благодаря этому удалось учесть языковые особенности и сделать правила более универсальными и воспроизводимыми.
🖥 Материалы проекта в скором времени будут опубликованы на GitHub: https://github.com/GOLEM-lab.
😉 Разметкой персонажей занимаемся и мы в Лаборатории языковой конвергенции на материале Корпуса русского рассказа, поэтому было крайне интересно познакомиться с коллегами и сравнить их подходы к аннотированию с теми, которые используются нами».
📸 Фотография конгресс-холла из Тэджона, где проходит #DH2026 от автора реплики.
📹 Кстати, Маргарита Кирина выступала дискутантом на заседании №41 семинара «Цифровая среда».
#dhконференции #ADHO
#dhконференции@DHRIsfu
💬 В эфире Маргарита Кирина, преподаватель департамента филологии, младший научный сотрудник Лаборатории языковой конвергенции НИУ ВШЭ — Санкт-Петербург:
🙂 «DH-конференция традиционно объединяла исследователей из различных областей гуманитарного (и не только) знания, и этот год не исключение. На мой взгляд, можно выделить два основных вектора вопросов, которые сейчас особенно волнуют исследователей и часто освещаются в докладах на конференции: большие языковые модели и цифровое сохранение культурного наследия.
🔜Организаторы отмечают, что с развитием искусственного интеллекта возрастает ценность качественно аннотированных, даже в небольшом количестве, данных, причем для разных языков и специальных доменов. Этому же посвящено и отдельное направление конференции — “Annotating | Beyond Patterns: Interpretation with Small Data”.
❗️ Интересный пример — один из прозвучавших докладов от исследователей из Гронингенского университета. Их проект посвящен разработке многоязычной методологии аннотирования персонажей на материале фанфиков. Большинство существующих инструментов для анализа литературных текстов англоцентричны, а инструкции по разметке — недостаточно прозрачны. Чтобы преодолеть этот разрыв, команда проекта создает датасет на основе 7 языков. Аннотирование охватывает четыре задачи: выделение упоминаний персонажей и кореференции, определение говорящего и адресата в диалогах, разметку характеристик персонажей и отношений между ними.
🎁 Одним из ключевых результатов авторы называют процесс разработки рекомендаций с включенным фидбэком от аннотаторов: так, аннотаторы регулярно обсуждали спорные случаи, уточняли правила и документировали принятые решения. Благодаря этому удалось учесть языковые особенности и сделать правила более универсальными и воспроизводимыми.
🖥 Материалы проекта в скором времени будут опубликованы на GitHub: https://github.com/GOLEM-lab.
😉 Разметкой персонажей занимаемся и мы в Лаборатории языковой конвергенции на материале Корпуса русского рассказа, поэтому было крайне интересно познакомиться с коллегами и сравнить их подходы к аннотированию с теми, которые используются нами».
📸 Фотография конгресс-холла из Тэджона, где проходит #DH2026 от автора реплики.
📹 Кстати, Маргарита Кирина выступала дискутантом на заседании №41 семинара «Цифровая среда».
#dhконференции #ADHO
#dhконференции@DHRIsfu