Язык через призму данных — новый проект «Системного Блока»Как проследить, менялось ли значение слова со временем? Как сравнить между собой тексты разных авторов? И зачем лингвисты считают миллионы слов вместо того, чтобы читать книги?
Мы запускаем
новый проект о корпусной лингвистике — направлении, которое изучает язык с помощью больших коллекций текстов. На одной странице мы собрали материалы, которые помогут разобраться,
как устроены языковые корпусы, что можно узнать с их помощью и как самостоятельно анализировать тексты — даже без опыта в программировании.
Вы узнаете, что такое
Национальный корпус русского языка и почему им пользуются не только лингвисты, но и журналисты, учителя и литературоведы. Мы рассказали, как корпус создается, как нейросети помогают
размечать слова, зачем нужны поэтические и драматургические корпусы и почему одного НКРЯ недостаточно для всех исследовательских задач.
Мы собрали реальные примеры исследований: как алгоритмы
определяют сюжеты в песнях — от рок-баллад до Тейлор Свифт, как на текстах корпуса
stihi.ru изучать наивную поэзию, как анализ текстов помогает
исследовать орфографию и даже
искать животных в детской литературе.
Для тех, кто хочет попробовать корпусный анализ самостоятельно, есть практические руководства. А еще — тесты, с помощью которых можно узнать что-то неожиданное о русском языке. Например, какие
ругательства встречаются в НКРЯ или что значат
редкие слова в произведениях Льва Толстого.
Изучить проект —
по ссылке.
🤖 «Системный Блокъ»
@sysblok