сегодня я нашла в НКРЯ


Гео и язык канала: Россия, Русский
Категория: Лингвистика


Национальный корпус русского языка на каждый день:
- откуда в текстах девятнадцатого века Шрек
- когда в русском языке появилось слово «чипсы»
- как связаны ВИА Гра и Онегин
- что рифмуется с розой помимо морозов
и другие приключения, серьёзные и не очень

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Лингвистика
Статистика
Фильтр публикаций


✍️✍️✍️ двухромокислая, свинячая утка


раньше тоже была Спасская, а теперь — Ленина

Сегодня пишу из Тюмени, поэтому немного потыкала корпус русской детской литературы (https://detcorpus.ru/search/), чтобы подвердить очевидную гипотезу. Действительно, в детлите больше всего упоминаний Тюмени в книгах главного тюменского детского писателя Владислава Петровича Крапивина (как говорится, вот это новости, вилку нашли на кухне).

Корпус детской литературы классный! Очень давно не заходила, а когда искала там что-то раньше, это было крайне поверхностно, сегодня же потыкала внимательнее и порадовалась. ДетКорпус включает и художку, и поэзию, и нон-фикшен, и критику, есть отличный набор базовых инструментов — коллокации, частотность, ключевые слова.

В общем, все на месте, крайне рекомендую для исследовательских и ностальгических целей — вдруг вы хотели вспомнить, кто из ваших любимых детских авторов чаще всего упоминал мышат (судя по корпусу, Радий Погодин).

#некря


Репост из: Демонтаж красноречия
👍 Была вот такая нелепая новость:

Самое длинное слово в русском языке состоит из 55 букв, однако его можно еще увеличить, если «навешать радикалов». Об этом сообщает Telegram-канал «Подъем» со ссылкой на экспертов Института русистики.
Самое длинное слово в русском языке — это химический термин «тетрагидропиранилциклопентилтетрагидропиридопиридиновые», его обнаружили в названии патента на химическое соединение, которое применяют при производстве лекарств от аллергии и астмы.


«Институт русистики» звучит авторитетно, как будто это какой-то научно-исследовательский институт, возможно, в структуре Академии наук. Но нет, это что-то совершенно левое, да и не называют ничего у нас русистикой, это скорее названия для зарубежных специальностей и институций, занимающихся русским языком. Причем отдельные специалисты могут называться русистами и у нас (как противопоставление германистам, иранистам, китаистам и т. д.).

Совсем бессмысленно считать слова в буквах (на секунду забудем, что бессмысленно считать длину слов вообще). Например, я могу сделать слово какой угодно длины по такой модели: а-а-а-а (и дальше произвольное число букв), и это будет слово русского языка.

Считать длину слова (если уж так хочется) нужно в слогах. И, само собой, химические термины, то есть единицы особой подсистемы языка, вряд ли нас удивят, хочется чего-то такого, что прозвучит в естественном контексте.

Свехдлинных слов в естественных контекстах, конечно, не бывает, но это должен быть хотя бы не специализированный контекст научной лаборатории, куда большинство из нас никогда не попадет.

И я нашел такое слово не из научного подъязыка, которое находится в коллекции НКРЯ, и даже по буквам длиннее химического термина (у того 55, у нашего 80). Это — четырехмиллионнопятьсотсорокасемитысячвосемьсотдвацатитрехквадратнокилометрового. Слово совершенно реальное из книги И. Н. Вирабова «Андрей Вознесенский» (2015), так что это его не лингвисты для НКРЯ придумали.

Есть и менее претенциозное слово покороче, которое даже можно при желании запомнить: недоиндивидуализированные (клик), всего 25 букв, но зато можно ввернуть в застольной беседе.

466 0 1 11 25

четырехмиллионнопятьсотсорокасемитысячвосемьсотдвадцатитрехквадратнокилометрового

Сегодня в НКРЯ нашла не я, а филолог Борис Орехов, и нашёл нечто немножко монструозное из заголовка этого поста.
Попробуем посмотреть, как можно это быстро проверить по корпусу (можно, конечно, и просто спросить Бориса Валерьевича, но так было бы неинтересно :):
1. Для технических задачек такого рода удобнее работать с регулярными выражениями: добавляем в поиск опцию "словоформа с регулярными выражениями"
2. Для русских слов используем только буквы кириллицы — они обозначаются как [а-я]
3. Добавляем указатель на число букв (от 80, раз уж мы точно знаем, что 80 можно) — получаем [а-я]{80,}
Если бы нужно было от 50, вышло бы [а-я]{50,}, если от 30 до 100 — [а-я]{30,100} и тому подобное.
Подробнее про поиск через регулярки можно почитать здесь: https://ruscorpora.ru/page/tool-regexp/

Любуемся на выдачу: да, действительно, слово из заголовка — самое длинное из "естественных" слов, аааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааа (количество а именно такое) и Центральвиссеншафтлихгелээртермэншэнлебэнсбедингунгенфербессэрунгсауссшусстрэффпунктклассэ вряд ли на звание самого длинного слова русского языка в основном корпусе НКРЯ могут претендовать :)

Ссылка: https://ruscorpora.ru/s/0gjpN


Возможно, вы ещё не видели рифму "с Днем Варенья — День Рожденье", а она в акцентологическом корпусе есть (там чего только нет)


В отпуске на Байкале очень уж было красиво, вот и не писала толком ничего;

Вот кусочек про бобра и бабра (тоже немножко иркутского в некотором роде) от Хлебникова — так сказать, весьма вольная, поэтическая этимология


Сегодня очень простая загадка про сравнение похожих слов для разных периодов :) Угадаете, какое существительное закрыли?
Конец XIX века и середина XX-го — прямо-таки хрестоматийный пример для тестирования инструмента "Портрета слова" :)

775 0 4 11 29

Репост из: Системный Блокъ
Язык через призму данных — новый проект «Системного Блока»

Как проследить, менялось ли значение слова со временем? Как сравнить между собой тексты разных авторов? И зачем лингвисты считают миллионы слов вместо того, чтобы читать книги?

Мы запускаем новый проект о корпусной лингвистике — направлении, которое изучает язык с помощью больших коллекций текстов. На одной странице мы собрали материалы, которые помогут разобраться, как устроены языковые корпусы, что можно узнать с их помощью и как самостоятельно анализировать тексты — даже без опыта в программировании.

Вы узнаете, что такое Национальный корпус русского языка и почему им пользуются не только лингвисты, но и журналисты, учителя и литературоведы. Мы рассказали, как корпус создается, как нейросети помогают размечать слова, зачем нужны поэтические и драматургические корпусы и почему одного НКРЯ недостаточно для всех исследовательских задач.

Мы собрали реальные примеры исследований: как алгоритмы определяют сюжеты в песнях — от рок-баллад до Тейлор Свифт, как на текстах корпуса stihi.ru изучать наивную поэзию, как анализ текстов помогает исследовать орфографию и даже искать животных в детской литературе.

Для тех, кто хочет попробовать корпусный анализ самостоятельно, есть практические руководства. А еще — тесты, с помощью которых можно узнать что-то неожиданное о русском языке. Например, какие ругательства встречаются в НКРЯ или что значат редкие слова в произведениях Льва Толстого.

Изучить проект — по ссылке.

🤖 «Системный Блокъ» @sysblok


Не без моего участия у дорогих коллег "Системного Блокъа" вышел большой сборник статей и материалов про корпусную лингвистику и похожие на неё вещи: советую посмотреть, там есть во что погрузиться :)


Репост из: Boris Orekhov
Sounds_Conclusion.pdf
453.0Кб
Как тут не вспомнить? Тем более, что там и башкирский есть.


И унесу из комментариев, потому что знаю, что в канале есть люди, которые любят не только маленькие финтифлюшки, но и большие вещи для контекста :)


what does the fox say


Вдогонку: вот график в ГИКРЯ по банальному слову "авторка" — при этом, как ни странно, большая частотность заметна как раз в 2007-2008. Вдруг догадаетесь, с чем это связано?


Вот только-только писала про свежие слова по нынешним меркам, а сегодня увидела в новых словах за 1967 год авторицу, бизнес-леди и драматургессу разом, задумалась о разнообразии советских феминитивов :)

#некря


Ещё и пулпулак теперь найден ⛲️


Благодаря релизу ГИКРЯ наконец-то смогла оценить распространённость грядушки в реальной речи!

(Венесуэла радует, очень нравится, когда на данные корпуса чуточку влияет экстравагантная манера людей заполнять анкету ВК — например, слово "кринж" использовало довольно много людей 1900-1909 года рождения согласно профилю ВК)


Волею судеб пьём чай среди деревьев; поскольку «что вижу, о том пою», пошла смотреть, какие существуют -колейки, кроме узкоколеек и одноколеек.

Неудивительно, что бывают ширококолейки (тоже не поддавшиеся гаплологии) и двухколейки.

Загадочнее просто «колейка»: в двух случаях это имя, скорее всего, сокращенная версия Николая. В третьем же встречаются целых 64 колейки (а перед ними — 3 рубля).

Ссылка: https://ruscorpora.ru/s/y8xZV


Чтение идёт настолько в час по чайной ложке, что за год с лишним я добралась до Сухово-Кобылина и встретила там затасканное, мистическое, вездесущее словечко "аффирмация" — правда, не то чтобы в современном значении.

(И очень нравится русский аналог "самонастрой" в примере номер три!)




Репост из: НКРЯ Национальный корпус русского языка
6 июня, в день рождения великого русского поэта Александра Сергеевича Пушкина, отмечается День русского языка. В честь этого праздника мы подготовили для вас небольшой тест, отсылающий к Сравнению скетчей в Основном корпусе НКРЯ. Сможете ли вы угадать, какие два слова участвуют в этих сравнениях?

Показано 20 последних публикаций.