сегодня я нашла в НКРЯ


Гео и язык канала: Россия, Русский
Категория: Лингвистика


Национальный корпус русского языка на каждый день:
- откуда в текстах девятнадцатого века Шрек
- когда в русском языке появилось слово «чипсы»
- как связаны ВИА Гра и Онегин
- что рифмуется с розой помимо морозов
и другие приключения, серьёзные и не очень

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Лингвистика
Статистика
Фильтр публикаций


Репост из: Грамота.ру
В третий четвертый раз закинул он невод!

⚡ Портал «Грамота.ру» объявляет сбор слов-претендентов на звание слова года — 2026.

💡 Предлагайте новые слова, которые привлекли ваше внимание и получили распространение в этом году или в последние пару лет, а также слова, которые получили новое значение в последнее время.

Что такое слово года по версии Грамоты?

Прежде всего, Грамота следит за актуальными процессами в русском языке. Рисуя лингвистический портрет уходящего года, мы ищем новые слова, которые обогащают русский язык, отражают новые явления и смыслы.

⏳ Оглядываясь назад, невозможно поверить, что слово «лабубу» уже забыто, а мода на квадроберов себя изжила. Наверняка и в этом году были такие слова-однодневки.

🎯 Задача Грамоты — проанализировать всех кандидатов с помощью количественных и качественных методов, чтобы составить короткий список слов, которые имеют шанс задержаться в языке. Новые слова попадут в цифровой метасловарь Грамоты с толкованием и грамматическими характеристиками. А главное слово выберут из короткого списка представители лингвистического сообщества.

📅 Сбор слов продлится до 10 октября.

Ждем ваши предложения в комментариях!

#Грамота_Слово_года_2026


Опять ловим слова года! Из совсем свежего меня очень забавляют "могнуть" и "ларпить", и вообще кажется, что в этом году существительные не так доминируют, как прежде.


Двортерьер и интерьер

Хотела посмотреть на самых популярных терьеров в корпусе, не предвидела, что -терьером может быть не только собака.

Удивлена настолько огромной популярности фокстерьеров, побеждают с огромным отрывом.

Популярное обозначение дворняги, «двортерьер», до 2001 в корпус не попадается: мне, наоборот, казалось, что это что-то позднесоветское в первую очередь.

Ещё увидела в 1912 году «оредальтерьера из Германии», сначала подумала, что это эрдельтерьер, но это английская порода. Может, конечно, в Германии их тоже разводили, а может, просто какая-то иная разновидность. Загадка.
Управление Ю.-З. ж.д., как мы уже сообщали, решило выписать из Германии немецких овчарок и оредальтерьеров


#основной


периодически попадаю в ситуации, когда говорю что-то вроде "надо бы в поезд еще анаком взять", вижу недоумение на лице мужа и уточняю "ну, в смысле, дошик"

судя по ГИКРЯ, и правда какая-то относительно южная история, вот такой нишевый регионализм

в примерах примерно такое же превращение в нарицательное обозначение, как и с дошираком, вот, например
Мы гуляли, как будто с уроков отпустили пораньше и можно есть сухой анаком на гаражах, придумывать игры на ходу, набивать болячки и потом бежать домой, чтобы успеть посмотреть' Шамана — кинга' .

470 0 7 18 31

Репост из: Журнал | Смысловая 226
Тест: «Графоман» или право имеете?

Ко дню рождения Льва Николаевича Толстого мы вместе с лингвистом Марией Подрядчиковой собрали простой, но занимательный тест, который с достоверной точностью поможет определить, в чьей вы на самом деле команде: Толстого или Достоевского?🔥

Не верите? Давайте проверять!


К дню рождения Толстого в Смысловой вышел вот такой полушуточный тест, основанный на частотностях из корпуса «Русская классика».

Очень боялась, что выйдет жуткий дисбаланс, но кажется, всё же распределяет на разные стороны — хоть и не всегда люди согласны ♠️ ♠️


Раз-глаз, градъ-братъ

Послезавтра иду слушать лекцию про древнерусский*, вдохновилась, решила посравнивать древнерусский корпус с основным и немножко залипла уже просто на топ-10 самых частотных существительных.

Нравится, как богъ сменился человеком — как говорится, многое говорит о нашем обществе. Случайные рифмы раз-глаз и градъ-братъ на 9-10 местах тоже повеселили (если это потянуло бы на рифму и в древнерусском, конечно).

День (дьнь) стабилен, лѣто сменилось годом (впрочем, все ещё оставаясь в настоящем в формах вроде 5 лет).

А ещё поменялась даже не сама лексика, а её разнообразие: если посмотреть на второй столбик, «употреблений на миллион слов», можно заметить, что в древнерусском самые частотные слова частотнее.

Впрочем, хотя бы в глаголах топ-1 совпадает — «быть» вне всякой конкуренции :)

*(Если вы в Москве, рекомендую! Это ещё и в Воронцовском парке, а он ранней осенью чудо как хорош)


🍁🍁🍁

#акцентологический


✍️✍️✍️ двухромокислая, свинячая утка


раньше тоже была Спасская, а теперь — Ленина

Сегодня пишу из Тюмени, поэтому немного потыкала корпус русской детской литературы (https://detcorpus.ru/search/), чтобы подвердить очевидную гипотезу. Действительно, в детлите больше всего упоминаний Тюмени в книгах главного тюменского детского писателя Владислава Петровича Крапивина (как говорится, вот это новости, вилку нашли на кухне).

Корпус детской литературы классный! Очень давно не заходила, а когда искала там что-то раньше, это было крайне поверхностно, сегодня же потыкала внимательнее и порадовалась. ДетКорпус включает и художку, и поэзию, и нон-фикшен, и критику, есть отличный набор базовых инструментов — коллокации, частотность, ключевые слова.

В общем, все на месте, крайне рекомендую для исследовательских и ностальгических целей — вдруг вы хотели вспомнить, кто из ваших любимых детских авторов чаще всего упоминал мышат (судя по корпусу, Радий Погодин).

#некря


Репост из: Демонтаж красноречия
👍 Была вот такая нелепая новость:

Самое длинное слово в русском языке состоит из 55 букв, однако его можно еще увеличить, если «навешать радикалов». Об этом сообщает Telegram-канал «Подъем» со ссылкой на экспертов Института русистики.
Самое длинное слово в русском языке — это химический термин «тетрагидропиранилциклопентилтетрагидропиридопиридиновые», его обнаружили в названии патента на химическое соединение, которое применяют при производстве лекарств от аллергии и астмы.


«Институт русистики» звучит авторитетно, как будто это какой-то научно-исследовательский институт, возможно, в структуре Академии наук. Но нет, это что-то совершенно левое, да и не называют ничего у нас русистикой, это скорее названия для зарубежных специальностей и институций, занимающихся русским языком. Причем отдельные специалисты могут называться русистами и у нас (как противопоставление германистам, иранистам, китаистам и т. д.).

Совсем бессмысленно считать слова в буквах (на секунду забудем, что бессмысленно считать длину слов вообще). Например, я могу сделать слово какой угодно длины по такой модели: а-а-а-а (и дальше произвольное число букв), и это будет слово русского языка.

Считать длину слова (если уж так хочется) нужно в слогах. И, само собой, химические термины, то есть единицы особой подсистемы языка, вряд ли нас удивят, хочется чего-то такого, что прозвучит в естественном контексте.

Свехдлинных слов в естественных контекстах, конечно, не бывает, но это должен быть хотя бы не специализированный контекст научной лаборатории, куда большинство из нас никогда не попадет.

И я нашел такое слово не из научного подъязыка, которое находится в коллекции НКРЯ, и даже по буквам длиннее химического термина (у того 55, у нашего 80). Это — четырехмиллионнопятьсотсорокасемитысячвосемьсотдвацатитрехквадратнокилометрового. Слово совершенно реальное из книги И. Н. Вирабова «Андрей Вознесенский» (2015), так что это его не лингвисты для НКРЯ придумали.

Есть и менее претенциозное слово покороче, которое даже можно при желании запомнить: недоиндивидуализированные (клик), всего 25 букв, но зато можно ввернуть в застольной беседе.

665 0 1 11 26

четырехмиллионнопятьсотсорокасемитысячвосемьсотдвадцатитрехквадратнокилометрового

Сегодня в НКРЯ нашла не я, а филолог Борис Орехов, и нашёл нечто немножко монструозное из заголовка этого поста.
Попробуем посмотреть, как можно это быстро проверить по корпусу (можно, конечно, и просто спросить Бориса Валерьевича, но так было бы неинтересно :):
1. Для технических задачек такого рода удобнее работать с регулярными выражениями: добавляем в поиск опцию "словоформа с регулярными выражениями"
2. Для русских слов используем только буквы кириллицы — они обозначаются как [а-я]
3. Добавляем указатель на число букв (от 80, раз уж мы точно знаем, что 80 можно) — получаем [а-я]{80,}
Если бы нужно было от 50, вышло бы [а-я]{50,}, если от 30 до 100 — [а-я]{30,100} и тому подобное.
Подробнее про поиск через регулярки можно почитать здесь: https://ruscorpora.ru/page/tool-regexp/

Любуемся на выдачу: да, действительно, слово из заголовка — самое длинное из "естественных" слов, аааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааа (количество а именно такое) и Центральвиссеншафтлихгелээртермэншэнлебэнсбедингунгенфербессэрунгсауссшусстрэффпунктклассэ вряд ли на звание самого длинного слова русского языка в основном корпусе НКРЯ могут претендовать :)

Ссылка: https://ruscorpora.ru/s/0gjpN


Возможно, вы ещё не видели рифму "с Днем Варенья — День Рожденье", а она в акцентологическом корпусе есть (там чего только нет)


В отпуске на Байкале очень уж было красиво, вот и не писала толком ничего;

Вот кусочек про бобра и бабра (тоже немножко иркутского в некотором роде) от Хлебникова — так сказать, весьма вольная, поэтическая этимология


Сегодня очень простая загадка про сравнение похожих слов для разных периодов :) Угадаете, какое существительное закрыли?
Конец XIX века и середина XX-го — прямо-таки хрестоматийный пример для тестирования инструмента "Портрета слова" :)

775 0 4 11 29

Репост из: Системный Блокъ
Язык через призму данных — новый проект «Системного Блока»

Как проследить, менялось ли значение слова со временем? Как сравнить между собой тексты разных авторов? И зачем лингвисты считают миллионы слов вместо того, чтобы читать книги?

Мы запускаем новый проект о корпусной лингвистике — направлении, которое изучает язык с помощью больших коллекций текстов. На одной странице мы собрали материалы, которые помогут разобраться, как устроены языковые корпусы, что можно узнать с их помощью и как самостоятельно анализировать тексты — даже без опыта в программировании.

Вы узнаете, что такое Национальный корпус русского языка и почему им пользуются не только лингвисты, но и журналисты, учителя и литературоведы. Мы рассказали, как корпус создается, как нейросети помогают размечать слова, зачем нужны поэтические и драматургические корпусы и почему одного НКРЯ недостаточно для всех исследовательских задач.

Мы собрали реальные примеры исследований: как алгоритмы определяют сюжеты в песнях — от рок-баллад до Тейлор Свифт, как на текстах корпуса stihi.ru изучать наивную поэзию, как анализ текстов помогает исследовать орфографию и даже искать животных в детской литературе.

Для тех, кто хочет попробовать корпусный анализ самостоятельно, есть практические руководства. А еще — тесты, с помощью которых можно узнать что-то неожиданное о русском языке. Например, какие ругательства встречаются в НКРЯ или что значат редкие слова в произведениях Льва Толстого.

Изучить проект — по ссылке.

🤖 «Системный Блокъ» @sysblok


Не без моего участия у дорогих коллег "Системного Блокъа" вышел большой сборник статей и материалов про корпусную лингвистику и похожие на неё вещи: советую посмотреть, там есть во что погрузиться :)


Репост из: Boris Orekhov
Sounds_Conclusion.pdf
453.0Кб
Как тут не вспомнить? Тем более, что там и башкирский есть.


И унесу из комментариев, потому что знаю, что в канале есть люди, которые любят не только маленькие финтифлюшки, но и большие вещи для контекста :)


what does the fox say

Показано 20 последних публикаций.