Цифровой филолог👩‍💻


Гео и язык канала: Россия, Русский
Категория: Лингвистика


Канал об электронных филологических ресурсах: словарях, проектах, текстовых корпусах,базах данных, лингвистических программах.
Автор канала — Рогожина Елена Игоревна (@Elena_Rechnaya), канд.филол. наук
Чат: t.me/digital_philologist_chat

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Лингвистика
Статистика
Фильтр публикаций


Репост из: Центр технологий для общества Yandex Cloud
▫️ Центр технологий для общества Yandex Cloud и Яндекс Практикум запускают Школу преподавателей облачных технологий!

С 5 октября 2026 года стартует бесплатная онлайн-программа для преподавателей, it-специалистов, а также исследователей из вузов и колледжей — всех, кто хочет интегрировать облачные технологии, аналитику данных и ИИ в образовательный процесс.

За 10 недель участники освоят сервисы Yandex Cloud и научатся проектировать практико-ориентированные задания на реальных инструментах: от DataLens и AI Studio до Terraform и Kubernetes. Программа включает три специализации: «Работа с данными и BI-аналитика», «Облачная инфраструктура и DevOps» и «Машинное обучение, искусственный интеллект и агенты». Так каждый участник школы сможет выбрать интересную лично ему траекторию!


🔘Учиться будем онлайн: интерактивные уроки, вебинары с экспертами, чат поддержки и проектная работа на материале собственного курса. По итогам школы участники получат сертификат повышения квалификации и готовое учебное решение для внедрения в вузе или колледже.


Сегодня более 70% IT-компаний работают в облаке, а требования работодателей меняются быстрее, чем обновляются образовательные программы. Школа помогает опережать эти изменения — без переписывания всей дисциплины, но с живыми кейсами и инструментами, которые уже используют в индустрии.

➡️Успейте подать заявку до 30 сентября, и до встречи в Школе преподавателей облачных технологий!

⚪️Подписывайтесь: @ycsocialtech


Репост из: Яндекс Книги
Привет,
это команда Яндекс Книг с новостью:

теперь вы можете узнать о персонажах прямо во время чтения или прослушивания.

В открытой книге кликаете на люмена (справа в читалке) ➡️ «О персонажах» — и получаете краткую справку о любом герое: кто такой, какова его роль и как он связан с остальными.

Удобно, если вы взялись за Толстого, вернулись к нему после трёхнедельного перерыва и уже не очень помните, кто такой этот Берг и зачем он вообще нужен.

Что ещё важно: спойлеров не будет. ИИ-компаньон знает, до какого места вы дочитали, и рассказывает только о том, что уже было.

Кто такой люмен?
⬇️
⬇️
Это будущий ИИ-компаньон, первые функции которого уже появляются в развлекательных сервисах Яндекса. У каждого подписчика — свой уникальный люмен. Если вы ещё не пробудили своего ИИ-компаньона, можете сделать это прямо в приложении Яндекс Книг или на сайте.


Функция уже работает для большинства книг, обновляйте приложение и пробуйте, например, на этой подборке. Ждём в комментах скриншоты 👀

Любим,
Яндекс Книги
🔴


Репост из: cool.zip
невероятной красоты сайт о Туве Янсон 🌸 (!!). иллюстрированный таймлайн, биография, книги и комиксы, редкие фото

открывать если хочется захотеть жить


Из поста коллеги узнала о новом фольклорном проекте "Фолкъ-Толкъ", который посвящён русским традициям на Урале.

Проект включает архив, где можно найти экспедиционные записи, записи лекций, семинаров и мастер-классов, просветительские фильмы, методические фильмы и реконструкции, музыкальные видеоклипы, подкасты, иллюстрации уральских костюмов с описанием деталей, библиотеку и материалы к программам

В архиве пока не очень много материалов, но проект кажется перспективным и интересным.

Другие фольклорные проекты

🧩Костромской архив этнолингвистических материалов (см. пост)
🧩Фольклорный архив Факультета гуманитарных наук ВШЭ (см. пост)
🧩Проект "Родная среда" (см. пост)


#архивы@digital_philologist
#проекты@digital_philologist
#фольклор@digital_philologist


Digital Dante — это семантическое издание "Божественной комедии" Данте Алигьери от Колумбийского университета.

Разделы

В Divine Comedy представлен текст Данте с англ. переводами. На каждой странице песни есть иллюстрации из Библиотеки редких книг и рукописей Колумбийского университета и аудиозаписи.

Цифровое издание сопровождается первым комментарием, опубликованным в цифровом формате Commento Baroliniano. Его можно читать отдельно или как целостное осмысление произведения.

Intertextual Dante — это цифровой инструмент для визуализации интертекстуальных связей в "Божественной комедии".

Image содержит исследования о художественных интерпретациях Данте и иллюстрации.

Sound посвящен акустическим и музыковедческим исследованиям Данте и его мира.

В History представлены оригинальные исследования исторического характера.

Text содержит оригинальные исследования текста произведения. Здесь размещена избранная библиотека произведений Данте на ориг. итал. яз. и англ. переводы.

#литература@digital_philologist


В Синтаксическом корпусе теперь можно отбирать тексты, для предложений которых доступна семантическая структура.

Функция доступна при создании подкорпуса.


#НКРЯ@digital_philologist


Репост из: НКРЯ Национальный корпус русского языка
Древнерусский корпус пополнен 129 тематическими комплексами экстратекстов на восточнославянских рукописях XII–XIV вв. — добавлено больше 230 записей общим объемом 5 тысяч слов. Учтены современные лингвистические публикации. Тематическая метаразметка позволяет выбрать отдельный подкорпус молитв, бытовых заметок или литературных миниатюр. В корпусе появилось 200 «новых» древнерусских лексем, в том числе предки таких привычных нам слов, как крючок, любитель, мешать, связать, непременный, горский, снова, грубо.


Репост из: Гуманитарии в цифре
😉 LLM + R

🔜 10 августа в 16:00 (msk) Ольга Алиева проводит трёхчасовой мастер-класс по работе с большими языковыми моделями для гуманитариев.

🖥 Опыт программирования не требуется, но нужно базовое знакомство с основами языка R.

🕓 Подробное описание и запись на Timepad.

❗️ Для подписчиков нашего канала действует промокод на скидку:
DHRI

🔜 Приходите, это не страшно и очень полезно 💻


Настоящая книга готовилась к 2001 г. — юбилейному "году Даля", но вышла только в 2007 году, поскольку подготовка к печати рукописных офенских словарей оказалась делом сложным и потребовала большего времени. В книге четыре части:

1. Словари народного тайноречия (об истории изучения русских арго в ХVIII—XIX вв. и роли В.И. Даля в создании первого свода лексики "офенских" языков);
2. "Словарь языка шерстобитов" (о "жгонском" языке);
3. Условный язык петербургских мошенников;
4. Арготическая лексика в словарях русского языка;

и собственно сами словари (Словарь мазуриков, шерстобитов, офенского языка).

Символично, что в этом году отмечается год Даля: 225 лет со дня рождения лексикографа.

#словари@digital_philologist


Как и обещала, делюсь ссылкой на компьютерную программу с рукописными словарями.

Папку нужно скачать, разархивировать. Программа не требует установки. Вам нужен файл "CDBook_2x". После этого запустится программа. Ее можно читать как обычную электронную книгу, передвигаясь по оглавлению (см. слева вкладку "Тексты"). При нажатии на "+" раскроются главы и параграфы.

Также можно пользоваться вкладкой "Поиск".

Инструменты
Сверху на панели инструментов есть стрелки « и » для переключения с одного раздела на другой. Можно скопировать любой фрагмент текста (для этого нужно предварительно выделить необходимый текст) и нажать на кнопку 📄, подготовить для печати 🖨, оставить заметку📝, справа есть возможность отрегулировать шрифт и ознакомиться с информацией о программе и об издании.

#словари@digital_philologist


Рукописные словари Даля (Офенские, шерстобитов, мазуриков)

Когда я готовилась к радиоэфиру о Владимире Ивановиче Дале, я открыла для себя много удивительных фактов. Конечно, мне было интересно узнать и об электронных ресурсах, связанных с Далем.

Оказывается, еще в 2007 году была создана электронная книга в формате компьютерной программы с рукописными словарями Даля.

В этой книге впервые были опубликованы четыре словаря В.И. Даля, составленные в 40—50-е годы XIX столетия параллельно с подготовкой его знаменитого "Толкового словаря".

1 и 2. "Словарь офенского языка" и "Русско-офенский словарь". Словари включают более 5 тысяч слов торговцев-коробейников — офеней.
3. "Словарь тайных слов шерстобитов"
4. "Словарь петербургских мазуриков".

В основу работы была положена книга Василия Даниловича Бондалетова "В.И. Даль и тайные языки в России" (делюсь ссылкой на библиотеку Klex).

В следующем посте прикреплю саму программу, расскажу о поисковых возможностях.

#словари@digital_philologist


Как самостоятельно разметить тексты для параллельной книги?

На этот вопрос есть ответ в "Градиентном блоге"
Сергея Аверкиева. В одном из постов он рассказывает, какие теги в txt сделают разметку удобнее.

Если авторизоваться на его платформе Lingtrain, то можно воспользоваться выравнивателем (см. скриншот в посте).


#программы@digital_philologist




Репост из: Градиент обреченный
🔺 Сделал датасет

Выложил небольшой датасет на языках России.

🟢 22 языка: алтайский, башкирский, бурятский, горномарийский, дигорский, кабардино-черкесский, калмыцкий, карачаево-балкарский, коми, кубачинский, марийский (луговой), мокшанский, орокский, осетинский (иронский), русский, татарский, удмуртский, хакасский, чувашский, чукотский, эрзянский, якутский.

🟢 По 1565 предложений в каждом.

🟢 Сделан по всем редакциям Маленького принца, которые собирали последние несколько лет + 3 новые (чукотский, карачаево-балкарский и дигорский).

🟢 Выравнивалось вручную при помощи lingtrain-aligner. Выверялось и корректировалось при помощи Fable. Посмотрели несколько редакций с носителями, одобряют.

🟢 В некоторых редакциях предложений не хватало, такие предложения были допереведены Fable на основе имеющейся лексики и помечены в отдельных колонках. Также была исправлена пунктуация на концах предложений для единообразия.

Даёшь больше языковых датасетов!

👉 HF




Репост из: Диджитал-гуманитарии с Урала
🌲 20 тысяч голосов костромской деревни — в одном цифровом архиве

Что получится, если соединить полевые экспедиции, фольклор, диалектологию и цифровой поиск?

Получится Костромской архив этнолингвистических материалов — проект кафедры русского языка, общего языкознания и речевой коммуникации УрФУ, где собрано уже больше 20 тысяч записей о традиционной жизни крестьян XX века.

Внутри — фольклорные тексты, рассказы местных жителей, этнографические описания, воспоминания о быте, обрядах, праздниках, приметах и деревенской повседневности.

🔎 Искать можно не только по слову, но и по жанру, теме и ключевым словам. Например: народная медицина, свадьба, похороны, работа, семья, запреты, приметы.

Каждый текст снабжён «паспортом»: где записан, от кого, к какой теме и жанру относится. То есть это не просто архив, а настоящая поисковая система по народной памяти.

И это отличный пример цифровой гуманитаристики: полевые записи не лежат мёртвым грузом в картотеках, а становятся доступными для новых исследований 🤓




Репост из: Системный Блокъ
Язык через призму данных — новый проект «Системного Блока»

Как проследить, менялось ли значение слова со временем? Как сравнить между собой тексты разных авторов? И зачем лингвисты считают миллионы слов вместо того, чтобы читать книги?

Мы запускаем новый проект о корпусной лингвистике — направлении, которое изучает язык с помощью больших коллекций текстов. На одной странице мы собрали материалы, которые помогут разобраться, как устроены языковые корпусы, что можно узнать с их помощью и как самостоятельно анализировать тексты — даже без опыта в программировании.

Вы узнаете, что такое Национальный корпус русского языка и почему им пользуются не только лингвисты, но и журналисты, учителя и литературоведы. Мы рассказали, как корпус создается, как нейросети помогают размечать слова, зачем нужны поэтические и драматургические корпусы и почему одного НКРЯ недостаточно для всех исследовательских задач.

Мы собрали реальные примеры исследований: как алгоритмы определяют сюжеты в песнях — от рок-баллад до Тейлор Свифт, как на текстах корпуса stihi.ru изучать наивную поэзию, как анализ текстов помогает исследовать орфографию и даже искать животных в детской литературе.

Для тех, кто хочет попробовать корпусный анализ самостоятельно, есть практические руководства. А еще — тесты, с помощью которых можно узнать что-то неожиданное о русском языке. Например, какие ругательства встречаются в НКРЯ или что значат редкие слова в произведениях Льва Толстого.

Изучить проект — по ссылке.

🤖 «Системный Блокъ» @sysblok


Была сегодня в программе "Гостиная вселенной" в гостях у Олега Юрьевича Клишина. Беседовали о жизни и творческом пути В.И. Даля. В эфир запись выйдет примерно через 3 недели.


Друзья, поправка! Эфир будет в записи, я отдельно сообщу

Показано 20 последних публикаций.