Антология всемирной литературы: как ИИ помогает филологу осуществить мечту
Можно ли с помощью ИИ собрать и перевести шедевры мировой литературы, начиная с древних времен? Оказывается, да. В новом выпуске своего блога филолог Борис Орехов рассказывает о проекте, который еще несколько лет назад было трудно представить: с помощью ИИ он создает свободную антологию всемирной литературы — от древнеегипетских поучений до произведений XIX–XX веков. Как устроен этот проект и почему нейросети не заменяют филолога, а помогают ему?
В чем состоит идея?
Один из главных русскоязычных трудов, который объемлет всю мировую литературу в совокупности, — это многотомная «История всемирной литературы». Именно по ее структуре он решил собрать собственную антологию: восемь томов, охватывающих литературы разных эпох и регионов — от Древнего Египта, Месопотамии, Индии и Китая до Европы Нового времени.
Главная цель проекта — не просто объединить тексты, а разместить их в открытом доступе. Многие классические переводы до сих пор защищены авторским правом, поэтому свободно публиковать их нельзя. Переводы, выполненные с помощью ИИ и затем проверенные человеком, позволяют обойти это ограничение.
Как проходила работа?
Работа начинается с «Истории всемирной литературы». ИИ анализирует главы, составляет краткие описания литературных традиций, извлекает названия произведений, ищет их в открытом доступе и находит современные переводы, чаще всего англоязычные. Затем модель переводит тексты на русский язык и оформляет их вместе с метаданными.
Вся коллекция хранится в Obsidian, где каждое произведение связано с другими текстами по эпохам, регионам и жанрам. Благодаря этому антология превращается не в собрание отдельных произведений, а в единую базу знаний, в которой можно проследить связи между литературными традициями.
Какие возникли сложности?
ИИ пока плохо справляется с некоторыми историческими и культурными контекстами. Например, начало одного из древнеегипетских текстов модель перевела как «Поучение, составленное Агентством Царя Верхнего и Нижнего Египта…», хотя очевидно, что никаких агентств тогда не существовало. Поэтому каждый перевод требует проверки и редактуры.
Есть и другие ограничения. В антологию попадают только произведения, которые удалось найти в интернете в оригинале или в переводе на современный язык. По оценке Бориса Орехова, из-за этого приходится отказаться примерно от 75 % текстов, упомянутых в «Истории всемирной литературы».
Зачем филолог, если есть нейросеть?
По мнению Бориса Орехова, большие языковые модели не делают филолога ненужным. Они берут на себя рутинные задачи — поиск, первичный перевод и организацию материалов, — позволяя исследователю сосредоточиться на интерпретации текстов. Благодаря этому мечта собрать свободную антологию мировой литературы становится не утопией, а реальным исследовательским проектом.
Подробности о том, как проходила работа, какие промпты использовал автор и как выглядит схема связей между текстами из антологии, — в полной версии материала.
Время чтения: 8 минут
🤖 «Системный Блокъ» @sysblok
Можно ли с помощью ИИ собрать и перевести шедевры мировой литературы, начиная с древних времен? Оказывается, да. В новом выпуске своего блога филолог Борис Орехов рассказывает о проекте, который еще несколько лет назад было трудно представить: с помощью ИИ он создает свободную антологию всемирной литературы — от древнеегипетских поучений до произведений XIX–XX веков. Как устроен этот проект и почему нейросети не заменяют филолога, а помогают ему?
В чем состоит идея?
Один из главных русскоязычных трудов, который объемлет всю мировую литературу в совокупности, — это многотомная «История всемирной литературы». Именно по ее структуре он решил собрать собственную антологию: восемь томов, охватывающих литературы разных эпох и регионов — от Древнего Египта, Месопотамии, Индии и Китая до Европы Нового времени.
Главная цель проекта — не просто объединить тексты, а разместить их в открытом доступе. Многие классические переводы до сих пор защищены авторским правом, поэтому свободно публиковать их нельзя. Переводы, выполненные с помощью ИИ и затем проверенные человеком, позволяют обойти это ограничение.
Как проходила работа?
Работа начинается с «Истории всемирной литературы». ИИ анализирует главы, составляет краткие описания литературных традиций, извлекает названия произведений, ищет их в открытом доступе и находит современные переводы, чаще всего англоязычные. Затем модель переводит тексты на русский язык и оформляет их вместе с метаданными.
Вся коллекция хранится в Obsidian, где каждое произведение связано с другими текстами по эпохам, регионам и жанрам. Благодаря этому антология превращается не в собрание отдельных произведений, а в единую базу знаний, в которой можно проследить связи между литературными традициями.
Какие возникли сложности?
ИИ пока плохо справляется с некоторыми историческими и культурными контекстами. Например, начало одного из древнеегипетских текстов модель перевела как «Поучение, составленное Агентством Царя Верхнего и Нижнего Египта…», хотя очевидно, что никаких агентств тогда не существовало. Поэтому каждый перевод требует проверки и редактуры.
Есть и другие ограничения. В антологию попадают только произведения, которые удалось найти в интернете в оригинале или в переводе на современный язык. По оценке Бориса Орехова, из-за этого приходится отказаться примерно от 75 % текстов, упомянутых в «Истории всемирной литературы».
Зачем филолог, если есть нейросеть?
По мнению Бориса Орехова, большие языковые модели не делают филолога ненужным. Они берут на себя рутинные задачи — поиск, первичный перевод и организацию материалов, — позволяя исследователю сосредоточиться на интерпретации текстов. Благодаря этому мечта собрать свободную антологию мировой литературы становится не утопией, а реальным исследовательским проектом.
Подробности о том, как проходила работа, какие промпты использовал автор и как выглядит схема связей между текстами из антологии, — в полной версии материала.
Время чтения: 8 минут
🤖 «Системный Блокъ» @sysblok