Репост из: ТЕХНО: Яндекс про технологии
Что общего у ИИ, старых книг и затонувших кораблей
После первых ядерных испытаний радиоактивные частицы разнеслись по атмосфере. С тех пор любая выплавленная сталь имеет микроскопический радиоактивный фон.
Для сверхчувствительных приборов вроде детекторов радиации это большая проблема. Поэтому особенно ценной стала низкофоновая сталь — произведённая до атомной эпохи в 1945 году. Самым удобным её источником оказались затонувшие корабли: металл их корпусов выплавили до начала атмосферных ядерных испытаний, поэтому в нём почти не было радионуклидов.
Похожая проблема существует и с информацией.
В мире всё больше текстов, созданных нейросетями. Если следующие поколения моделей без разбора обучать преимущественно на результатах предыдущих, они могут терять редкие паттерны, накапливать ошибки и выдавать более однообразные тексты.
В июле этого года 404 Media рассказала, что компании, работающие с обучающими данными, закупают всё большие объёмы печатных книг. Их главное преимущество — они точно написаны людьми, а не нейросетями. И по аналогии с доядерной сталью такие данные до выпуска ChatGPT в 2022 году тоже называют низкофоновыми.
Есть даже проекты вроде публичного каталога Low-background Steel. Его авторы собирают ссылки на книги, архивы и другие источники без генеративного ИИ, чтобы такие материалы было проще находить и сохранять.
Подписывайтесь 👉 @techno_yandex
После первых ядерных испытаний радиоактивные частицы разнеслись по атмосфере. С тех пор любая выплавленная сталь имеет микроскопический радиоактивный фон.
Для сверхчувствительных приборов вроде детекторов радиации это большая проблема. Поэтому особенно ценной стала низкофоновая сталь — произведённая до атомной эпохи в 1945 году. Самым удобным её источником оказались затонувшие корабли: металл их корпусов выплавили до начала атмосферных ядерных испытаний, поэтому в нём почти не было радионуклидов.
Похожая проблема существует и с информацией.
В мире всё больше текстов, созданных нейросетями. Если следующие поколения моделей без разбора обучать преимущественно на результатах предыдущих, они могут терять редкие паттерны, накапливать ошибки и выдавать более однообразные тексты.
В июле этого года 404 Media рассказала, что компании, работающие с обучающими данными, закупают всё большие объёмы печатных книг. Их главное преимущество — они точно написаны людьми, а не нейросетями. И по аналогии с доядерной сталью такие данные до выпуска ChatGPT в 2022 году тоже называют низкофоновыми.
Есть даже проекты вроде публичного каталога Low-background Steel. Его авторы собирают ссылки на книги, архивы и другие источники без генеративного ИИ, чтобы такие материалы было проще находить и сохранять.
Подписывайтесь 👉 @techno_yandex