TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Экстракт

2 Oct, 12:26

Открыть в Telegram Поделиться Пожаловаться

Оксфордский исследователь Илья Шумайлов и математик Кембриджского университета Захар Шумайлов вместе с коллегами описали саморазрушительный цикл обучения ИИ. Новая модель получает тексты предыдущей, затем ее ответы становятся сырьем следующей. При бесконтрольной замене первоисточников машинными копиями редкие сведения постепенно выпадают. Авторы статьи в Nature от 24 июля 2024 года назвали этот процесс model collapse — коллапсом модели. Грамотность отдельных ответов не защищает от потери разнообразия.

Первой жертвой становится малочисленный материал. В конечный набор сгенерированных примеров редкий тип может просто не попасть. Если следующая модель воспроизводит частоты только этого набора, отсутствие превращается в нулевую вероятность дальнейшего появления. Наиболее распространенные варианты переживают переписывание легче. Возникает отбор в пользу привычных сочетаний, при котором необычная формулировка или редкий случай теряют место в учебной базе.

Условный расчет отделяет случайность от ее наследования. При частоте редкого типа 1 на 10 тысяч в выборке из 10 тысяч независимых примеров вероятность его полного отсутствия равна примерно 36,8%. Следующее копирование эмпирических частот закрепляет потерю. Этот процент относится к заданному примеру, без претензии измерить забывчивость коммерческих нейросетей. Вывод касается самого способа передачи: размножение оставшихся записей не возвращает отсутствующую запись.

Исследование охватывает языковые модели и другие генеративные системы, включая вариационные автоэнкодеры и гауссовские смеси. В эксперименте с OPT-125m, обучавшейся на WikiText-2 и затем на ответах предшественников, 9-е поколение превратило продолжение текста об архитектуре в перечисление разноцветных зайцев. Попытка подавить повторы дополнительным штрафом ухудшила результат. Стилистическое разнообразие не исправило утрату исходного содержания: машине можно запретить повторять слова, не предоставив ей недостающих сведений.

Искажения трудно обратить внутри замкнутой цепочки. Сведения о том, что было отброшено, в ней уже могут отсутствовать. Возвращение исходного архива меняет условия задачи. Исследователь Маттиас Герстграссер и соавторы в работе 2024 года сохраняли первоначальные реальные данные и добавляли к ним все последующие синтетические наборы. В испытанных режимах накопление позволило избежать коллапса, возникавшего при замене. Производитель, уничтожающий старую базу ради удобства обновления, тем самым отказывается от проверенного способа ограничить наследование ошибок.

Сохраненный архив решает задачу передачи уже известного. Обновление знаний требует независимого поступления сведений: старые ответы не содержат наблюдений за событиями, случившимися после их создания. Поэтому человеческие тексты и фотографии имеют ценность как связь с внешним миром. По мере заполнения доступных массивов машинными публикациями растет значение происхождения каждой новой партии. Миллион пересказов одного сообщения не становится миллионом независимых свидетельств.

Google уже договорилась о регулярном получении такого потока у Reddit. Соглашение от 22 февраля 2024 года дало ей доступ к обновляемым публикациям и комментариям через интерфейс данных, в том числе для обучения моделей. Вице-президент Google Раджан Патель отдельно отметил человеческие разговоры и опыт пользователей. Это подтвержденный спрос на доступ к живому источнику, хотя договор не удостоверяет авторство каждого сообщения.

Для Google полезность такого доступа зависит от того, сумеет ли она сохранить первоисточники и отделить новые человеческие свидетельства от машинных пересказов. Если пользователи начнут массово возвращать на Reddit ответы нейросетей, обновляемый поток сможет замкнуться на прежних моделях. Тогда компания будет получать свежую дату публикации без соответствующего притока независимых сведений. Сокращать эту зависимость придется через проверку происхождения материала и сохранение оригиналов, которые сама генерация восстановить не может.

@ex_trakt

10.2k 4 53
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot