Продолжение скандала вокруг OpenAI: разоблачение о приватности данных и Теренс Тао рассказал, что OpenAI воспользовалась трудом реальных людей и выдала как за свой
1-я и 2-я части скандала тут и тут.
Со-основатель OpenAI, создатель GPT Джон Шульман, в контексте скандала вокруг OpenAI, что они якобы решили задачу тысячелетия развил миф, который сеет OpenAI о том, как проходит обучение на пользовательских данных.
Шульман говорит, что есть разные способы обучаться на пользовательских данных:
1. Претрейн на пользовательских данных, тут используются токены пользователя как цель предсказания. Есть высокий риск, что модель потом выплюнет текст, так делать не стоит.
2. Дистилляция через промпты - использовать запросы пользователей, чтобы сжать большую модель в маленькую. Здесь риск, некоторые компании это делают.
3. RL на основе пользовательских трейсов, тут модель редко дословно запоминает, но интеллектуальную собственность вытащить можно, от безобидного «взяли явный фидбек в reward model» до жёсткого «забрали среду и git-историю и сделали из этого RL».
В конце Шульман говорит:
«Деанонимизация слабая, человека можно опознать по малому числу бит, а длинные трассы дают больше, чем достаточно. И на риск утечки IP это не влияет».
Исследователь Сьюзан Чжан, экс-Meta(запрещена в РФ) высказалась, что все кто говорит: «мы не использовали данные намеренно», либо говорят полуправду, либо сами не знают что вошло в их тренировочные данные. Пайплайны настолько сложны, что внутри компании мало кто видит полную картину.
Теперь про Теренса Тао, лауреата Филдсовской премии.
Он рассказал, что OpenAI использовали его интервью для рекламы, не согласовав формат. Также он говорит, что ситуация сильно ухудшилась, математическому сообществу нужно объединиться вокруг своих ценностей и отвергнуть безответственное использование ИИ.
Это позиция человека, который год назад верил в «лучшее из обоих миров» и теперь видит, куда всё пришло.
_______
Источник | #blockchainRF
@F_S_C_P
-------
Поддержи канал подпиской
-------
1-я и 2-я части скандала тут и тут.
Со-основатель OpenAI, создатель GPT Джон Шульман, в контексте скандала вокруг OpenAI, что они якобы решили задачу тысячелетия развил миф, который сеет OpenAI о том, как проходит обучение на пользовательских данных.
Шульман говорит, что есть разные способы обучаться на пользовательских данных:
1. Претрейн на пользовательских данных, тут используются токены пользователя как цель предсказания. Есть высокий риск, что модель потом выплюнет текст, так делать не стоит.
2. Дистилляция через промпты - использовать запросы пользователей, чтобы сжать большую модель в маленькую. Здесь риск, некоторые компании это делают.
3. RL на основе пользовательских трейсов, тут модель редко дословно запоминает, но интеллектуальную собственность вытащить можно, от безобидного «взяли явный фидбек в reward model» до жёсткого «забрали среду и git-историю и сделали из этого RL».
В конце Шульман говорит:
«Деанонимизация слабая, человека можно опознать по малому числу бит, а длинные трассы дают больше, чем достаточно. И на риск утечки IP это не влияет».
Исследователь Сьюзан Чжан, экс-Meta(запрещена в РФ) высказалась, что все кто говорит: «мы не использовали данные намеренно», либо говорят полуправду, либо сами не знают что вошло в их тренировочные данные. Пайплайны настолько сложны, что внутри компании мало кто видит полную картину.
Теперь про Теренса Тао, лауреата Филдсовской премии.
Он рассказал, что OpenAI использовали его интервью для рекламы, не согласовав формат. Также он говорит, что ситуация сильно ухудшилась, математическому сообществу нужно объединиться вокруг своих ценностей и отвергнуть безответственное использование ИИ.
Это позиция человека, который год назад верил в «лучшее из обоих миров» и теперь видит, куда всё пришло.
_______
Источник | #blockchainRF
@F_S_C_P
-------
Поддержи канал подпиской
-------