Свежая статья Google нам говорит о совершенно новом этапе
Исследователи предлагают новый подход к МО, который может преодолеть фундаментальные ограничения современных систем
МО держится на огромные массивы данных
Это позволило создать языковые модели
Вместо коротких взаимодействий "вопрос-ответ", новый подход предлагает системы, существующие в непрерывном "потоке опыта" — подобно тому, как люди живут и учатся годами
Такое МО будет:
DeepMind предлагает вернуться к обучению с подкреплением (RL), но в более продвинутой форме
Системы будут строить "модели мира", позволяющие предсказывать последствия действий и планировать, одновременно получая вознаграждения из реальной среды
AlphaProof, недавно получивший серебряную медаль на Международной математической олимпиаде, уже показывает элементы этого подхода, обучаясь на собственном опыте доказательств
Сильвер и Саттон предсказывают создание систем, которые смогут значительно превзойти человеческие возможности во многих областях
Однако они также предупреждают о рисках сокращения человеческого контроля над автономными агентами, стремящимися к долгосрочным целям
Экспериментальные данные затмят масштаб и качество данных, созданных человеком
Остается открытым вопрос - как скоро первые настоящие агенты "потоков опыта" появятся в реальном мире, и готовы ли потребители к последствиям этого перехода?
Исследователи предлагают новый подход к МО, который может преодолеть фундаментальные ограничения современных систем
МО держится на огромные массивы данных
Это позволило создать языковые модели
Ценные новые идеи, такие как новые теоремы, технологии или научные прорывы, лежат за пределами текущего человеческого понимания и не могут быть получены из существующих данных
Вместо коротких взаимодействий "вопрос-ответ", новый подход предлагает системы, существующие в непрерывном "потоке опыта" — подобно тому, как люди живут и учатся годами
Такое МО будет:
Взаимодействовать с реальным миром через различные интерфейсы
Получать обратную связь непосредственно из окружающей среды
Развивать собственную модель мира, постоянно уточняя предсказания
Стремиться к долгосрочным целям, а не только к немедленным ответам
DeepMind предлагает вернуться к обучению с подкреплением (RL), но в более продвинутой форме
Системы будут строить "модели мира", позволяющие предсказывать последствия действий и планировать, одновременно получая вознаграждения из реальной среды
AlphaProof, недавно получивший серебряную медаль на Международной математической олимпиаде, уже показывает элементы этого подхода, обучаясь на собственном опыте доказательств
Сильвер и Саттон предсказывают создание систем, которые смогут значительно превзойти человеческие возможности во многих областях
Однако они также предупреждают о рисках сокращения человеческого контроля над автономными агентами, стремящимися к долгосрочным целям
Экспериментальные данные затмят масштаб и качество данных, созданных человеком
Это изменение парадигмы, сопровождаемое алгоритмическими достижениями в RL, откроет новые возможности, превосходящие человеческие способности во многих областях
Остается открытым вопрос - как скоро первые настоящие агенты "потоков опыта" появятся в реальном мире, и готовы ли потребители к последствиям этого перехода?