Ооо )))) Я постил в сентябре что нейронки - это просто архиватор - а тут научно обосновывают. Книга Principles and Practice of Deep Representation Learning - A Mathematical Theory of Memory, выложена тут. Китаец Yi Ma в University of Berkeley лидирует
Их самая ключевая амбиция: что нейронки просто находят компактные / малоразмерные / информационно-плотные representations в потоке более многомерных данных реального мира, где не вся инфа одинакова важна
Авторы метят во что-то уровня Шеннона с его теорией информации и von Neumann про компьютинг итп. В том плане, что:
- Не просто гениальные инженеры типа Sutskever, сами не понимая как и почему, откроют то трансформеры, то Stable Diffusion, то еще что-то
а
- Им важно обобщить теоретические основания и так проложить путь дальше (как Петя Лидский говорил и про продление жизни: без общей теории засолвить будет сложновато)
Видят 3 уровня:
1. Собственно, компрессия/память
- Ее и выводят из полудюжины кейсов известных нейроархитектур и пытаются строго показать. Что нейронки, сжимая сложность реальности в более малоразмерные representations, "осваивают" паттерны, "борются" с энтропией, "конструируют" распределения мЕньшей размерности, “добиваются" self-consistency
- Это еще пока не итог уровня Шеннона или Геделя, а текущий research в процессе обобщения
2. Автономная само-коррекция
- Это, видимо, потребует не статичных LLM, а перепрошивки нейронов на лету, поэтому уже даже Karpaty ожидает десятки лет до AGI
- Это уже на агентность залезает, не? (но я после новостей, что на астероидах нашли прекурсоры аминокислот думаю, что агентность - это фича физической реальности. И у компов и роботов сознания не будет. Ну или разве что их на биосубстрате уже запилят)
3. Итоговое научное мышление (это уже чисто их спекуляции)
**
Не читать - времязатратно (400 страниц) и сложно (это же фронтир: там и не все ученые-то поймут, как Денис Баранов в интервью отмечал про фронтир). Чисто полистать их графики, названия глав оценить. Коснуться красоты Вселенной
**
Начинается книга, кстати, угарно:
- Сперва “мы хотели бы внести наш скромный вклад”, портреты великих, "используются такие-то обозначения"
- А дальше - фсио-писдес-надо-вникать-в-каждую-формулу. Как известный ролик "Алгебраично!" ))
Но
Книга все равно в этом плане похожа на теорию Геделя: не обязательно понимать всю его строгую формализацию, чтобы понять общие выводы его открытия (что все объяснения математической системы априори лежат вовне её, в аксиомах. Которые то ли мыслящие наблюдатели рандомно вводят и объяснить их не могут. То ли это физически наша Вселенная так устроена, а в других Вселенных уже своя математика будет)
Их самая ключевая амбиция: что нейронки просто находят компактные / малоразмерные / информационно-плотные representations в потоке более многомерных данных реального мира, где не вся инфа одинакова важна
Авторы метят во что-то уровня Шеннона с его теорией информации и von Neumann про компьютинг итп. В том плане, что:
- Не просто гениальные инженеры типа Sutskever, сами не понимая как и почему, откроют то трансформеры, то Stable Diffusion, то еще что-то
а
- Им важно обобщить теоретические основания и так проложить путь дальше (как Петя Лидский говорил и про продление жизни: без общей теории засолвить будет сложновато)
Видят 3 уровня:
1. Собственно, компрессия/память
- Ее и выводят из полудюжины кейсов известных нейроархитектур и пытаются строго показать. Что нейронки, сжимая сложность реальности в более малоразмерные representations, "осваивают" паттерны, "борются" с энтропией, "конструируют" распределения мЕньшей размерности, “добиваются" self-consistency
- Это еще пока не итог уровня Шеннона или Геделя, а текущий research в процессе обобщения
2. Автономная само-коррекция
- Это, видимо, потребует не статичных LLM, а перепрошивки нейронов на лету, поэтому уже даже Karpaty ожидает десятки лет до AGI
- Это уже на агентность залезает, не? (но я после новостей, что на астероидах нашли прекурсоры аминокислот думаю, что агентность - это фича физической реальности. И у компов и роботов сознания не будет. Ну или разве что их на биосубстрате уже запилят)
3. Итоговое научное мышление (это уже чисто их спекуляции)
**
Не читать - времязатратно (400 страниц) и сложно (это же фронтир: там и не все ученые-то поймут, как Денис Баранов в интервью отмечал про фронтир). Чисто полистать их графики, названия глав оценить. Коснуться красоты Вселенной
**
Начинается книга, кстати, угарно:
- Сперва “мы хотели бы внести наш скромный вклад”, портреты великих, "используются такие-то обозначения"
- А дальше - фсио-писдес-надо-вникать-в-каждую-формулу. Как известный ролик "Алгебраично!" ))
Но
Книга все равно в этом плане похожа на теорию Геделя: не обязательно понимать всю его строгую формализацию, чтобы понять общие выводы его открытия (что все объяснения математической системы априори лежат вовне её, в аксиомах. Которые то ли мыслящие наблюдатели рандомно вводят и объяснить их не могут. То ли это физически наша Вселенная так устроена, а в других Вселенных уже своя математика будет)