2-ая часть моего саммари интервью с Saining Xie и объяснение аферы нарратива про AGI и scaling law:
LLM
- LLM - это virtual intelligence и НЕ имеет отношения к миру: факты, bits итп. Модель мира же требует непрерывного трекинга многомерного пространства (e.g. все сенсоры роботов, их не токенизировать). А LLM дискретны. Студентам говорю идти в robotics тк там ничего не засолвлено, нет аналога pre-training, нет "мозга" итд
- В computer vision не важен scaling law, тк там заботятся о другом, это не язык. Язык - АНТИрандомность - итог мышления людей за тыщи лет, загрузили в инет - и вуаля. Без инета LLM не было бы
- LLM это не machine learning, который мэтчит из X в Y, а просто предсказания ТОЛЬКО внутри Y
- AI ученые уже десятки лет сталкиваются с Moravec's paradox: вещи легкие для машин сложны для людей и наоборот
- LLM юзаю каждый день, но они будут уходить в закат, а вовсе не путь к AGI. В ближ. 5 лет будет идти развитие reasoning + распространение моделей в применение в real world
Ложь AGI нарратива
- Идет якобы из эссе 2019 года Bitter Lesson (от патриарха RL Sutton) что типа автоматические подходы (НЕ supervised) всегда побьют rules based и supervised, и типа надо scaling law. Наоборот: язык - это же и есть supervised data в каждом токене (!), координата Y что я выше описал. И LLM - это же КОНТРПРИМЕР к Bitter Lesson. Язык - это уже ИТОГ работ моделей мира у множества людей
- Sutton говорил, что RL - это как инстинкты животных - реакция БЕЗ модели мира (система 1 и 2 Канемана). И в этом плане Sutton был против чисто RL. Reasoning в LLM - это щас модно, но это же система 1.. И intelligence агентам это не добавит
но
- Просто уже много лет этот нарратив “AGI рядом/надо scaling” помогал привлекать $ в лабы (которые в академии были недофинансированы). Но щас этим стали пытаться оправдывать сотни млрд долл в облачные GPU? Это же структурно ложно
Бизнес
- Наука или стартап? Да это чисто к чему ваша душа лежит
- Silicon Valley моно-культурна (product product product), NYC - междисциплинарен, эстетский
Режим exploration
- Kaiming меня научил, что в рисече нужно первую треть времени (1-2 мес) выделить на treat research like a game, игрушка на поиграться - exploration чтобы найти свои идеи, starting point. Как и в DL, и во всех сферах жизни - это стохастический процесс градиентного спуска пока идем к конечной цели. Либо вы гений, либо оч. удачливы - это бывает, но в основном - прогресс идет так. И нелинейно, с пивотами. Это не шахматы - ошибся в середине игры и все, а как изобретательство. И инновирование - это в первую очередь способность define problems
- Мной движет желание попасть в топ20 самых важных статей про DL. Типа AlexNet, ImageNet, ResNet, R-CNN, GPT/transformers, Bert, GAN. Пока не попал [Витя: у него 100 тыс (!) цитирований]
- В науке важно трекать все свои эксперименты (до последнего времени был популярен Excel) - чтобы ловить сигнал
Все не то, чем кажется
- Kaiming давал мне Diamond Sutra: "все вещи подобны снам, иллюзиям, теням". Все феномены - иллюзия. А если видишь как не-феномены, то перед тобой Tathagata (просветленный) / Кант “вещь в себе" итп
- Свой стиль важен, мне важен, мои статьи - на стиле. И вообще я в детстве хотел стать режиссером. Kaiming давал книгу Story от Robert McKee, про сценарии, но она по сути про research и про жизнь: через конфликт находятся решения / как достаточный контраст в градиентном спуске / виден сигнал
С кем работать
- Менторы и коллеги невероятно влияют на формирование нас как специалистов, на наш рост. Я устал уже Kaiming’а упоминать )
- В FAIR я нанял стажером Bill Peebles (щас глава Sora/OpenAI) и мы сперва игрались/explore, пытаясь понять что за representations копят diffusion models в отличии от self-supervised learning
Наш стартап
- Путь к моделям мира идет слоями, растить абстрактность representations.. И мы с LeCun, Fei-Fei Li, и другие - туда идем
- Нужна именно правильная, компактная архитектура, а не scaling и бездны сompute LLM. Визуально мы 1 млрд бит в секунду процессим, а устно - 10 бит - наш мозг что-то сделал?
**
А часть 1 тут
LLM
- LLM - это virtual intelligence и НЕ имеет отношения к миру: факты, bits итп. Модель мира же требует непрерывного трекинга многомерного пространства (e.g. все сенсоры роботов, их не токенизировать). А LLM дискретны. Студентам говорю идти в robotics тк там ничего не засолвлено, нет аналога pre-training, нет "мозга" итд
- В computer vision не важен scaling law, тк там заботятся о другом, это не язык. Язык - АНТИрандомность - итог мышления людей за тыщи лет, загрузили в инет - и вуаля. Без инета LLM не было бы
- LLM это не machine learning, который мэтчит из X в Y, а просто предсказания ТОЛЬКО внутри Y
- AI ученые уже десятки лет сталкиваются с Moravec's paradox: вещи легкие для машин сложны для людей и наоборот
- LLM юзаю каждый день, но они будут уходить в закат, а вовсе не путь к AGI. В ближ. 5 лет будет идти развитие reasoning + распространение моделей в применение в real world
Ложь AGI нарратива
- Идет якобы из эссе 2019 года Bitter Lesson (от патриарха RL Sutton) что типа автоматические подходы (НЕ supervised) всегда побьют rules based и supervised, и типа надо scaling law. Наоборот: язык - это же и есть supervised data в каждом токене (!), координата Y что я выше описал. И LLM - это же КОНТРПРИМЕР к Bitter Lesson. Язык - это уже ИТОГ работ моделей мира у множества людей
- Sutton говорил, что RL - это как инстинкты животных - реакция БЕЗ модели мира (система 1 и 2 Канемана). И в этом плане Sutton был против чисто RL. Reasoning в LLM - это щас модно, но это же система 1.. И intelligence агентам это не добавит
но
- Просто уже много лет этот нарратив “AGI рядом/надо scaling” помогал привлекать $ в лабы (которые в академии были недофинансированы). Но щас этим стали пытаться оправдывать сотни млрд долл в облачные GPU? Это же структурно ложно
Бизнес
- Наука или стартап? Да это чисто к чему ваша душа лежит
- Silicon Valley моно-культурна (product product product), NYC - междисциплинарен, эстетский
Режим exploration
- Kaiming меня научил, что в рисече нужно первую треть времени (1-2 мес) выделить на treat research like a game, игрушка на поиграться - exploration чтобы найти свои идеи, starting point. Как и в DL, и во всех сферах жизни - это стохастический процесс градиентного спуска пока идем к конечной цели. Либо вы гений, либо оч. удачливы - это бывает, но в основном - прогресс идет так. И нелинейно, с пивотами. Это не шахматы - ошибся в середине игры и все, а как изобретательство. И инновирование - это в первую очередь способность define problems
- Мной движет желание попасть в топ20 самых важных статей про DL. Типа AlexNet, ImageNet, ResNet, R-CNN, GPT/transformers, Bert, GAN. Пока не попал [Витя: у него 100 тыс (!) цитирований]
- В науке важно трекать все свои эксперименты (до последнего времени был популярен Excel) - чтобы ловить сигнал
Все не то, чем кажется
- Kaiming давал мне Diamond Sutra: "все вещи подобны снам, иллюзиям, теням". Все феномены - иллюзия. А если видишь как не-феномены, то перед тобой Tathagata (просветленный) / Кант “вещь в себе" итп
- Свой стиль важен, мне важен, мои статьи - на стиле. И вообще я в детстве хотел стать режиссером. Kaiming давал книгу Story от Robert McKee, про сценарии, но она по сути про research и про жизнь: через конфликт находятся решения / как достаточный контраст в градиентном спуске / виден сигнал
С кем работать
- Менторы и коллеги невероятно влияют на формирование нас как специалистов, на наш рост. Я устал уже Kaiming’а упоминать )
- В FAIR я нанял стажером Bill Peebles (щас глава Sora/OpenAI) и мы сперва игрались/explore, пытаясь понять что за representations копят diffusion models в отличии от self-supervised learning
Наш стартап
- Путь к моделям мира идет слоями, растить абстрактность representations.. И мы с LeCun, Fei-Fei Li, и другие - туда идем
- Нужна именно правильная, компактная архитектура, а не scaling и бездны сompute LLM. Визуально мы 1 млрд бит в секунду процессим, а устно - 10 бит - наш мозг что-то сделал?
**
А часть 1 тут