Ю Су про агентов: интеллект + continual learning = экспертиза (Рубрика #AI)
Посмотрел доклад Ю Су «Intelligence + Continual Learning = Expertise» с трека Memory & Continual Learning на AI Engineer World's Fair 2026. Су — профессор Ohio State University, из его группы вышли Mind2Web, SeeAct, MMMU и HippoRAG, а в апреле 2026-го он вывел из стелса стартап NeoCognition ($40 млн seed) — про агентов, которые доучиваются на работе. За двадцать минут он отвечает на вопрос, который занимает и меня: почему кодинг-агенты — большой успех, а агенты для всего остального буксуют.
Рамка доклада такая.
🤖 Intelligence — способность рассуждать над незнакомой задачей из выданного контекста. Фронтирные модели делают это всё лучше, но каждый эпизод живёт отдельно.
💪 Expertise — накопленная и ситуативная компетентность: действовать в конкретном домене надёжно, эффективно и с суждением.
По Су, эти оси почти ортогональны, и, масштабируя только интеллект, мы получаем «самого умного в мире новичка»: он блестяще берётся за любую подсунутую задачу, но между задачами ничего не накапливает.
Почему тогда кодинг сработал? Код — привилегированный, language-native мир: всё уже записано символьно и структурировано, а тесты дают готовые награды. Происходящее Су называет современным парадоксом Моравека: «коронные» символьные дисциплины вроде кода и математики агентам даются, а повседневная цифровая работа — нет. Потому что это не один мир, а миллионы микромиров: каждая профессия и компания — даже два инстанса одного софта — настроены по-разному, со своей локальной физикой: структурами, ограничениями, динамикой. Слишком гетерогенно, чтобы одна статичная модель сжала это в себя.
Самая интересная часть — как Су раскладывает экспертизу, опираясь на когнитивистику. Эксперты не просто знают больше — они видят иначе: мгновенно узнают паттерны (в огромном баг-репорте — где именно копать), видят глубинную структуру задачи (назначить встречу — не поиск общего слота в календарях, а оптимизация с ограничениями по полномочиям, приоритетам и срочности), понимают условность правил и когда их можно гнуть, владеют суждением: что такое качество и когда «good enough». Фактически эксперт выучил world model своего микромира. Отсюда же токенная прожорливость агентов: интеллект расширяет поиск, запуская сотню параллельных попыток, а экспертиза сжимает его — shortcuts уже выучены.
Мост между осями — continual learning: адаптивное сжатие опыта в переиспользуемые структуры для будущего поведения. Четыре вопроса задают всё пространство решений:
1️⃣ Какой опыт - эпизоды, факты, процедуры, фидбек
2️⃣ Как сжимать - векторы, символьные индексы, дистилляция в параметры, RL
3️⃣ В какие структуры - адаптеры, графы, скиллы, world models
4️⃣ Как их использовать - вспоминание, предсказание, планирование, value function
Плюс в конце автор говорит про unbounded expertise from bounded intelligence — если алгоритмы continual learning станут достаточно хороши, после некоторого порога интеллекта сильнее модель не нужна: масштабировать надо обучение на опыте. А следующая возможность уровня «интернет как датасет» — опыт приватных микромиров, когда специализированные агенты начнут возвращать выученное в общие модели.
Что я забрал.
— Это удачная рамка для происходящего: memory-файлы, skill libraries и RL на проверяемых наградах уже дают кодинг-агентам примитивный continual learning. Открытый вопрос — как повторить это там, где нет ни символьного мира, ни бесплатных тестов.
— Управленческий вывод: если Су прав, moat компании — не доступ к модели, а learning loop поверх собственных микромиров, превращающий опыт людей и агентов в institutional memory.
— Unbounded expertise — это пока гипотеза, а не результат. Как измерять экспертизу и мирить надёжность с пластичностью — открытые вопросы, Су честно перечисляет их сам. Ну и NeoCognition продаёт ровно это, так что перед нами манифест основателя, а не нейтральный обзор.
#AI #Agents #Research #Engineering #Conference
Посмотрел доклад Ю Су «Intelligence + Continual Learning = Expertise» с трека Memory & Continual Learning на AI Engineer World's Fair 2026. Су — профессор Ohio State University, из его группы вышли Mind2Web, SeeAct, MMMU и HippoRAG, а в апреле 2026-го он вывел из стелса стартап NeoCognition ($40 млн seed) — про агентов, которые доучиваются на работе. За двадцать минут он отвечает на вопрос, который занимает и меня: почему кодинг-агенты — большой успех, а агенты для всего остального буксуют.
Рамка доклада такая.
🤖 Intelligence — способность рассуждать над незнакомой задачей из выданного контекста. Фронтирные модели делают это всё лучше, но каждый эпизод живёт отдельно.
💪 Expertise — накопленная и ситуативная компетентность: действовать в конкретном домене надёжно, эффективно и с суждением.
По Су, эти оси почти ортогональны, и, масштабируя только интеллект, мы получаем «самого умного в мире новичка»: он блестяще берётся за любую подсунутую задачу, но между задачами ничего не накапливает.
Почему тогда кодинг сработал? Код — привилегированный, language-native мир: всё уже записано символьно и структурировано, а тесты дают готовые награды. Происходящее Су называет современным парадоксом Моравека: «коронные» символьные дисциплины вроде кода и математики агентам даются, а повседневная цифровая работа — нет. Потому что это не один мир, а миллионы микромиров: каждая профессия и компания — даже два инстанса одного софта — настроены по-разному, со своей локальной физикой: структурами, ограничениями, динамикой. Слишком гетерогенно, чтобы одна статичная модель сжала это в себя.
Самая интересная часть — как Су раскладывает экспертизу, опираясь на когнитивистику. Эксперты не просто знают больше — они видят иначе: мгновенно узнают паттерны (в огромном баг-репорте — где именно копать), видят глубинную структуру задачи (назначить встречу — не поиск общего слота в календарях, а оптимизация с ограничениями по полномочиям, приоритетам и срочности), понимают условность правил и когда их можно гнуть, владеют суждением: что такое качество и когда «good enough». Фактически эксперт выучил world model своего микромира. Отсюда же токенная прожорливость агентов: интеллект расширяет поиск, запуская сотню параллельных попыток, а экспертиза сжимает его — shortcuts уже выучены.
Мост между осями — continual learning: адаптивное сжатие опыта в переиспользуемые структуры для будущего поведения. Четыре вопроса задают всё пространство решений:
1️⃣ Какой опыт - эпизоды, факты, процедуры, фидбек
2️⃣ Как сжимать - векторы, символьные индексы, дистилляция в параметры, RL
3️⃣ В какие структуры - адаптеры, графы, скиллы, world models
4️⃣ Как их использовать - вспоминание, предсказание, планирование, value function
Плюс в конце автор говорит про unbounded expertise from bounded intelligence — если алгоритмы continual learning станут достаточно хороши, после некоторого порога интеллекта сильнее модель не нужна: масштабировать надо обучение на опыте. А следующая возможность уровня «интернет как датасет» — опыт приватных микромиров, когда специализированные агенты начнут возвращать выученное в общие модели.
Что я забрал.
— Это удачная рамка для происходящего: memory-файлы, skill libraries и RL на проверяемых наградах уже дают кодинг-агентам примитивный continual learning. Открытый вопрос — как повторить это там, где нет ни символьного мира, ни бесплатных тестов.
— Управленческий вывод: если Су прав, moat компании — не доступ к модели, а learning loop поверх собственных микромиров, превращающий опыт людей и агентов в institutional memory.
— Unbounded expertise — это пока гипотеза, а не результат. Как измерять экспертизу и мирить надёжность с пластичностью — открытые вопросы, Су честно перечисляет их сам. Ну и NeoCognition продаёт ровно это, так что перед нами манифест основателя, а не нейтральный обзор.
#AI #Agents #Research #Engineering #Conference