Открыл сегодня x и увидел пару постов на 100k+ просмотров про статью Recursive Language Models
Суть такая. Вместо того чтобы запихивать всё в контекст, предлагают относиться к проблеме длинного контекста как к software engineering задаче. Дать LLM инструменты вроде поиска по регуляркам, чтобы она сама обрабатывала контекст, плюс инструмент для запросов в LLM, чтобы параллельно гонять сабагентов. Идейно – обычный агент (codex/claude-code/итд) просто теперь вместо репозитория нужно искать агент работает по большому txt. Приложил картинку из статьи, очень наглядная.
Сразу после статьи вышел блогпост от PrimeIntellect (очень бодрые ребята, много делают для agentic rl и хайпуют в x). Они делали эксперименты на эту же тему и показали больше ablations, плюс небольшие улучшения вроде: а давайте инструменты будут доступны только сабагентам, чтобы не раздувать контекст основной LLM.
Мои мысли такие:
1. Мне казалось, что все deep research агенты и так работают примерно так? Саша Абрамов @dealerAI вроде писал много про инжиниринг контекста, память итп.
2. По ablations у PrimeIntellect видно, что на двух бенчмарках есть просадка, но это похоже на проблему скаффолдинга, значит лечится обучением.
3. Такой swe-agentic подход хорошо подходит для needle-in-a-haystack задач, когда в массиве текста есть атомарные факты, их нужно найти и обработать. А вот для неявной и глубокой семантики, где на текст нужно смотреть как бы сверху, кажется, уже не очень.
4. Такой swe-agentic подход удобно заводить под rl: есть multi-turn, удобнее суммаризации, инфраструктура для обучения у многих уже есть из-за расцвета RLVR. И в отличие от SWE задач не нужно 100500 разных sandbox-контейнеров под каждую задачу.
5. По названию Recursive Language Models кажется, что это про архитектуру моделей и прочее, а не про простой цикл. Но это мб только для меня так.
сама статья https://arxiv.org/abs/2512.24601v1
блогпост PrimeIntellect https://www.primeintellect.ai/blog/rlm
Твит автора https://x.com/a1zhang/status/2007198916073136152
P.S. Кстати, датасет с траекториями https://t.me/c0mmit/88, про который я писал на прошлой неделе сидит в первой десятке trending huggingface с >100 лайков.
Суть такая. Вместо того чтобы запихивать всё в контекст, предлагают относиться к проблеме длинного контекста как к software engineering задаче. Дать LLM инструменты вроде поиска по регуляркам, чтобы она сама обрабатывала контекст, плюс инструмент для запросов в LLM, чтобы параллельно гонять сабагентов. Идейно – обычный агент (codex/claude-code/итд) просто теперь вместо репозитория нужно искать агент работает по большому txt. Приложил картинку из статьи, очень наглядная.
Сразу после статьи вышел блогпост от PrimeIntellect (очень бодрые ребята, много делают для agentic rl и хайпуют в x). Они делали эксперименты на эту же тему и показали больше ablations, плюс небольшие улучшения вроде: а давайте инструменты будут доступны только сабагентам, чтобы не раздувать контекст основной LLM.
Мои мысли такие:
1. Мне казалось, что все deep research агенты и так работают примерно так? Саша Абрамов @dealerAI вроде писал много про инжиниринг контекста, память итп.
2. По ablations у PrimeIntellect видно, что на двух бенчмарках есть просадка, но это похоже на проблему скаффолдинга, значит лечится обучением.
3. Такой swe-agentic подход хорошо подходит для needle-in-a-haystack задач, когда в массиве текста есть атомарные факты, их нужно найти и обработать. А вот для неявной и глубокой семантики, где на текст нужно смотреть как бы сверху, кажется, уже не очень.
4. Такой swe-agentic подход удобно заводить под rl: есть multi-turn, удобнее суммаризации, инфраструктура для обучения у многих уже есть из-за расцвета RLVR. И в отличие от SWE задач не нужно 100500 разных sandbox-контейнеров под каждую задачу.
5. По названию Recursive Language Models кажется, что это про архитектуру моделей и прочее, а не про простой цикл. Но это мб только для меня так.
сама статья https://arxiv.org/abs/2512.24601v1
блогпост PrimeIntellect https://www.primeintellect.ai/blog/rlm
Твит автора https://x.com/a1zhang/status/2007198916073136152
P.S. Кстати, датасет с траекториями https://t.me/c0mmit/88, про который я писал на прошлой неделе сидит в первой десятке trending huggingface с >100 лайков.