Loop Engineering вместо Prompt Engineering от создателей басен и мифов 👍
Пока мы ждём решения вопросиков между Anthropic и чиновниками, обратимся к вечному - методологии циклического инжениринга.
Вместе с выходом самих моделей Mythos и Fable, создатели harness от Anthropic поделились новым паттерном для работы с кодинг агентами. Назвали его Loop Engineering он преподносится, как развитие Prompt Engineering, но дополняет Context Engineering.
На самом деле, это схожий концепт с подходами Карпаты по самоусовершенствованию агентов за счёт обратной связи среды. Кстати, почему это работает? Если вспомнить, модели R1 в тех.репортах от команды DeepSeek используют RLVR для обучения. Они помещаются в среду, где награда получается автоматом, без внешних моделек. И в качестве такой среды, для примера, брался компилятор. Т.е. изначально LMку тюнили под такое поведение с RL.
Но вернемся к тому, как это нативно встраивается в harness.
Веделяются три столпа подхода:
1. Self-correction loop. Модель выполняет действие → получает обратную связь от окружения (например, код не прошел тест) → самоисправляется → и повторяет цикл, пока не удовлетворит заданному критерию (например, все тесты не будут пройдены). Все знакомо и напоминает ReAct цикл: получил задачу, сделал план, провел действие, оценил че там наделал, скорректировал план, и по кругу. Но авторы снова тут поднимают проблему ReAct подхода, как эхо камеры - тк происходит самооценка, а модель, по признанию самих же авторов, сама себя оценивает плохо (см. overconfidence bias). 🚬
Мы кстати не раз поднимали эту тему в данном канале и обращались к соседям по цеху. Поэтому вводятся, как оценки от среды (компиляторы, юнит-тесты и тп), так и саб агенты в лице иных моделей оценщиков.
2. Память. Модуль, который позволяет знаниям накапливаться между этапами и даже сессиями, и использоваться в будущем. Модель может записывать в память, как md-файлы в репозитории: извлеченные уроки, удачные паттерны и даже неудачные ходы. Помню, что последнее делал Manus. В следующих сессиях она может обратиться к этой памяти, чтобы начать работу с более высокого уровня, не повторяя прошлых ошибок. Этот механизм реализует пятиэтапный подход: fail (ошибся) → investigate (исследование причин ошибки) → verify (проверка гипотезы почему ошибся) → distill (запись верного суждения об этом в память) → consult (обращение к памяти за ранее сохраненными ходами). В целом, напоминает наше поведение. Произвёл ошибку, почесал репу, понял почему ошибся, запомнил, как надо и не надо делать, пошёл дальше, когда столкнулся с подобной ситуацией, уже научен что и как. 🧠
3. Рубрики и цель. В целом, не нативное понимание этого у авторов, по факту рубрика - оценка, цель это задача. Но тут переходят от оценочного суждения (скор, ранг, лучше/хуже), к четким проверяемым критериям: прошел тесты, без ошибок сборка встала, ответ совпадает и тп. И критерий достижения цели и есть рубрики.
И напоследок, совет дня. Инвестируйте не в "супер-промптеров", а в инженеров по проектированию агентных систем. Это стратегический сдвиг от эксплуатации к архитектуре. При этом основными скиллами становятся как контекст, так и loop инженеринг (для сложных многошаговых задач), а промптингу остаются простые, быстрые, одношаговые сценарии.
Источник помимо x.
Пока мы ждём решения вопросиков между Anthropic и чиновниками, обратимся к вечному - методологии циклического инжениринга.
Вместе с выходом самих моделей Mythos и Fable, создатели harness от Anthropic поделились новым паттерном для работы с кодинг агентами. Назвали его Loop Engineering он преподносится, как развитие Prompt Engineering, но дополняет Context Engineering.
На самом деле, это схожий концепт с подходами Карпаты по самоусовершенствованию агентов за счёт обратной связи среды. Кстати, почему это работает? Если вспомнить, модели R1 в тех.репортах от команды DeepSeek используют RLVR для обучения. Они помещаются в среду, где награда получается автоматом, без внешних моделек. И в качестве такой среды, для примера, брался компилятор. Т.е. изначально LMку тюнили под такое поведение с RL.
Но вернемся к тому, как это нативно встраивается в harness.
Веделяются три столпа подхода:
1. Self-correction loop. Модель выполняет действие → получает обратную связь от окружения (например, код не прошел тест) → самоисправляется → и повторяет цикл, пока не удовлетворит заданному критерию (например, все тесты не будут пройдены). Все знакомо и напоминает ReAct цикл: получил задачу, сделал план, провел действие, оценил че там наделал, скорректировал план, и по кругу. Но авторы снова тут поднимают проблему ReAct подхода, как эхо камеры - тк происходит самооценка, а модель, по признанию самих же авторов, сама себя оценивает плохо (см. overconfidence bias). 🚬
Мы кстати не раз поднимали эту тему в данном канале и обращались к соседям по цеху. Поэтому вводятся, как оценки от среды (компиляторы, юнит-тесты и тп), так и саб агенты в лице иных моделей оценщиков.
2. Память. Модуль, который позволяет знаниям накапливаться между этапами и даже сессиями, и использоваться в будущем. Модель может записывать в память, как md-файлы в репозитории: извлеченные уроки, удачные паттерны и даже неудачные ходы. Помню, что последнее делал Manus. В следующих сессиях она может обратиться к этой памяти, чтобы начать работу с более высокого уровня, не повторяя прошлых ошибок. Этот механизм реализует пятиэтапный подход: fail (ошибся) → investigate (исследование причин ошибки) → verify (проверка гипотезы почему ошибся) → distill (запись верного суждения об этом в память) → consult (обращение к памяти за ранее сохраненными ходами). В целом, напоминает наше поведение. Произвёл ошибку, почесал репу, понял почему ошибся, запомнил, как надо и не надо делать, пошёл дальше, когда столкнулся с подобной ситуацией, уже научен что и как. 🧠
3. Рубрики и цель. В целом, не нативное понимание этого у авторов, по факту рубрика - оценка, цель это задача. Но тут переходят от оценочного суждения (скор, ранг, лучше/хуже), к четким проверяемым критериям: прошел тесты, без ошибок сборка встала, ответ совпадает и тп. И критерий достижения цели и есть рубрики.
И напоследок, совет дня. Инвестируйте не в "супер-промптеров", а в инженеров по проектированию агентных систем. Это стратегический сдвиг от эксплуатации к архитектуре. При этом основными скиллами становятся как контекст, так и loop инженеринг (для сложных многошаговых задач), а промптингу остаются простые, быстрые, одношаговые сценарии.
Источник помимо x.