Репост из: Илья Филиппов
От промптов к loops
Поигрался чуть-чуть с Fable 5 — и поймал себя на мысли, как быстро сменилась парадигма. Сначала мы все писали промпты. Потом строили агентов. Теперь нам Антропик советует создавать loops — петли, в которых модель сама себя корректирует.
Что понимается под loops?
Вместо того чтобы «рулить» моделью вручную, эффективнее дать ей среду с обратной связью. Задаёшь цель и рубрику с проверяемыми критериями — агент работает, сверяется, корректируется и продолжает, пока критерии не выполнены.
Ключевой нюанс (по мнению того же Антропика) — кто судит. Самокритика у моделей работает плохо: отдельный verifier-агент с независимым контекстом стабильно обыгрывает self-critique. Не просить модель «проверь себя», а отдать независимого оценщика,
Еще приём — память как петля поверх сессий: модель фиксирует ошибки, разбирается в причинах, дистиллирует их в правила и переиспользует. Старшие модели проходят этот цикл целиком — получается самообучающаяся база знаний агента.
/goal уже использую, с остальным буду играться дальше)
Какой вывод?
Эволюция продолжается: prompt engineering → agent engineering → loop engineering. И выигрывать будут те, кто раньше научится проектировать такие среды) и старое доброе - у кого лучше данные)
Поигрался чуть-чуть с Fable 5 — и поймал себя на мысли, как быстро сменилась парадигма. Сначала мы все писали промпты. Потом строили агентов. Теперь нам Антропик советует создавать loops — петли, в которых модель сама себя корректирует.
Что понимается под loops?
Вместо того чтобы «рулить» моделью вручную, эффективнее дать ей среду с обратной связью. Задаёшь цель и рубрику с проверяемыми критериями — агент работает, сверяется, корректируется и продолжает, пока критерии не выполнены.
Ключевой нюанс (по мнению того же Антропика) — кто судит. Самокритика у моделей работает плохо: отдельный verifier-агент с независимым контекстом стабильно обыгрывает self-critique. Не просить модель «проверь себя», а отдать независимого оценщика,
Еще приём — память как петля поверх сессий: модель фиксирует ошибки, разбирается в причинах, дистиллирует их в правила и переиспользует. Старшие модели проходят этот цикл целиком — получается самообучающаяся база знаний агента.
/goal уже использую, с остальным буду играться дальше)
Какой вывод?
Эволюция продолжается: prompt engineering → agent engineering → loop engineering. И выигрывать будут те, кто раньше научится проектировать такие среды) и старое доброе - у кого лучше данные)