🔁🪆 loop внутри loop'а
месяц назад все угорали вокруг "harness" — обвязка, тулы, скиллы, права
ну а теперь уже подъехал новый термин: "loop engineering" 🧐
идея: больше не нужно постоянно промптить агента, — сейчас ты проектируешь петлю, которая промптит его за тебя
Boris Cherny (founder Claude Code) говорит, что не пишет промпты вообще — у него крутятся loop'ы, которые сами читают GitHub и Slack и решают, что делать
🧪 но, в целом-то, сам loop это "while-true", три строчки кода — основная штука это "проверяющий"
у агента должно быть что-то, что само скажет ему "плохо, переделай" — быстро, дёшево, без человека
в кодинге это есть нативно: тесты, компилятор, CI
поэтому там и взлетело в первую очередь — не потому что кодеры умнее, а потому что система проверки уже была готова
☠️ а в продуктовой работе классического компилятора нет
сам цикл собрать легко: агент читает провальные диалоги → находит паттерн → правит промпт → выкатывает
только кто скажет, что стало лучше? "звучит убедительнее"? посмотрим на юзерах через две недели?
нет чекера — нет и петли
получится быстрая генерация мусора, которую разгребаешь дольше, чем сделал бы руками
🤷♂️ так что тут порядок обратный тому, что пишут в типовых статьях — сначала строим evals, потом loop
иначе у нас не автономность, а автопилот без приборов
у нас на Agentic Mindset я как раз есть на днях выпустил воркшоп про evals и качество — как собрать golden set и регрессию, чтобы агенту можно было доверить автономный запуск (ну или хотя бы он не деградировал в продакшене, а мы это контролировали)
запрыгивайте, если хочется не "попробовать агентов", а довести до состояния, когда за ними не надо каждый день смотреть 🛠
месяц назад все угорали вокруг "harness" — обвязка, тулы, скиллы, права
ну а теперь уже подъехал новый термин: "loop engineering" 🧐
идея: больше не нужно постоянно промптить агента, — сейчас ты проектируешь петлю, которая промптит его за тебя
Boris Cherny (founder Claude Code) говорит, что не пишет промпты вообще — у него крутятся loop'ы, которые сами читают GitHub и Slack и решают, что делать
🧪 но, в целом-то, сам loop это "while-true", три строчки кода — основная штука это "проверяющий"
у агента должно быть что-то, что само скажет ему "плохо, переделай" — быстро, дёшево, без человека
в кодинге это есть нативно: тесты, компилятор, CI
поэтому там и взлетело в первую очередь — не потому что кодеры умнее, а потому что система проверки уже была готова
☠️ а в продуктовой работе классического компилятора нет
сам цикл собрать легко: агент читает провальные диалоги → находит паттерн → правит промпт → выкатывает
только кто скажет, что стало лучше? "звучит убедительнее"? посмотрим на юзерах через две недели?
нет чекера — нет и петли
получится быстрая генерация мусора, которую разгребаешь дольше, чем сделал бы руками
🤷♂️ так что тут порядок обратный тому, что пишут в типовых статьях — сначала строим evals, потом loop
иначе у нас не автономность, а автопилот без приборов
у нас на Agentic Mindset я как раз есть на днях выпустил воркшоп про evals и качество — как собрать golden set и регрессию, чтобы агенту можно было доверить автономный запуск (ну или хотя бы он не деградировал в продакшене, а мы это контролировали)
запрыгивайте, если хочется не "попробовать агентов", а довести до состояния, когда за ними не надо каждый день смотреть 🛠