Harness Engineering — как OpenAI пишут весь код агентами
OpenAI выкатили большую статью о том, как их команда из 3 (потом 7) инженеров за 5 месяцев написала продукт на ~1 млн строк кода. Они ставили себе задачу выстроить работу, когда разработчики ничего не пишут руками. Весь код только через Codex-агентов. По их оценке, это в ~10 раз быстрее, чем писать вручную.
Ключевые мысли:
⚙️ Вы больше не пишете код, вы строите среду
Инженер ставит задачу, агент открывает PR. Когда что-то не получается, вопрос не «как написать лучше», а «какой capability не хватает агенту и как сделать это понятным для него». По сути, работа смещается в проектирование окружения, формулирование intent'а и построение feedback loop'ов.
Вся работа инженеров помимо выстраивания архитектуры сосредоточена на формирования туллинга для эффективной работы агента над полным выполнением задачи.
При этом первым шагом что-то можно фиксировать в AGENTS, но постепенно стоит всё, что можно уносить в автоматизированные проверки, которые агент может запустить и получить feedback.
📜 Репозиторий как единственный источник правды
Всё, что живёт в Slack, Google Docs или головах для агента не существует. Знания нужно перетаскивать в репо: доки, решения, архитектурные схемы, гайдлайны.
При этом они поняли, что один гигантский AGENTS.md не работает — контекст вытесняет саму задачу. Лучше короткая «карта» на ~100 строк + структурированная docs/ директория с небольшими файлами (в статье приведен пример структуры)
🔍 Observability как суперсила агента
По мере ускорения разработки узким местом стал QA. OpenAI дали агенту доступ к логам, метрикам и трейсам через локальный observability-стек, который поднимается под конкретный worktree. Агент ходит в логи через LogQL, в метрики через PromQL. Также они подключили Chrome DevTools, чтобы агент сам мог воспроизводить и чинить UI-баги.
🧹 Entropy и garbage collection
Качество неизбежно «плывёт»: агент копирует из кодовой базы паттерны, включая плохие. Ручная чистка не масштабируется. Они нашли решение в том, чтобы делать garbage collection техдолга руками тех же агентов: поиск техдолга, фиксы мелочей, рефакторинги, апдейты доков. В их репозитории это специализированные агенты, которые регулярно шерстят репозиторий и фиксят подобные вещи.
В RetailCRM мы активно внедряем harness-режим работы и по себе вижу, что в проектах, где делаешь первые изменения в этом подходе, большая часть времени уходит на обогащение проекта описанным выше туллингом: дополнение AGENS.md и его структурирование, а также настройку среды для работы агента
🔗 Инженерия и AI | Ilyas Salikhov
OpenAI выкатили большую статью о том, как их команда из 3 (потом 7) инженеров за 5 месяцев написала продукт на ~1 млн строк кода. Они ставили себе задачу выстроить работу, когда разработчики ничего не пишут руками. Весь код только через Codex-агентов. По их оценке, это в ~10 раз быстрее, чем писать вручную.
Ключевые мысли:
⚙️ Вы больше не пишете код, вы строите среду
Инженер ставит задачу, агент открывает PR. Когда что-то не получается, вопрос не «как написать лучше», а «какой capability не хватает агенту и как сделать это понятным для него». По сути, работа смещается в проектирование окружения, формулирование intent'а и построение feedback loop'ов.
Вся работа инженеров помимо выстраивания архитектуры сосредоточена на формирования туллинга для эффективной работы агента над полным выполнением задачи.
При этом первым шагом что-то можно фиксировать в AGENTS, но постепенно стоит всё, что можно уносить в автоматизированные проверки, которые агент может запустить и получить feedback.
📜 Репозиторий как единственный источник правды
Всё, что живёт в Slack, Google Docs или головах для агента не существует. Знания нужно перетаскивать в репо: доки, решения, архитектурные схемы, гайдлайны.
При этом они поняли, что один гигантский AGENTS.md не работает — контекст вытесняет саму задачу. Лучше короткая «карта» на ~100 строк + структурированная docs/ директория с небольшими файлами (в статье приведен пример структуры)
🔍 Observability как суперсила агента
По мере ускорения разработки узким местом стал QA. OpenAI дали агенту доступ к логам, метрикам и трейсам через локальный observability-стек, который поднимается под конкретный worktree. Агент ходит в логи через LogQL, в метрики через PromQL. Также они подключили Chrome DevTools, чтобы агент сам мог воспроизводить и чинить UI-баги.
🧹 Entropy и garbage collection
Качество неизбежно «плывёт»: агент копирует из кодовой базы паттерны, включая плохие. Ручная чистка не масштабируется. Они нашли решение в том, чтобы делать garbage collection техдолга руками тех же агентов: поиск техдолга, фиксы мелочей, рефакторинги, апдейты доков. В их репозитории это специализированные агенты, которые регулярно шерстят репозиторий и фиксят подобные вещи.
В RetailCRM мы активно внедряем harness-режим работы и по себе вижу, что в проектах, где делаешь первые изменения в этом подходе, большая часть времени уходит на обогащение проекта описанным выше туллингом: дополнение AGENS.md и его структурирование, а также настройку среды для работы агента
🔗 Инженерия и AI | Ilyas Salikhov