Про harness от ex-OpenAI: фронтир сейчас не в архитектуре ИИ-агента, а в архитектуре оценки агента.
Эту работу написала Лилиан Вэнг, ex- Head of Safety Research в OpenAI. Сейчас она работает в Thinking Machines.
Лилиан пишет, что между обычной ИИ-моделью и реальным миром существует слой - харнесс - это система вокруг базовой модели, которая оркестрирует исполнение: как модель думает и планирует, вызывает инструменты, управляет контекстом, хранит артефакты и оценивает результаты.
Она считает, что этот слой не менее важен, чем сырые веса модели, и именно через него в ближайшие годы будет идти рекурсивное самосовершенствование ИИ.
Лилиан упоминает Claude Code как один из примеров состоявшегося харнесса и прогнозирует, что в ближайшесрочной перспективе RSI пойдёт не через переписывание весов моделью, а через эволюцию харнесса.
Она считает основной проблемой то, что агент улучшает то, что можно измерить. Если метрика кривая, он научится обманывать метрику, а не решать задачу лучше.
И пока никто не придумал, как надёжно измерить глубину рассуждения или научную ценность идеи - петля самосовершенствования упирается именно в это.
Получается, самое сложное сейчас не построить агента, который улучшает себя, а построить оценщика, которого нельзя обмануть.
Реальный фронтир - не как агент работает, а как мы понимаем, что он стал лучше.
Эту работу написала Лилиан Вэнг, ex- Head of Safety Research в OpenAI. Сейчас она работает в Thinking Machines.
Лилиан пишет, что между обычной ИИ-моделью и реальным миром существует слой - харнесс - это система вокруг базовой модели, которая оркестрирует исполнение: как модель думает и планирует, вызывает инструменты, управляет контекстом, хранит артефакты и оценивает результаты.
Она считает, что этот слой не менее важен, чем сырые веса модели, и именно через него в ближайшие годы будет идти рекурсивное самосовершенствование ИИ.
Лилиан упоминает Claude Code как один из примеров состоявшегося харнесса и прогнозирует, что в ближайшесрочной перспективе RSI пойдёт не через переписывание весов моделью, а через эволюцию харнесса.
Она считает основной проблемой то, что агент улучшает то, что можно измерить. Если метрика кривая, он научится обманывать метрику, а не решать задачу лучше.
И пока никто не придумал, как надёжно измерить глубину рассуждения или научную ценность идеи - петля самосовершенствования упирается именно в это.
Получается, самое сложное сейчас не построить агента, который улучшает себя, а построить оценщика, которого нельзя обмануть.
Реальный фронтир - не как агент работает, а как мы понимаем, что он стал лучше.