🧊 Лучший скилл для агента — научиться думать зачем он выполняет свою работы
Стандартный Claude Opus 5 получил 30,16% на ARC-AGI-3 — тесте из 25 незнакомых интерактивных игр. Модели не сообщают ни правила, ни цель. Она должна сама экспериментировать, замечать изменения в своей результативности, строить модель мира и постепенно понимать, как победить.
Затем разработчик Пубеш Гоутам подключил к Claude Code один кастомный скилл. Та же модель прошла все 25 игр и 183 уровня, получив максимально возможные 100 баллов. Ей понадобилось 7 645 действий против 17 135 у медианного человека. Базовая модель многие игры вообще не завершила, поэтому прямое сравнение числа ходов невозможно.
Что именно изменилось в поведении агента?
Перед каждым действием Claude должен был сформулировать проверяемое предсказание: какие элементы игровой ситуации изменятся, куда переместится объект, что произойдёт после нажатия или завершится ли уровень. Если агент не мог сказать, чего именно ожидает, инструмент просто не выполнял действие.
После хода программа сравнивала предсказание с фактическим результатом. Если ожидание не сбывалось, запланированная последовательность останавливалась, а ошибка сохранялась как свидетельство против прежней гипотезы. На первый взгляд это похоже на обычную проверку гипотез. Но эвристика здесь глубже: агенту предлагают не просто перебирать варианты, а сначала определить, какую неопределённость он пытается снять.
Это не тривиально даже для людей. Умный человек тоже может долго экспериментировать, нажимая на разные кнопки, собирая факты и почти не понимая, какой именно вопрос задаёт очередной пробой. В результате эксперименты превращаются в механический перебор, а не в исследование.
Пубеш Гоутам, похоже, встроил в работу модели минимальную научную дисциплину: сначала предположение, затем действие, затем сравнение ожидания с наблюдением.
За весь эксперимент Claude сделал 7 627 предсказаний и ошибся в 443. Постепенно одиночные пробные действия сменились длинными планами: в них оказалось выполнено 91,6% всех ходов. Ошибочными были 37,1% исследовательских нажатий, но лишь 2,9% действий внутри планов, основанных на уже проверенных правилах.
То есть агент не стал просто «осторожнее». Он научился отделять исследование от эксплуатации уже найденного правила: сначала проверять, потом действовать сериями.
И вот здесь начинается настоящий скилл-инжиниринг
Промпт просит модель вести себя определённым образом. Скилл определяет процедуру принятия решений в неоднозначных ситуациях. Разница примерно такая же, как между советом сотруднику «думайте перед тем, как действовать» и системой, которая не позволяет выполнить действие, пока не зафиксированы цель эксперимента и ожидаемый результат.
Отсюда вытекают принципы конструирования скиллов — не как универсальный чек-лист, а как ответы на типичные проблемы агентной работы.
1⃣ Сначала найдите не абстрактный недостаток, а повторяющийся провал. Агент не различает факт и гипотезу? Повторяет уже опровергнутую идею? Скилл нужен не ради дополнительного слоя инструкций, а ради устранения конкретной измеримой ошибки.
2⃣ Если правило действительно важно, не оставляйте его на совести модели. В этом эксперименте требование сформулировать предсказание стало техническим шлюзом: без него действие невозможно. Иначе даже хорошая инструкция постепенно превращается в необязательную рекомендацию.
3⃣ Заставляйте агента формулировать не красивые объяснения, а проверяемые ожидания. Вопрос не в том, может ли модель рассказать, что она «анализирует ситуацию», а в том, можно ли после следующего действия однозначно установить, была ли её гипотеза верной.
4⃣ Отделяйте исследование от выполнения плана. На этапе неопределённости агенту нужны короткие эксперименты и высокая чувствительность к ошибкам. После подтверждения правила — длинные последовательности и минимальное количество лишних проверок. Один и тот же режим поведения плохо подходит.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Стандартный Claude Opus 5 получил 30,16% на ARC-AGI-3 — тесте из 25 незнакомых интерактивных игр. Модели не сообщают ни правила, ни цель. Она должна сама экспериментировать, замечать изменения в своей результативности, строить модель мира и постепенно понимать, как победить.
Затем разработчик Пубеш Гоутам подключил к Claude Code один кастомный скилл. Та же модель прошла все 25 игр и 183 уровня, получив максимально возможные 100 баллов. Ей понадобилось 7 645 действий против 17 135 у медианного человека. Базовая модель многие игры вообще не завершила, поэтому прямое сравнение числа ходов невозможно.
Что именно изменилось в поведении агента?
Скилл не объяснял модели правила игр. Он заставлял её объяснять самой себе, зачем нужен следующий ход.
Перед каждым действием Claude должен был сформулировать проверяемое предсказание: какие элементы игровой ситуации изменятся, куда переместится объект, что произойдёт после нажатия или завершится ли уровень. Если агент не мог сказать, чего именно ожидает, инструмент просто не выполнял действие.
После хода программа сравнивала предсказание с фактическим результатом. Если ожидание не сбывалось, запланированная последовательность останавливалась, а ошибка сохранялась как свидетельство против прежней гипотезы. На первый взгляд это похоже на обычную проверку гипотез. Но эвристика здесь глубже: агенту предлагают не просто перебирать варианты, а сначала определить, какую неопределённость он пытается снять.
Это не тривиально даже для людей. Умный человек тоже может долго экспериментировать, нажимая на разные кнопки, собирая факты и почти не понимая, какой именно вопрос задаёт очередной пробой. В результате эксперименты превращаются в механический перебор, а не в исследование.
Пубеш Гоутам, похоже, встроил в работу модели минимальную научную дисциплину: сначала предположение, затем действие, затем сравнение ожидания с наблюдением.
За весь эксперимент Claude сделал 7 627 предсказаний и ошибся в 443. Постепенно одиночные пробные действия сменились длинными планами: в них оказалось выполнено 91,6% всех ходов. Ошибочными были 37,1% исследовательских нажатий, но лишь 2,9% действий внутри планов, основанных на уже проверенных правилах.
То есть агент не стал просто «осторожнее». Он научился отделять исследование от эксплуатации уже найденного правила: сначала проверять, потом действовать сериями.
И вот здесь начинается настоящий скилл-инжиниринг
Промпт просит модель вести себя определённым образом. Скилл определяет процедуру принятия решений в неоднозначных ситуациях. Разница примерно такая же, как между советом сотруднику «думайте перед тем, как действовать» и системой, которая не позволяет выполнить действие, пока не зафиксированы цель эксперимента и ожидаемый результат.
Отсюда вытекают принципы конструирования скиллов — не как универсальный чек-лист, а как ответы на типичные проблемы агентной работы.
1⃣ Сначала найдите не абстрактный недостаток, а повторяющийся провал. Агент не различает факт и гипотезу? Повторяет уже опровергнутую идею? Скилл нужен не ради дополнительного слоя инструкций, а ради устранения конкретной измеримой ошибки.
2⃣ Если правило действительно важно, не оставляйте его на совести модели. В этом эксперименте требование сформулировать предсказание стало техническим шлюзом: без него действие невозможно. Иначе даже хорошая инструкция постепенно превращается в необязательную рекомендацию.
3⃣ Заставляйте агента формулировать не красивые объяснения, а проверяемые ожидания. Вопрос не в том, может ли модель рассказать, что она «анализирует ситуацию», а в том, можно ли после следующего действия однозначно установить, была ли её гипотеза верной.
4⃣ Отделяйте исследование от выполнения плана. На этапе неопределённости агенту нужны короткие эксперименты и высокая чувствительность к ошибкам. После подтверждения правила — длинные последовательности и минимальное количество лишних проверок. Один и тот же режим поведения плохо подходит.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться