TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Тест Тьюринга

25 Aug, 09:30

Open in Telegram Share Report

🧊 Лучший скилл для агента — научиться думать зачем он выполняет свою работы

Стандартный Claude Opus 5 получил 30,16% на ARC-AGI-3 — тесте из 25 незнакомых интерактивных игр. Модели не сообщают ни правила, ни цель. Она должна сама экспериментировать, замечать изменения в своей результативности, строить модель мира и постепенно понимать, как победить.

Затем разработчик Пубеш Гоутам подключил к Claude Code один кастомный скилл. Та же модель прошла все 25 игр и 183 уровня, получив максимально возможные 100 баллов. Ей понадобилось 7 645 действий против 17 135 у медианного человека. Базовая модель многие игры вообще не завершила, поэтому прямое сравнение числа ходов невозможно.

Что именно изменилось в поведении агента?

Скилл не объяснял модели правила игр. Он заставлял её объяснять самой себе, зачем нужен следующий ход.


Перед каждым действием Claude должен был сформулировать проверяемое предсказание: какие элементы игровой ситуации изменятся, куда переместится объект, что произойдёт после нажатия или завершится ли уровень. Если агент не мог сказать, чего именно ожидает, инструмент просто не выполнял действие.

После хода программа сравнивала предсказание с фактическим результатом. Если ожидание не сбывалось, запланированная последовательность останавливалась, а ошибка сохранялась как свидетельство против прежней гипотезы. На первый взгляд это похоже на обычную проверку гипотез. Но эвристика здесь глубже: агенту предлагают не просто перебирать варианты, а сначала определить, какую неопределённость он пытается снять.

Это не тривиально даже для людей. Умный человек тоже может долго экспериментировать, нажимая на разные кнопки, собирая факты и почти не понимая, какой именно вопрос задаёт очередной пробой. В результате эксперименты превращаются в механический перебор, а не в исследование.

Пубеш Гоутам, похоже, встроил в работу модели минимальную научную дисциплину: сначала предположение, затем действие, затем сравнение ожидания с наблюдением.

За весь эксперимент Claude сделал 7 627 предсказаний и ошибся в 443. Постепенно одиночные пробные действия сменились длинными планами: в них оказалось выполнено 91,6% всех ходов. Ошибочными были 37,1% исследовательских нажатий, но лишь 2,9% действий внутри планов, основанных на уже проверенных правилах.

То есть агент не стал просто «осторожнее». Он научился отделять исследование от эксплуатации уже найденного правила: сначала проверять, потом действовать сериями.

И вот здесь начинается настоящий скилл-инжиниринг

Промпт просит модель вести себя определённым образом. Скилл определяет процедуру принятия решений в неоднозначных ситуациях. Разница примерно такая же, как между советом сотруднику «думайте перед тем, как действовать» и системой, которая не позволяет выполнить действие, пока не зафиксированы цель эксперимента и ожидаемый результат.

Отсюда вытекают принципы конструирования скиллов — не как универсальный чек-лист, а как ответы на типичные проблемы агентной работы.

1⃣ Сначала найдите не абстрактный недостаток, а повторяющийся провал. Агент не различает факт и гипотезу? Повторяет уже опровергнутую идею? Скилл нужен не ради дополнительного слоя инструкций, а ради устранения конкретной измеримой ошибки.

2⃣ Если правило действительно важно, не оставляйте его на совести модели. В этом эксперименте требование сформулировать предсказание стало техническим шлюзом: без него действие невозможно. Иначе даже хорошая инструкция постепенно превращается в необязательную рекомендацию.

3⃣ Заставляйте агента формулировать не красивые объяснения, а проверяемые ожидания. Вопрос не в том, может ли модель рассказать, что она «анализирует ситуацию», а в том, можно ли после следующего действия однозначно установить, была ли её гипотеза верной.

4⃣ Отделяйте исследование от выполнения плана. На этапе неопределённости агенту нужны короткие эксперименты и высокая чувствительность к ошибкам. После подтверждения правила — длинные последовательности и минимальное количество лишних проверок. Один и тот же режим поведения плохо подходит.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться

90 0 4 3
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot