Почему xhigh effort - это не режим "максимальной эффективности"
Закончил тесты GPT на десяти реальных задачах. Сравнивал обычные значения effort с переключением на xhigh.
Результат довольно однозначный: xhigh не улучшил качество ни у одной из моделей, зато существенно увеличил время работы и расход токенов.
У GPT-5.6 результат снизился с 70,18% до 69,21%, а количество полностью решенных задач - с 6 из 10 до 5 из 10. Время выросло с 21:39 до 55:40, объем входных токенов - с 3,32 до 7,08 млн, выходных - с 44,96 до 122,28 тыс.
У GPT-5.5 результат снизился с 61,38% до 59,05%, решенных задач стало 4 из 10 вместо 5 из 10. Время выросло с 38:12 до часа, выходных токенов стало больше примерно вдвое.
То есть в данном случае "не улучшил" фактически означает "ухудшил". Модель дольше работала, потратила больше токенов и в итоге решила меньше задач.
Высокий effort действительно может быть полезен, но не как настройка по умолчанию. Он нужен для задач, где требуется именно размышление:
аналитика рынка или ниши
формирование продуктовой карты
поиск неочевидных решениq
творческие задачи
работа с неявными критериями приемки
ситуации, где нужно не выполнить инструкцию, а сначала придумать, что именно следует делать
Но если агент просто выполняет понятные операции, пишет обычный код или оркестратор только управляет другими агентами, высокий effort ему не нужен.
Для кодинга он зачастую скорее вреден. Модель начинает дольше обдумывать простые действия, генерирует больше промежуточных рассуждений и медленнее приходит к тому же или даже худшему результату.
Отсюда, видимо, и рассказы о том, как люди постоянно сжигают лимиты своих тарифов, которых им вечно не хватает. Включают "максимальное мышление" для всех задач подряд и получают расход в два-три раза больше времени и токенов.
Но "больше думать" - вообще не синоним эффективности.
Иногда это буквально означает, что прежде чем выполнить ls или dir, модель долго размышляет, как эта команда повлияет на архитектуру всего проекта. 🙂
Короче, переключаться на xhigh для тестов было плохой идеей. Возвращаю модели на medium и дальнейшие сравнения буду проводить именно на нем.
Высокий effort оставлю для тех задач, где дополнительное размышление действительно является частью работы
Закончил тесты GPT на десяти реальных задачах. Сравнивал обычные значения effort с переключением на xhigh.
Результат довольно однозначный: xhigh не улучшил качество ни у одной из моделей, зато существенно увеличил время работы и расход токенов.
У GPT-5.6 результат снизился с 70,18% до 69,21%, а количество полностью решенных задач - с 6 из 10 до 5 из 10. Время выросло с 21:39 до 55:40, объем входных токенов - с 3,32 до 7,08 млн, выходных - с 44,96 до 122,28 тыс.
У GPT-5.5 результат снизился с 61,38% до 59,05%, решенных задач стало 4 из 10 вместо 5 из 10. Время выросло с 38:12 до часа, выходных токенов стало больше примерно вдвое.
То есть в данном случае "не улучшил" фактически означает "ухудшил". Модель дольше работала, потратила больше токенов и в итоге решила меньше задач.
Высокий effort действительно может быть полезен, но не как настройка по умолчанию. Он нужен для задач, где требуется именно размышление:
аналитика рынка или ниши
формирование продуктовой карты
поиск неочевидных решениq
творческие задачи
работа с неявными критериями приемки
ситуации, где нужно не выполнить инструкцию, а сначала придумать, что именно следует делать
Но если агент просто выполняет понятные операции, пишет обычный код или оркестратор только управляет другими агентами, высокий effort ему не нужен.
Для кодинга он зачастую скорее вреден. Модель начинает дольше обдумывать простые действия, генерирует больше промежуточных рассуждений и медленнее приходит к тому же или даже худшему результату.
Отсюда, видимо, и рассказы о том, как люди постоянно сжигают лимиты своих тарифов, которых им вечно не хватает. Включают "максимальное мышление" для всех задач подряд и получают расход в два-три раза больше времени и токенов.
Но "больше думать" - вообще не синоним эффективности.
Иногда это буквально означает, что прежде чем выполнить ls или dir, модель долго размышляет, как эта команда повлияет на архитектуру всего проекта. 🙂
Короче, переключаться на xhigh для тестов было плохой идеей. Возвращаю модели на medium и дальнейшие сравнения буду проводить именно на нем.
Высокий effort оставлю для тех задач, где дополнительное размышление действительно является частью работы