TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Вебмастер Букреев (Reader)

28 Jul, 11:19

Открыть в Telegram Поделиться Пожаловаться

Почему xhigh effort - это не режим "максимальной эффективности"

Закончил тесты GPT на десяти реальных задачах. Сравнивал обычные значения effort с переключением на xhigh.

Результат довольно однозначный: xhigh не улучшил качество ни у одной из моделей, зато существенно увеличил время работы и расход токенов.

У GPT-5.6 результат снизился с 70,18% до 69,21%, а количество полностью решенных задач - с 6 из 10 до 5 из 10. Время выросло с 21:39 до 55:40, объем входных токенов - с 3,32 до 7,08 млн, выходных - с 44,96 до 122,28 тыс.

У GPT-5.5 результат снизился с 61,38% до 59,05%, решенных задач стало 4 из 10 вместо 5 из 10. Время выросло с 38:12 до часа, выходных токенов стало больше примерно вдвое.

То есть в данном случае "не улучшил" фактически означает "ухудшил". Модель дольше работала, потратила больше токенов и в итоге решила меньше задач.

Высокий effort действительно может быть полезен, но не как настройка по умолчанию. Он нужен для задач, где требуется именно размышление:

аналитика рынка или ниши
формирование продуктовой карты
поиск неочевидных решениq
творческие задачи
работа с неявными критериями приемки
ситуации, где нужно не выполнить инструкцию, а сначала придумать, что именно следует делать

Но если агент просто выполняет понятные операции, пишет обычный код или оркестратор только управляет другими агентами, высокий effort ему не нужен.

Для кодинга он зачастую скорее вреден. Модель начинает дольше обдумывать простые действия, генерирует больше промежуточных рассуждений и медленнее приходит к тому же или даже худшему результату.

Отсюда, видимо, и рассказы о том, как люди постоянно сжигают лимиты своих тарифов, которых им вечно не хватает. Включают "максимальное мышление" для всех задач подряд и получают расход в два-три раза больше времени и токенов.

Но "больше думать" - вообще не синоним эффективности.

Иногда это буквально означает, что прежде чем выполнить ls или dir, модель долго размышляет, как эта команда повлияет на архитектуру всего проекта. 🙂

Короче, переключаться на xhigh для тестов было плохой идеей. Возвращаю модели на medium и дальнейшие сравнения буду проводить именно на нем.

Высокий effort оставлю для тех задач, где дополнительное размышление действительно является частью работы

316 2 3 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot