Штош, настало время более сложных тестов
Взял я сервер, на котором крутится 12 довольно тяжёлых проектов, которые я последние 2.5 месяца усердно рефакторил (но судя по всему - они ещё не до конца доведены до идеала), и запустил по 11 из них 3 итерации подробных ревью:
- GPT-5.6-sol (ultra)
- GPT-6-astra (ultra)
- Opus 5 (ultracode/xhigh)
Первый работал 1.5 часа и сожрал всего лишь 3% бюджета ChatGPT Pro 20x.
Второй отработал за 30 минут, сожрал 4% бюджета ChatGPT Pro 20x.
Третий работал полдня - дважды упирался в 5-часовые лимиты Claude Max 20x, работал 12 часов (без учёта простоев), сожрал 46% недельного бюджета.
Дополнительно я запустил сравнительный аудит двух GPT-отчётов (Sol и Astra) силами Astra - шёл 35 минут, сожрал 4,25% недельного бюджета.
Затем, без учёта сравнительного аудита, я запустил ещё один - по всем трём отчётам силами Astra - шёл 30 минут и сожрал 12% (!!!) недельного бюджета.
Также сгрузил 3 отчёта и в Claude, но уже без ultracode, потому что и так все бюджеты сожраны.
А теперь к результатам, сначала сырые Sol -> Astra -> Opus:
- находок всего: 129 -> 142 -> 459
- точные строки фикса: частично -> нет -> есть
- раздел «проверено и признано НЕ дефектом»: нет -> частично -> есть
- предупреждения «этот фикс сам вызовет регрессию»: нет -> нет -> есть
- ложных срабатываний после проверки: 3 -> 6 -> 73
Отдельно по Sol/Astra, по итогам парного аудита:
- Astra точнее: из 142 заявленных проблем подтверждено 97,2% при всего 3 ошибочных утверждениях, тогда как Sol из 129 пунктов подтвердил 87,6% и допустил 29 ошибок (ложные срабатывания или неверные рекомендации)
- Sol нашёл 58 реальных проблем, которые Astra пропустил
- Astra нашёл 115 реальных проблем, которые Sol пропустил
Оговорка: это первый, парный прогон. Во втором, тройном, Astra пересчитал те же отчёты и сам себя поправил - 89,1% у Sol против 94,4% у себя, ложных 3 против 6, а уникальные стали 54 и 112. Разрыв схлопнулся почти вдвое.
Если сравнить с Opus:
- Sol нашёл 37 подтверждённых проблем, которых нет в отчёте Opus
- Astra нашёл 73 подтверждённые проблемы, которых нет в отчёте Opus
Итог: все трое сошлись всего на 22 находках из 467. Каждая модель нашла десятки реальных багов, которых не увидели две другие, так что «взять модель получше» тут не работает: покрытие общего каталога - 77,7% у Opus, 30% у Astra, 17,6% у Sol.
Но если мы оцениваем все эти аудиты не как эксперимент и повод вчитываться в тонны текста, а как реальный инструмент, который должен упростить тебе жизнь - тут Claude Opus всухую уделывает GPT Astra:
- покрытие файловы выше
- аудит шире
- тесты на регрессии
- конкретные фиксы прямо в отчете (что кстати и было запрошено у всех трёх моделей, но без внесения изменений в исходники)
Взял я сервер, на котором крутится 12 довольно тяжёлых проектов, которые я последние 2.5 месяца усердно рефакторил (но судя по всему - они ещё не до конца доведены до идеала), и запустил по 11 из них 3 итерации подробных ревью:
- GPT-5.6-sol (ultra)
- GPT-6-astra (ultra)
- Opus 5 (ultracode/xhigh)
Первый работал 1.5 часа и сожрал всего лишь 3% бюджета ChatGPT Pro 20x.
Второй отработал за 30 минут, сожрал 4% бюджета ChatGPT Pro 20x.
Третий работал полдня - дважды упирался в 5-часовые лимиты Claude Max 20x, работал 12 часов (без учёта простоев), сожрал 46% недельного бюджета.
Дополнительно я запустил сравнительный аудит двух GPT-отчётов (Sol и Astra) силами Astra - шёл 35 минут, сожрал 4,25% недельного бюджета.
Затем, без учёта сравнительного аудита, я запустил ещё один - по всем трём отчётам силами Astra - шёл 30 минут и сожрал 12% (!!!) недельного бюджета.
Также сгрузил 3 отчёта и в Claude, но уже без ultracode, потому что и так все бюджеты сожраны.
А теперь к результатам, сначала сырые Sol -> Astra -> Opus:
- находок всего: 129 -> 142 -> 459
- точные строки фикса: частично -> нет -> есть
- раздел «проверено и признано НЕ дефектом»: нет -> частично -> есть
- предупреждения «этот фикс сам вызовет регрессию»: нет -> нет -> есть
- ложных срабатываний после проверки: 3 -> 6 -> 73
Отдельно по Sol/Astra, по итогам парного аудита:
- Astra точнее: из 142 заявленных проблем подтверждено 97,2% при всего 3 ошибочных утверждениях, тогда как Sol из 129 пунктов подтвердил 87,6% и допустил 29 ошибок (ложные срабатывания или неверные рекомендации)
- Sol нашёл 58 реальных проблем, которые Astra пропустил
- Astra нашёл 115 реальных проблем, которые Sol пропустил
Оговорка: это первый, парный прогон. Во втором, тройном, Astra пересчитал те же отчёты и сам себя поправил - 89,1% у Sol против 94,4% у себя, ложных 3 против 6, а уникальные стали 54 и 112. Разрыв схлопнулся почти вдвое.
Если сравнить с Opus:
- Sol нашёл 37 подтверждённых проблем, которых нет в отчёте Opus
- Astra нашёл 73 подтверждённые проблемы, которых нет в отчёте Opus
Итог: все трое сошлись всего на 22 находках из 467. Каждая модель нашла десятки реальных багов, которых не увидели две другие, так что «взять модель получше» тут не работает: покрытие общего каталога - 77,7% у Opus, 30% у Astra, 17,6% у Sol.
Но если мы оцениваем все эти аудиты не как эксперимент и повод вчитываться в тонны текста, а как реальный инструмент, который должен упростить тебе жизнь - тут Claude Opus всухую уделывает GPT Astra:
- покрытие файловы выше
- аудит шире
- тесты на регрессии
- конкретные фиксы прямо в отчете (что кстати и было запрошено у всех трёх моделей, но без внесения изменений в исходники)