TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
digital на минималках

10 Sep, 15:34

Открыть в Telegram Поделиться Пожаловаться

Штош, настало время более сложных тестов

Взял я сервер, на котором крутится 12 довольно тяжёлых проектов, которые я последние 2.5 месяца усердно рефакторил (но судя по всему - они ещё не до конца доведены до идеала), и запустил по 11 из них 3 итерации подробных ревью:
- GPT-5.6-sol (ultra)
- GPT-6-astra (ultra)
- Opus 5 (ultracode/xhigh)

Первый работал 1.5 часа и сожрал всего лишь 3% бюджета ChatGPT Pro 20x.
Второй отработал за 30 минут, сожрал 4% бюджета ChatGPT Pro 20x.
Третий работал полдня - дважды упирался в 5-часовые лимиты Claude Max 20x, работал 12 часов (без учёта простоев), сожрал 46% недельного бюджета.

Дополнительно я запустил сравнительный аудит двух GPT-отчётов (Sol и Astra) силами Astra - шёл 35 минут, сожрал 4,25% недельного бюджета.

Затем, без учёта сравнительного аудита, я запустил ещё один - по всем трём отчётам силами Astra - шёл 30 минут и сожрал 12% (!!!) недельного бюджета.

Также сгрузил 3 отчёта и в Claude, но уже без ultracode, потому что и так все бюджеты сожраны.

А теперь к результатам, сначала сырые Sol -> Astra -> Opus:
- находок всего: 129 -> 142 -> 459
- точные строки фикса: частично -> нет -> есть
- раздел «проверено и признано НЕ дефектом»: нет -> частично -> есть
- предупреждения «этот фикс сам вызовет регрессию»: нет -> нет -> есть
- ложных срабатываний после проверки: 3 -> 6 -> 73

Отдельно по Sol/Astra, по итогам парного аудита:
- Astra точнее: из 142 заявленных проблем подтверждено 97,2% при всего 3 ошибочных утверждениях, тогда как Sol из 129 пунктов подтвердил 87,6% и допустил 29 ошибок (ложные срабатывания или неверные рекомендации)
- Sol нашёл 58 реальных проблем, которые Astra пропустил
- Astra нашёл 115 реальных проблем, которые Sol пропустил

Оговорка: это первый, парный прогон. Во втором, тройном, Astra пересчитал те же отчёты и сам себя поправил - 89,1% у Sol против 94,4% у себя, ложных 3 против 6, а уникальные стали 54 и 112. Разрыв схлопнулся почти вдвое.

Если сравнить с Opus:
- Sol нашёл 37 подтверждённых проблем, которых нет в отчёте Opus
- Astra нашёл 73 подтверждённые проблемы, которых нет в отчёте Opus

Итог: все трое сошлись всего на 22 находках из 467. Каждая модель нашла десятки реальных багов, которых не увидели две другие, так что «взять модель получше» тут не работает: покрытие общего каталога - 77,7% у Opus, 30% у Astra, 17,6% у Sol.

Но если мы оцениваем все эти аудиты не как эксперимент и повод вчитываться в тонны текста, а как реальный инструмент, который должен упростить тебе жизнь - тут Claude Opus всухую уделывает GPT Astra:
- покрытие файловы выше
- аудит шире
- тесты на регрессии
- конкретные фиксы прямо в отчете (что кстати и было запрошено у всех трёх моделей, но без внесения изменений в исходники)

1.5k 0 7 13 20
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot