TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
КайфКодинг

2 Oct, 15:21

Telegram'da ochish Ulashish Shikoyat qilish

Детектор «нерфа» Opus 5.5 на собственной проверке не отличил Opus 5.5 от подставленного вместо него Opus 5.

Это livenerf — открытый бенчмарк разработчика под ником ninjahawk. Он стартовал примерно через два с половиной дня после релиза и раз в день гоняет одну и ту же панель вопросов, чтобы поймать момент, когда модель тихо станет хуже. За свой счёт, на подписке Max. Тред о нём на Hacker News собрал больше 900 баллов.

Прежде чем мерить, автор проверил сам прибор: дал ему заведомо известные ухудшения. Результат подмены модели он вынес в README отдельным пунктом — «Предел». Opus 5 вместо Opus 5.5 дал минус 3,8 пункта точности при стандартной ошибке 6,3 — на заранее заданном пороге 99% неразличимо.

Снижение effort прибор видит — но в токенах, а не в точности. На low выходных токенов меньше на 62%, чем на high. Точность при этом падает на 8,3 пункта с ошибкой 4,5 — на границе шума.

Поэтому главным вторичным сигналом автор называет счётчик выходных токенов: если модель тихо начнёт думать меньше, первым это покажет он, часто раньше, чем сдвинется точность.

Вторая находка — про то, что принимают за модель. Версию Claude Code автор закрепил и пишет, что это не обсуждается. Его формулировка:


Обновление Claude Code меняет обвязку, а изменившаяся обвязка выглядит ровно как изменившаяся модель.

Цена такой строгости видна в цифрах. Из 2 336 вопросов в панель попали 78: почти на всех остальных Opus 5.5 либо всегда прав, либо всегда неправ. Один прогон в день ловит сдвиг примерно от 7,5 пункта за десятидневное окно и съедает около 3,6% недельного лимита.

Вердикта пока нет, первый возможный — около 24 октября. График, под которым на Reddit в конце сентября спорили про «провал», автор тогда сам назвал базовой линией, которая ещё собиралась. Аудит 80 вопросов — 78 из панели и двух исключённых позже — нашёл 8 ключей ответов, похожих на ошибочные, и 30 неоднозначных вопросов.

Одна неудачная сессия — выборка из одного. Прибору с ежедневным прогоном одних и тех же вопросов нужен месяц.

https://github.com/ninjahawk/livenerf

Расскажите, по какому признаку вы в последний раз решили, что модель «отупела», — посмотрим, что из этого вообще можно проверить.
GitHub - ninjahawk/livenerf: Benchmark for tracking model capability after release.
Benchmark for tracking model capability after release. - ninjahawk/livenerf

180 0 1
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot