TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
AI Feed

16 Jun, 12:47

Telegram'da ochish Ulashish Shikoyat qilish

📎 Адель и МЛь

Artificial Analysis обновили свой Intelligence Index.

Его заметно сдвинули в сторону agentic workloads и выкинули старые уже насыщенные бенчи.

Некоторые конкретно поменяли:
- Terminal-Bench Hard заменили на Terminal-Bench 2.1 - более свежий и сложный набор задач для агентских сценариев.
- τ²-Bench Telecom заменили на τ³-Bench Banking - тоже более реалистичные и тяжёлые агентские задачи.
- GDPval-AA обновили до GDPval-AA v2: подтянули расчеты Elo под длинные агентские цепочки, а не только короткие ответы
- IFBench убрали из Intelligence Index, потому что он насытился и перестал хорошо разделять frontier-модели

Ещё добавили новые per-task метрики: cost per task, time per task и tokens per task. Теперь можно смотреть не только “насколько модель умная”, но и сколько в среднем стоит одна задача, сколько она занимает времени и сколько токенов модель тратит. Короче можно взвешивать в зависимости от ваших приоритетов.

Плюс теперь отдельно учитывают cached input tokens и их влияние на стоимость, потому что в реальных агентских сценариях кэш может сильно менять экономику.

Понятно, что лидерборды немного изменились. Из интересного по результатам:

- Claude Opus 4.8 max сейчас выглядит как самая сильная доступная модель, GPT-5.5 xhigh идёт почти рядом, но заметно дешевле.
- Sonnet 4.6 max оказался выше Gemini 3.1 Pro.
- DeepSeek V4 Flash max встал примерно на уровне GPT-5.4-mini xhigh, но дешевле в 8 раз. Очень сильный cost/performance.
- Mistral, к сожалению, совсем утонули: их лучшая модель Medium 3.5 набрала всего 30 очков - примерно на уровне Claude 4.5 Haiku. Ждем Le Chaton Fat %)

Если вас, как и меня, интересуют небольшие модели с хорошими агентскими способностями, то тут с большим отрывом лидируют Qwen 3.6 27B и Qwen 3.6 35B A3B. Остальные даже не рядом, хотя по coding index Qwen, Gemma и Cohere выглядят примерно сопоставимо.

В целом хороший апдейт. Бенчи быстро стареют и насыщаются, поэтому индекс надо постоянно чистить и двигать ближе к реальным задачам. Плюс очень удобно смотреть на другие индексы вроде костов, скорости и токенов.

основной индекс
маленькие агентские модели

11 0 0
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot