TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
commit history

1 Jul, 20:46

Telegram'da ochish Ulashish Shikoyat qilish

За последний месяц сделали несколько апдейтов SWE-rebench Leaderboard:

https://swe-rebench.com/

> собрали новые задачи и прогнали кучу моделей на свежем срезе
> обновили интерфейс, сделали его более понятным и красивым
> добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor

Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.

Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.

> SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks

> SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks

Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов.
@etechlead
@ai_driven
Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки.

https://youtu.be/a5jf-kyV12Y
SWE-rebench v1: Как создать хороший SWE бенчмарк? Рассказывает Ибрагим Бадертдинов.
В этом видео Родион Мостовой беседует с Ибрагимом Бадертдиновым, ML-исследователем из компании Nebius. Основная тема разговора — создание бенчмарка SWE-rebench для оценки больших языковых моделей (LLM) и кодовых агентов в задачах программирования. Ибрагим подробно рассказывает о том, почему оригинал...

2.5k 0 24 38
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot