TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Копай глубже

21 Oct 2025, 13:02

Открыть в Telegram Поделиться Пожаловаться

Вы знаете что я последнее время очень интересовался бенчмарками по кодингу для LLM, в первую очередь потому что это единственная +- реальная метрика на которую можно положится для общего понимания насколько модели хорошо могут писать код.

Погружаясь в мир бенчмарков я увидел много интересного.

1. Бенчмарков существует тысячи и как правило большинство из них закрытые, то есть буквально "поверьте на слово что там были хорошие задачи и поверьте на слово что LLM их решил", как доверять таким бенчам не ясно
2. Есть открытые бенчмарки, самый известный и популярный это SWE Bench и SWE Bench Verified, где в роли задач представлены реальные issue из github. В чем разница? В случае SWE Bench Verified модель не просто пишет код и тестами проверяется валидность, код еще отсматривают специально нанятые инженеры, поэтому процент решений по SWE Bench Verified всегда ниже чем не verified.
3. Но даже в случае самого популярного SWE Bench Verified, я так и не нашел нигде к просмотру код который LLM реально написала, чтобы самостоятельно оценить качество этого кода.

В целом можно было бы собрать эти задачи, закинуть пару сот долларов на баланс и засавить модель прорешать все эти задачи, и я в целом уже был готов это делать, но тут мне на глаза попалось интересное исследование, ребята уже до меня проделали такую работу и вот что интересного они накопали.

- Было выявлено, что 32.67% успешных исправлений моделей — это "утечка решения", когда ответ уже содержится в описании задачи или комментариях (модели фактически копируют решение).
- Еще 31.08% успешных исправлений — подозрительные: слабые тесты не умеют отлавливать ошибки, и модели проходят тесты, хотя исправления неверны или неполны.
- После фильтрации таких случаев успешность SWE-Agent+GPT-4 падает с 12.47% до 3.97%.
- Чтобы решить эти проблемы, создали SWE-Bench+, в котором нет утечки решений и все задачи созданы после обучающих дат моделей, что исключает утечку знаний. На SWE-Bench+ успешность моделей заметно упала: SWE-Agent+GPT-4 — до 0.55%, SWE-RAG+GPT-4 — 0.73%, AutoCodeRover+GPT-4o — 3.83%.
- Продолжается проблема слабых тестов: около 67.72% прошедших исправлений на SWE-Bench+ на самом деле не решают проблему

То есть LLM сегодня могут решить примерно 5% от задач в которых четко описаны требования и есть ясный и понятный не очень большой фикс. Не много другая картина нежели 70% которые вы видите на лидерборде swe bench не правда ли?)

Вообщем в мире бенчей для LLM большая масса проблем из-за чего люди некорректно воспринимают переоценивают возможности LLM по написанию кода. Вопрос только в том интересно ли кому-то копать глубже?

Ссылка на исследование

218 0 0 1 5
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot