Господа!
К вопросу об изменении ландшафта специальности программист. 😉
Как знают внимательные читатели, я давно и с интересом слежу за SWE-bench (тык, тык, тык, тык...). В числе участников там Amazon, Google, IBM, Alibaba, ByteDance, Anthropic и другие вполне серьезные товарищи. Ровно поэтому этот бенчмарк и показателен.
Если стартапы очень часто ради раунда инвестиций затачиваются под датасет, то у больших компаний такое тоже бывает (что уж там, мы когда-то активно поучаствовали во вскрытии мухлежа Microsoft), но, как правило, результат серьезных дядь намного более воспроизводим и при независимых тестах похож.
Какие мысли, глядя на свежий топ номинации Verified (наиболее показательной):
1. Обратите внимание — практически весь топ — новые (последние 3 месяца). Обновление топа идет очень быстро!
2. ByteDance со свежим trae.ai всех порвали, выбив 75%, но важнее, что их агент опенсорсный
https://github.com/bytedance/trae-agent! Думаю, что это многих забустит!
3. На мой вкус крайне интересен прогресс Google. Их последняя Gemini выстрелила очень неплохо! Обратим внимание, что последний раз они сабмиттили модель аж в декабре. Скорее всего публичных сабмитов нет, поскольку они не первые (а показывать, что они в топе им не нужно), но топ явственно полнее, чем мы видим.
В целом можно констатировать, что SWE-bench довольно быстро насыщается!
Программистских агентов ругают, но главный аргумент в их пользу — где вы найдете такого джуна за 20$? 😁
Понятно, что на пути прогресса много чудного, например, вот недавняя история как раз с использованием Gemini 2.5 Pro в Cursor:
Что-то подсказывает, что агент Google скоро научится прямо говорить ("а ты, дорогой, не офигел ли такую сложную задачу давать?"))) и такое поведение починят, но сейчас это прям на редкость прекрасно 😉
———
Недавно меня пригласили выступить на вручении дипломов магистров ВМК.
Я долго думал, что сказать. Ограничиться ли обычными словами о том, какие все молодцы или сказать горькую правду. Выбрал второе. И сказал, что при текущей скорости прогресса с огромной вероятностью через 3 года модели будут уверенно решать задачи, на которые прокачанным программистам нужно 2-3 дня. А через 4 года дойдет до недели. Это значит, что агенты начнут выполнять задачи уровня спринта. И это будет революция, поскольку компании начнут сокращать мидлов и частично синьоров. В этом плане главный экзамен для сегодняшних выпускников будет через 4 года — останутся они в профессии (и начнут получать скорее всего больше) или будут вынуждены сменить профессию? Я попытался смягчить как мог, но зал, очевидно, напрягся. Наверное больше меня не позовут 😂 Незачем людям портить праздник) 😉
Господа, вы живете в феерически интересное время!
К вопросу об изменении ландшафта специальности программист. 😉
Как знают внимательные читатели, я давно и с интересом слежу за SWE-bench (тык, тык, тык, тык...). В числе участников там Amazon, Google, IBM, Alibaba, ByteDance, Anthropic и другие вполне серьезные товарищи. Ровно поэтому этот бенчмарк и показателен.
Если стартапы очень часто ради раунда инвестиций затачиваются под датасет, то у больших компаний такое тоже бывает (что уж там, мы когда-то активно поучаствовали во вскрытии мухлежа Microsoft), но, как правило, результат серьезных дядь намного более воспроизводим и при независимых тестах похож.
Какие мысли, глядя на свежий топ номинации Verified (наиболее показательной):
1. Обратите внимание — практически весь топ — новые (последние 3 месяца). Обновление топа идет очень быстро!
2. ByteDance со свежим trae.ai всех порвали, выбив 75%, но важнее, что их агент опенсорсный
https://github.com/bytedance/trae-agent! Думаю, что это многих забустит!
3. На мой вкус крайне интересен прогресс Google. Их последняя Gemini выстрелила очень неплохо! Обратим внимание, что последний раз они сабмиттили модель аж в декабре. Скорее всего публичных сабмитов нет, поскольку они не первые (а показывать, что они в топе им не нужно), но топ явственно полнее, чем мы видим.
В целом можно констатировать, что SWE-bench довольно быстро насыщается!
Программистских агентов ругают, но главный аргумент в их пользу — где вы найдете такого джуна за 20$? 😁
Понятно, что на пути прогресса много чудного, например, вот недавняя история как раз с использованием Gemini 2.5 Pro в Cursor:
При решении весьма стандартной задачи ИИ-агент впал в отчаяние и депрессию, а в конечном итоге и в режим саморазрушения, решив удалить весь код 😱 Все шаги сопровождались очень персональными сообщениями, похожими на поведение человека в отчаянии и депрессии.
Что-то подсказывает, что агент Google скоро научится прямо говорить ("а ты, дорогой, не офигел ли такую сложную задачу давать?"))) и такое поведение починят, но сейчас это прям на редкость прекрасно 😉
———
Недавно меня пригласили выступить на вручении дипломов магистров ВМК.
Я долго думал, что сказать. Ограничиться ли обычными словами о том, какие все молодцы или сказать горькую правду. Выбрал второе. И сказал, что при текущей скорости прогресса с огромной вероятностью через 3 года модели будут уверенно решать задачи, на которые прокачанным программистам нужно 2-3 дня. А через 4 года дойдет до недели. Это значит, что агенты начнут выполнять задачи уровня спринта. И это будет революция, поскольку компании начнут сокращать мидлов и частично синьоров. В этом плане главный экзамен для сегодняшних выпускников будет через 4 года — останутся они в профессии (и начнут получать скорее всего больше) или будут вынуждены сменить профессию? Я попытался смягчить как мог, но зал, очевидно, напрягся. Наверное больше меня не позовут 😂 Незачем людям портить праздник) 😉
Господа, вы живете в феерически интересное время!