Господа!
Давно не писал про будущее программирования. А там бурный процесс вовсю идет!)
В топе SWE-bench аж 5 топовых результатов были за последние 2 недели! И продвижение +7,6% за месяц с небольшим! 😲👏👍
И это было бы выбросом, если бы таких "выбросов" не было несколько за год. В итоге пройден путь от 4,4% в октябре прошлого года до 53% в октябре этого года!!! Еще год такими темпами и бенчмарк надо будет менять на что-то более сложное (что, заметим, во многих областях уже успешно произошло). 😲😲😲
Для тех, кто все пропустил — в SWE-bench измеряется исправление реальных issues (багрепортов) взятых из разных репозиториев гитхаба. В коллекции Verified ровно 500 issues. Задачка отчасти тепличная, поскольку требуются тесты (которые сильно упрощают проверку). Но это все равно круто. А ты %%USERNAME%% какой процент этих 500 issues закроешь и за сколько по времени? Чтобы представлять масштаб проблем — 52% issues размечены уровнем сложности 15 минут — 1 час. 8,4%: 1-4 часа, 0,6% — больше 4 часов. Это грубо 125-500 часов работы грамотного кожаного. Нормально так! До 3 месяцев при 40 часах в неделю. 😨😉 Это надо закрывать 8+ issues в день (лучше больше). Каждый день. 3 месяца. В разных репозиториях. Вперед, друзья, все у вас получится! 😁
Одна из серьезных проблем — работа с большими реальными репозиториями со всеми текущими ограничениями современных LLM на длину контекста. И ее прямо на глазах успешно решают!
Ну и в последнее время в ИИ было довольно много инвестиций. Вот топ компаний (отсюда):
Внимательный читатель заметит, что в топ-9 проинвестированных 4 строят ИИ-программистов (и на чей же сайт из этого топа идет линк коллекции Verified? 😉). Ну и как вы думаете 44% — это много или мало? 🤔 И какие у них будут успехи за следующий год? 🤔🤔🤔
Также внимательный читатель заметит в числе участников SWE таких серьезных товарищей, как:
* Amazon Q Developer Agent
* IBM Research Agent-101
* Alibaba Lingma Agent
* Bytedance MarsCode Agent
Которые (в отличие от стартапов) явно не торопятся каждый релиз в бенчмарк отправлять (но и на месте точно не сидят).
В общем вспоминаем, как зажигал Дженсен "курточка" Хуанг (CEO NVIDIA) "не отдавайте детей учиться программированию, мы заберем у них работу" и-и-и-и-и...? И к какому выводу приходим? 😉
Пост "Программисты всё вымирают и вымирают" все еще на 16-м месте в топе года Хабра, а миллионы леммингов не могут ошибаться. Там советуют расслабиться, сидеть ровно и не кашлять (дословно!)
И это ПРОСТО ПРЕКРАСНО! 👍 (не забудьте посоветовать прочитать эту статью всем знакомым) 😉 Ибо, чем больше будет тех, кто сидит на попе ровно, тем проще будет тем, кто целенаправленно прокачивается. 😎
Let's make your wisdom choice! 😁
Давно не писал про будущее программирования. А там бурный процесс вовсю идет!)
В топе SWE-bench аж 5 топовых результатов были за последние 2 недели! И продвижение +7,6% за месяц с небольшим! 😲👏👍
И это было бы выбросом, если бы таких "выбросов" не было несколько за год. В итоге пройден путь от 4,4% в октябре прошлого года до 53% в октябре этого года!!! Еще год такими темпами и бенчмарк надо будет менять на что-то более сложное (что, заметим, во многих областях уже успешно произошло). 😲😲😲
Для тех, кто все пропустил — в SWE-bench измеряется исправление реальных issues (багрепортов) взятых из разных репозиториев гитхаба. В коллекции Verified ровно 500 issues. Задачка отчасти тепличная, поскольку требуются тесты (которые сильно упрощают проверку). Но это все равно круто. А ты %%USERNAME%% какой процент этих 500 issues закроешь и за сколько по времени? Чтобы представлять масштаб проблем — 52% issues размечены уровнем сложности 15 минут — 1 час. 8,4%: 1-4 часа, 0,6% — больше 4 часов. Это грубо 125-500 часов работы грамотного кожаного. Нормально так! До 3 месяцев при 40 часах в неделю. 😨😉 Это надо закрывать 8+ issues в день (лучше больше). Каждый день. 3 месяца. В разных репозиториях. Вперед, друзья, все у вас получится! 😁
Одна из серьезных проблем — работа с большими реальными репозиториями со всеми текущими ограничениями современных LLM на длину контекста. И ее прямо на глазах успешно решают!
Ну и в последнее время в ИИ было довольно много инвестиций. Вот топ компаний (отсюда):
OpenAI — $6.6B (крупнейший раунд в истории венчурной индустрии, строит AGI, [агентов и в том числе ИИ-программиста])
xAI — $6B (строит AGI в твиттере)
SSI — $1B (строит добрый AGI)
Anthropic — $4.5B (строит LLM)
Poolside — $500M (строит ИИ-программиста)
Magic — $450M (ИИ-программист)
Cognition — $175M (ИИ-программист)
Sierra — $85M (замена customer support)
Sentient — $85M (модели на блокчейнах)
Внимательный читатель заметит, что в топ-9 проинвестированных 4 строят ИИ-программистов (и на чей же сайт из этого топа идет линк коллекции Verified? 😉). Ну и как вы думаете 44% — это много или мало? 🤔 И какие у них будут успехи за следующий год? 🤔🤔🤔
Также внимательный читатель заметит в числе участников SWE таких серьезных товарищей, как:
* Amazon Q Developer Agent
* IBM Research Agent-101
* Alibaba Lingma Agent
* Bytedance MarsCode Agent
Которые (в отличие от стартапов) явно не торопятся каждый релиз в бенчмарк отправлять (но и на месте точно не сидят).
В общем вспоминаем, как зажигал Дженсен "курточка" Хуанг (CEO NVIDIA) "не отдавайте детей учиться программированию, мы заберем у них работу" и-и-и-и-и...? И к какому выводу приходим? 😉
Пост "Программисты всё вымирают и вымирают" все еще на 16-м месте в топе года Хабра, а миллионы леммингов не могут ошибаться. Там советуют расслабиться, сидеть ровно и не кашлять (дословно!)
И это ПРОСТО ПРЕКРАСНО! 👍 (не забудьте посоветовать прочитать эту статью всем знакомым) 😉 Ибо, чем больше будет тех, кто сидит на попе ровно, тем проще будет тем, кто целенаправленно прокачивается. 😎
Let's make your wisdom choice! 😁