📎 e/acc
Бенчмарки перестали быть чем-то полезным:
- METR уже не имеет смысла, потому что агенты делают автономную работу которая измеряется неделями человеческого времени
- ARC-AGI, все три версии полностью решены на 99%
- FrontierMath (все четыре редакции), где каждая задача заняла недели времени топовых математиков для составления решен на 98%
Мы пришли в ту стадию, где ИИ нужно оценивать только по экономическому эффекту. Я сгенерировал график роста выручки ИИ компаний за последние кварталы. Выручка это некоторый прокси пользы модели в экономике, но важно понимать что стоимость токена, который может решать одну и ту же задачу все еще падает примерно в 10 раз в год.
Бенчмарки перестали быть чем-то полезным:
- METR уже не имеет смысла, потому что агенты делают автономную работу которая измеряется неделями человеческого времени
- ARC-AGI, все три версии полностью решены на 99%
- FrontierMath (все четыре редакции), где каждая задача заняла недели времени топовых математиков для составления решен на 98%
Мы пришли в ту стадию, где ИИ нужно оценивать только по экономическому эффекту. Я сгенерировал график роста выручки ИИ компаний за последние кварталы. Выручка это некоторый прокси пользы модели в экономике, но важно понимать что стоимость токена, который может решать одну и ту же задачу все еще падает примерно в 10 раз в год.