Господа!
Дошли руки написать про оценку скорости прогресса в нашей области.
Я недавно писал, что обучение LLM уровня GPT-2 по оценке Карпаты за 6 лет подешевело в 400 раз. И то, что в 2019 году могли делать только топовые специалисты за 40000$ сегодня может повторить любой аспирант. Кстати, экспоненциальный рост потому и сложно прогнозировать, что эти фантастические 400 раз, это рост всего пример в 3 жалких раза в год в среднем. И вот вам 400 за 6 лет. 🤔
Также еще зимой Google рапортовал, что 25% кода в компании создается ИИ, а недавно они заявили уже 30%. Причем требования к качеству кода внутри Google очень высокие и это, очевидно, не тот вайбкодинг, которым скоро будет под завязку забит Github. С другой стороны это, очевидно, низковисящие фрукты в первую очередь (тестирование, автодокументирование и т.п.) Но в любом случае интересно, сколько будет в конце года? 😉 Ваши ставки? (Я ставлю на 40-45%) 😉
Про интересный подход группы METR "Measuring AI Ability to Complete Long Tasks", который дал оценку удвоения временной сложности задач примерно каждые 7 месяцев на дистанции 5 лет (т.е. даже чуть больше 3 раз в год!) я писал недавно.
Несколько ранее, в ноябре прошлого года у них была другая работа на тему "RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts", в которой они также сравнивают производительность человека и моделей (график оттуда выше).
Там тоже, как в прошлый раз, есть вопросы к методике (например, они берут лучший результат из десятков прогонов модели, т.е. в каком-то смысле подыгрывают моделям), но в любом случае графики выглядят любопытно. Уже хотя бы потому, что стоимость часов работы моделей значительно ниже аналогичной стоимости работы человека (и, напомню, быстро падает для задач эквивалентной сложности!)
Хорошо видно, что на коротких задачах модели справляются лучше человека, однако при росте сложности задачи человек довольно быстро обгоняет все модели (и тренд результатов кожаных идет намного круче вверх).
Что тут можно сказать:
* Во-первых, если тренды сохранятся, то условно через 6 лет в 1000 может вырасти сложность успешно решаемых задач, при этом одновременно в 200 раз упадет стоимость решения аналогичной задачи (хотя время решения скорее всего заметно вырастет, в том числе для снижения себестоимости и сильно возрастет средняя сложность задачи). Звучит, как фантастика, но основания для сохранения тренда есть. ✌️
* Во-вторых, очень быстро растет, как стоимость разметки датасетов подобных задач, так и стоимость прогонов таких бенчмарков. Наибольший интерес, безусловно, к сложным задачам, а на них сохранение reward заметная проблема. Интересно, что для программистских задач хорошие объемы размеченных данных есть во внутренних кодовых базах компаний, т.е. внутри крупной компании бенчмаркать такие решения проще. Хотя открытые датасеты появляются. Например, месяц назад вышла любопытная статья, в которой размечено 170 тысяч задач! 💪 Очевидно обновляться будет и мой любимый SWE-bench (который явно закончится к двухлетию).
* В-третьих, сейчас мы наблюдаем, как студенты достаточно массово начинают использовать LLM при сдаче заданий курсов и написании дипломов (подтверждая график выше 😉). И очень рады этому. Очевидно, мы наблюдаем довольно быстрое успешное решение простых задач, традиционно выдававшихся в курсах. Недавно я спровоцировал обсуждения явления среди авторов курсов в нескольких местах (и университетах, и компаниях). Резюме как-нибудь в другой раз, но было любопытно, что, скажем так, молодые преподаватели наименее склонны были усложнению заданий (не хотят учиться — и не надо, их дело). 🤷♂️ Их можно понять, у них основная работа есть, и чем меньше там будет конкурентов, тем лучше 😉
Очень интересно наблюдать, к чему эти процессы приведут в среднесрочной перспективе, но уже очевидно, что наиболее будут цениться те, кто в состоянии делать очень сложные задачи (что на практике требует экспертизы, часто в разных областях). 🤷♂️😉
В общем — всем экспертности! 😁
#speed_of_progress
Дошли руки написать про оценку скорости прогресса в нашей области.
Я недавно писал, что обучение LLM уровня GPT-2 по оценке Карпаты за 6 лет подешевело в 400 раз. И то, что в 2019 году могли делать только топовые специалисты за 40000$ сегодня может повторить любой аспирант. Кстати, экспоненциальный рост потому и сложно прогнозировать, что эти фантастические 400 раз, это рост всего пример в 3 жалких раза в год в среднем. И вот вам 400 за 6 лет. 🤔
Также еще зимой Google рапортовал, что 25% кода в компании создается ИИ, а недавно они заявили уже 30%. Причем требования к качеству кода внутри Google очень высокие и это, очевидно, не тот вайбкодинг, которым скоро будет под завязку забит Github. С другой стороны это, очевидно, низковисящие фрукты в первую очередь (тестирование, автодокументирование и т.п.) Но в любом случае интересно, сколько будет в конце года? 😉 Ваши ставки? (Я ставлю на 40-45%) 😉
Про интересный подход группы METR "Measuring AI Ability to Complete Long Tasks", который дал оценку удвоения временной сложности задач примерно каждые 7 месяцев на дистанции 5 лет (т.е. даже чуть больше 3 раз в год!) я писал недавно.
Несколько ранее, в ноябре прошлого года у них была другая работа на тему "RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts", в которой они также сравнивают производительность человека и моделей (график оттуда выше).
Там тоже, как в прошлый раз, есть вопросы к методике (например, они берут лучший результат из десятков прогонов модели, т.е. в каком-то смысле подыгрывают моделям), но в любом случае графики выглядят любопытно. Уже хотя бы потому, что стоимость часов работы моделей значительно ниже аналогичной стоимости работы человека (и, напомню, быстро падает для задач эквивалентной сложности!)
Хорошо видно, что на коротких задачах модели справляются лучше человека, однако при росте сложности задачи человек довольно быстро обгоняет все модели (и тренд результатов кожаных идет намного круче вверх).
Что тут можно сказать:
* Во-первых, если тренды сохранятся, то условно через 6 лет в 1000 может вырасти сложность успешно решаемых задач, при этом одновременно в 200 раз упадет стоимость решения аналогичной задачи (хотя время решения скорее всего заметно вырастет, в том числе для снижения себестоимости и сильно возрастет средняя сложность задачи). Звучит, как фантастика, но основания для сохранения тренда есть. ✌️
* Во-вторых, очень быстро растет, как стоимость разметки датасетов подобных задач, так и стоимость прогонов таких бенчмарков. Наибольший интерес, безусловно, к сложным задачам, а на них сохранение reward заметная проблема. Интересно, что для программистских задач хорошие объемы размеченных данных есть во внутренних кодовых базах компаний, т.е. внутри крупной компании бенчмаркать такие решения проще. Хотя открытые датасеты появляются. Например, месяц назад вышла любопытная статья, в которой размечено 170 тысяч задач! 💪 Очевидно обновляться будет и мой любимый SWE-bench (который явно закончится к двухлетию).
* В-третьих, сейчас мы наблюдаем, как студенты достаточно массово начинают использовать LLM при сдаче заданий курсов и написании дипломов (подтверждая график выше 😉). И очень рады этому. Очевидно, мы наблюдаем довольно быстрое успешное решение простых задач, традиционно выдававшихся в курсах. Недавно я спровоцировал обсуждения явления среди авторов курсов в нескольких местах (и университетах, и компаниях). Резюме как-нибудь в другой раз, но было любопытно, что, скажем так, молодые преподаватели наименее склонны были усложнению заданий (не хотят учиться — и не надо, их дело). 🤷♂️ Их можно понять, у них основная работа есть, и чем меньше там будет конкурентов, тем лучше 😉
Очень интересно наблюдать, к чему эти процессы приведут в среднесрочной перспективе, но уже очевидно, что наиболее будут цениться те, кто в состоянии делать очень сложные задачи (что на практике требует экспертизы, часто в разных областях). 🤷♂️😉
В общем — всем экспертности! 😁
#speed_of_progress