TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
VG: VideoLab & Self-Motivated Learning

4 May 2025, 15:35

Открыть в Telegram Поделиться Пожаловаться

Господа!

Дошли руки написать про оценку скорости прогресса в нашей области.

Я недавно писал, что обучение LLM уровня GPT-2 по оценке Карпаты за 6 лет подешевело в 400 раз. И то, что в 2019 году могли делать только топовые специалисты за 40000$ сегодня может повторить любой аспирант. Кстати, экспоненциальный рост потому и сложно прогнозировать, что эти фантастические 400 раз, это рост всего пример в 3 жалких раза в год в среднем. И вот вам 400 за 6 лет. 🤔

Также еще зимой Google рапортовал, что 25% кода в компании создается ИИ, а недавно они заявили уже 30%. Причем требования к качеству кода внутри Google очень высокие и это, очевидно, не тот вайбкодинг, которым скоро будет под завязку забит Github. С другой стороны это, очевидно, низковисящие фрукты в первую очередь (тестирование, автодокументирование и т.п.) Но в любом случае интересно, сколько будет в конце года? 😉 Ваши ставки? (Я ставлю на 40-45%) 😉

Про интересный подход группы METR "Measuring AI Ability to Complete Long Tasks", который дал оценку удвоения временной сложности задач примерно каждые 7 месяцев на дистанции 5 лет (т.е. даже чуть больше 3 раз в год!) я писал недавно.

Несколько ранее, в ноябре прошлого года у них была другая работа на тему "RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts", в которой они также сравнивают производительность человека и моделей (график оттуда выше).

Там тоже, как в прошлый раз, есть вопросы к методике (например, они берут лучший результат из десятков прогонов модели, т.е. в каком-то смысле подыгрывают моделям), но в любом случае графики выглядят любопытно. Уже хотя бы потому, что стоимость часов работы моделей значительно ниже аналогичной стоимости работы человека (и, напомню, быстро падает для задач эквивалентной сложности!)

Хорошо видно, что на коротких задачах модели справляются лучше человека, однако при росте сложности задачи человек довольно быстро обгоняет все модели (и тренд результатов кожаных идет намного круче вверх).

Что тут можно сказать:

* Во-первых, если тренды сохранятся, то условно через 6 лет в 1000 может вырасти сложность успешно решаемых задач, при этом одновременно в 200 раз упадет стоимость решения аналогичной задачи (хотя время решения скорее всего заметно вырастет, в том числе для снижения себестоимости и сильно возрастет средняя сложность задачи). Звучит, как фантастика, но основания для сохранения тренда есть. ✌️

* Во-вторых, очень быстро растет, как стоимость разметки датасетов подобных задач, так и стоимость прогонов таких бенчмарков. Наибольший интерес, безусловно, к сложным задачам, а на них сохранение reward заметная проблема. Интересно, что для программистских задач хорошие объемы размеченных данных есть во внутренних кодовых базах компаний, т.е. внутри крупной компании бенчмаркать такие решения проще. Хотя открытые датасеты появляются. Например, месяц назад вышла любопытная статья, в которой размечено 170 тысяч задач! 💪 Очевидно обновляться будет и мой любимый SWE-bench (который явно закончится к двухлетию).

* В-третьих, сейчас мы наблюдаем, как студенты достаточно массово начинают использовать LLM при сдаче заданий курсов и написании дипломов (подтверждая график выше 😉). И очень рады этому. Очевидно, мы наблюдаем довольно быстрое успешное решение простых задач, традиционно выдававшихся в курсах. Недавно я спровоцировал обсуждения явления среди авторов курсов в нескольких местах (и университетах, и компаниях). Резюме как-нибудь в другой раз, но было любопытно, что, скажем так, молодые преподаватели наименее склонны были усложнению заданий (не хотят учиться — и не надо, их дело). 🤷‍♂️ Их можно понять, у них основная работа есть, и чем меньше там будет конкурентов, тем лучше 😉

Очень интересно наблюдать, к чему эти процессы приведут в среднесрочной перспективе, но уже очевидно, что наиболее будут цениться те, кто в состоянии делать очень сложные задачи (что на практике требует экспертизы, часто в разных областях). 🤷‍♂️😉

В общем — всем экспертности! 😁

#speed_of_progress

1k 0 6 9
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot