Наука или инженерия
Мысли после ICML'26 [2/2]
В первой части обсуждали критерии научности и 10% работ, которые им соответствуют. Теперь про остальные 90%. Чему они соответствуют?
Roberto Pieraccini называет такие работы translational имея ввиду “перевод” общих методов в плоскость прикладных задач. По смыслу это ближе всего к тому что ML сообществе называют RnD:
• Составление бенчмарков
• Добавление к общему методу inductive bias конкретной модальности или задачи
• Локальные трюки и хаки
То есть высокая специфичность решений может не обобщаться, а знания и трюки — устаревать еще до появления на конференции.
Сразу отмечу, что не считаю такие работы менее интересными или ценными. Они часто проверяют полезность общих методов и закрывают актуальные вопросы, волнующие сообщество здесь и сейчас. Давайте рассмотрим на примерах.
Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models
Инференс DLM опирается на потокенные confidence и энтропию. Их независимость может приводить к несогласованным траекториям (одновременно размаскируем sunny и rainy в разных частях одного предложения). Авторы предлагают доп верификацию противоречивности уже после диффузионного семплинга. Это дает ускорение, метод training-free.
Полезно? Сейчас точно да. Научно? Со сменой генеративного стека и общим прогрессом качества метод может обесцениться.
CUARewardBench: Benchmark for Evaluating Reward Models on Computer-using Agent Trajectories
Первый бенчмарк сразу для outcome- и process-reward моделей, оценивающих computer-using агентов. По сути, сделали метрику (human judges) на метрику (VLM as a judge), прогнали 7 VLM и описали наблюдения. Например, что общие модели судят траектории лучше специализированных CUA, а Qwen2.5VL-72B проиграл своей же 32B 🌚
Полезно? Да, очень. Научно? Паттерн работы агентов может поменяться и бенч станет не актуален.
❗️Описанные работы ценны, но важно относиться к ним по-другому.
В чем же ценность? Для меня — в возможности понять общее направление проблем и их решений. Если обозреть их на более высоком уровне, то можно заметить интресные факты.
В диффузии, например, из DLM всё больше делают авторегрессию. Нам повезло с JustGRPO из прошлого поста — outstanding paper говорит о неоднозначности полезности произвольного порядка семплирования явно. Можно ли было понять это без той работы? Да, можно, подумав о том что стоит за Beyond confidence в этом посте и десятком аналогичных работ.
В агентах другая проблема — им никто не доверяет. FormalJudge, SERA, MAS-ProVe, ReSeek, тот же CUARewardBench: в десятках статье к агенту приделывается верификатор потому что агенты не могут оценить себя сами. Возможно, прогресс области ограничен сигналом верификации, а не способностями модели.
Практический вывод №2: translational статьи полезны, особенно если смотреть глубже частных трюков и стараться обобщать.
И снова, не важно где вы изучаете работы. Надеюсь, кому-то подобный подход к разбору статей хотя бы немного упростит жизнь.
Мысли после ICML'26 [2/2]
В первой части обсуждали критерии научности и 10% работ, которые им соответствуют. Теперь про остальные 90%. Чему они соответствуют?
Roberto Pieraccini называет такие работы translational имея ввиду “перевод” общих методов в плоскость прикладных задач. По смыслу это ближе всего к тому что ML сообществе называют RnD:
• Составление бенчмарков
• Добавление к общему методу inductive bias конкретной модальности или задачи
• Локальные трюки и хаки
То есть высокая специфичность решений может не обобщаться, а знания и трюки — устаревать еще до появления на конференции.
Сразу отмечу, что не считаю такие работы менее интересными или ценными. Они часто проверяют полезность общих методов и закрывают актуальные вопросы, волнующие сообщество здесь и сейчас. Давайте рассмотрим на примерах.
Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models
Инференс DLM опирается на потокенные confidence и энтропию. Их независимость может приводить к несогласованным траекториям (одновременно размаскируем sunny и rainy в разных частях одного предложения). Авторы предлагают доп верификацию противоречивности уже после диффузионного семплинга. Это дает ускорение, метод training-free.
Полезно? Сейчас точно да. Научно? Со сменой генеративного стека и общим прогрессом качества метод может обесцениться.
CUARewardBench: Benchmark for Evaluating Reward Models on Computer-using Agent Trajectories
Первый бенчмарк сразу для outcome- и process-reward моделей, оценивающих computer-using агентов. По сути, сделали метрику (human judges) на метрику (VLM as a judge), прогнали 7 VLM и описали наблюдения. Например, что общие модели судят траектории лучше специализированных CUA, а Qwen2.5VL-72B проиграл своей же 32B 🌚
Полезно? Да, очень. Научно? Паттерн работы агентов может поменяться и бенч станет не актуален.
❗️Описанные работы ценны, но важно относиться к ним по-другому.
В чем же ценность? Для меня — в возможности понять общее направление проблем и их решений. Если обозреть их на более высоком уровне, то можно заметить интресные факты.
В диффузии, например, из DLM всё больше делают авторегрессию. Нам повезло с JustGRPO из прошлого поста — outstanding paper говорит о неоднозначности полезности произвольного порядка семплирования явно. Можно ли было понять это без той работы? Да, можно, подумав о том что стоит за Beyond confidence в этом посте и десятком аналогичных работ.
В агентах другая проблема — им никто не доверяет. FormalJudge, SERA, MAS-ProVe, ReSeek, тот же CUARewardBench: в десятках статье к агенту приделывается верификатор потому что агенты не могут оценить себя сами. Возможно, прогресс области ограничен сигналом верификации, а не способностями модели.
Практический вывод №2: translational статьи полезны, особенно если смотреть глубже частных трюков и стараться обобщать.
И снова, не важно где вы изучаете работы. Надеюсь, кому-то подобный подход к разбору статей хотя бы немного упростит жизнь.