Наука или инженерия
Мысли после ICML'26 [1/2]
Не важно ходишь ли по постерам в Сеуле или пытаешься читать по заверениям дедов фид arxiv cs.ai 👴: твой контекст не бесконечен и не очевидно на что его тратить.
Есть такой Roberto Pieraccini, я бы его описал как Шмитхубера здорового человека: много чего сделал и понял, но не пытается причислить себе все ключевые находки в ML. У него есть блог The voice in the machine, в котором он много рефлексирует и обсуждает прогресс.
В эссе Prompting Is Not AI Research он на примере статей, про, собственно, промтинг предлагает для определения научности использовать критерии:
1. Механизм. Работа объясняет, почему объект исследования ведет себя определенным образом или только фиксирует поведение?
2. Долговечность. Знание накапливается или обесценивается с очередным релизом модели?
Идея не нова, но заставила задуматься.
Дальше я решил посмотреть на статьи с ICML: грепнул все работы, разметил LM’кой, вышло ~10% науки против ~90% всего остального. Разметка автоматическая, да и граница между категориями размытая, так что это скорее порядок величины.
Дальше я решил взять две области, за которыми следил на конфе: диффузионки и агентов. По ним было примерно по 450 статей, всего около 15% конференции. Дальше повторил классификацию, получил по диффузии порядка 11% научных работ (чуть выше среднего), а по агентам (ожидаемо) всего 3%.
Ситуация со статьями по агентам ожидаема потому что в сообществе сейчас популярно мнение, что это вообще не область и науки в ней нет, но так ли это?
Ниже примеры по-настоящиму научных работ в каждой из областей.
The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
[код, веса]
Одна из двух Outstanding Papers этой конфы. Интуиция такая: произвольный порядок генерации в DLM включает left-to-right как частный случай и кажется, он должен делать всё строго лучше. Но авторы показывают, что на математике и коде выходит обратное: DLM пользуется свободой порядка, чтобы избегать токенов с высокой неопределенностью, те самые forking tokens, где ветвятся пути решения. В результате генерация коллапсирует. Лечат JustGRPO: left-to-right форсят только на RL-фазе.
The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents
RAG-агентов оценивают по одному запросу, и это прячет главное: запросы геометрически связаны в общем эмбеддинг-пространстве. Плотность документов по широкой теме (например, фильмы-боевики) выдавливает из top-k соседнюю узкую категорию (Film Noir 🧐). Это фундаментальная проблема RAG-систем, корень которой в самом лоссе на обучении поисковых агентов. Для решения проблмы переформулируют задачу и делают так чтоб агент сам двигал эмбеддинги, оптимизируя свою же точность поиска.
Практический вывод №1: больше внимания действительно научным статьям. Их, в действительности, не так много.
В следующем посте - про остальные 90%, их ценность, которая видна только при чтении множества работ.
Мысли после ICML'26 [1/2]
Не важно ходишь ли по постерам в Сеуле или пытаешься читать по заверениям дедов фид arxiv cs.ai 👴: твой контекст не бесконечен и не очевидно на что его тратить.
Есть такой Roberto Pieraccini, я бы его описал как Шмитхубера здорового человека: много чего сделал и понял, но не пытается причислить себе все ключевые находки в ML. У него есть блог The voice in the machine, в котором он много рефлексирует и обсуждает прогресс.
В эссе Prompting Is Not AI Research он на примере статей, про, собственно, промтинг предлагает для определения научности использовать критерии:
1. Механизм. Работа объясняет, почему объект исследования ведет себя определенным образом или только фиксирует поведение?
2. Долговечность. Знание накапливается или обесценивается с очередным релизом модели?
Идея не нова, но заставила задуматься.
Дальше я решил посмотреть на статьи с ICML: грепнул все работы, разметил LM’кой, вышло ~10% науки против ~90% всего остального. Разметка автоматическая, да и граница между категориями размытая, так что это скорее порядок величины.
Дальше я решил взять две области, за которыми следил на конфе: диффузионки и агентов. По ним было примерно по 450 статей, всего около 15% конференции. Дальше повторил классификацию, получил по диффузии порядка 11% научных работ (чуть выше среднего), а по агентам (ожидаемо) всего 3%.
Ситуация со статьями по агентам ожидаема потому что в сообществе сейчас популярно мнение, что это вообще не область и науки в ней нет, но так ли это?
Ниже примеры по-настоящиму научных работ в каждой из областей.
The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
[код, веса]
Одна из двух Outstanding Papers этой конфы. Интуиция такая: произвольный порядок генерации в DLM включает left-to-right как частный случай и кажется, он должен делать всё строго лучше. Но авторы показывают, что на математике и коде выходит обратное: DLM пользуется свободой порядка, чтобы избегать токенов с высокой неопределенностью, те самые forking tokens, где ветвятся пути решения. В результате генерация коллапсирует. Лечат JustGRPO: left-to-right форсят только на RL-фазе.
The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents
RAG-агентов оценивают по одному запросу, и это прячет главное: запросы геометрически связаны в общем эмбеддинг-пространстве. Плотность документов по широкой теме (например, фильмы-боевики) выдавливает из top-k соседнюю узкую категорию (Film Noir 🧐). Это фундаментальная проблема RAG-систем, корень которой в самом лоссе на обучении поисковых агентов. Для решения проблмы переформулируют задачу и делают так чтоб агент сам двигал эмбеддинги, оптимизируя свою же точность поиска.
Практический вывод №1: больше внимания действительно научным статьям. Их, в действительности, не так много.
В следующем посте - про остальные 90%, их ценность, которая видна только при чтении множества работ.