Небольшой анекдот-история, чтобы задать правильный ритм на неделю. А кому и настроение поднять
Наблюдал я как-то следующую ситуацию. Была у компании умная модель. И ее через кастомизированные харнессы (system prompts + тулы + конеткст) адаптировали к разным прикладным доменам.
Одна из задач была помочь оптмизировать работу фиансовых аналитиков. Техническая команда быстро собрала агентскую обвязку и добавила разных профильных тулов. Среди прочих были и более классические: bash с файловой системой и web_search
Чтобы померить качество своего агента, команда взяля набор открытых публичных бенчмарков, которые пересекались с реальными приложениями хотя бы на уровне инструментов.
Сделали прогоны. На каждый бенчмарк по 5 попыток решить задачу - все честно и с стат значимостью. Бэйзлайны других агентов/моделей гонять не стали – взяли открытые цифры. Получалась SOTA! На каждом бенчмарке! Где-то 15%, где-то и все 30%. Кто следит за лабами, тот знает всю эту кухню бенчмаксинга.
Большие цифры никого не смущали. Был проделан быстрый human expert анализ траекторий агентов на небольшом подмножестве сэмплов из каждого бенчмарка. Все клеилось. Агент просто хорош.
Стали готовить презентации, рисовать те самые заветные bar charts, показывая в каком далеком космосе новый агент.
Но все-таки бывалых инженеров что-то насторожило. Проделали еще один инженерный анализ. Выяснилось, что один из инструментов, web_search, так мощно работал, что когда агент решал его использовать, то в выдаче регулярно оказывались ссылки на...исходники бенчмарков! либо на гитхаб репозиторий, либо на hugging face, либо куда-то еще. Бенчи то опенсоурсные и все ответы лежат в открытом доступе! Стоит добавить, что не каждый поисковый движок такой сильный, чтобы глубоко индексировать интернет
Обнаружить такое было и правда не тривиально (без некоторых проверок на уровне эвала), потому что модель по-умному читерила. Понимала, что нашла ответ, но якобы проверяла себя, сначала «честно» пытаясь решить задачу, используя все валидные инструменты, а при не удаче, просто копируя ответ. Так траектории получались достаточно реалистичными.
Презентации свернули. Продакты краснели от негодования. Молодые рисерчеры краснели еще сильнее. Бывалые соколы оправдывали свое призвание бывалых.
Баги устранили, определенные веб домены были добавлены в исключения, агенту в системном пропмтпе запретели лазить по некоторым сайтам, а в рубрики валидаторов добавили проверку на рассуждения. Эксперимент был перезапущен.
Цифры стали скромнее. SOTA испарилась. Но на некоторых бенчах результаты все равно радовали глаз.
Проверйте результаты, вставляйте все возможные проверки, чтобы отловить читерство.
Наблюдал я как-то следующую ситуацию. Была у компании умная модель. И ее через кастомизированные харнессы (system prompts + тулы + конеткст) адаптировали к разным прикладным доменам.
Одна из задач была помочь оптмизировать работу фиансовых аналитиков. Техническая команда быстро собрала агентскую обвязку и добавила разных профильных тулов. Среди прочих были и более классические: bash с файловой системой и web_search
Чтобы померить качество своего агента, команда взяля набор открытых публичных бенчмарков, которые пересекались с реальными приложениями хотя бы на уровне инструментов.
Сделали прогоны. На каждый бенчмарк по 5 попыток решить задачу - все честно и с стат значимостью. Бэйзлайны других агентов/моделей гонять не стали – взяли открытые цифры. Получалась SOTA! На каждом бенчмарке! Где-то 15%, где-то и все 30%. Кто следит за лабами, тот знает всю эту кухню бенчмаксинга.
Большие цифры никого не смущали. Был проделан быстрый human expert анализ траекторий агентов на небольшом подмножестве сэмплов из каждого бенчмарка. Все клеилось. Агент просто хорош.
Стали готовить презентации, рисовать те самые заветные bar charts, показывая в каком далеком космосе новый агент.
Но все-таки бывалых инженеров что-то насторожило. Проделали еще один инженерный анализ. Выяснилось, что один из инструментов, web_search, так мощно работал, что когда агент решал его использовать, то в выдаче регулярно оказывались ссылки на...исходники бенчмарков! либо на гитхаб репозиторий, либо на hugging face, либо куда-то еще. Бенчи то опенсоурсные и все ответы лежат в открытом доступе! Стоит добавить, что не каждый поисковый движок такой сильный, чтобы глубоко индексировать интернет
Обнаружить такое было и правда не тривиально (без некоторых проверок на уровне эвала), потому что модель по-умному читерила. Понимала, что нашла ответ, но якобы проверяла себя, сначала «честно» пытаясь решить задачу, используя все валидные инструменты, а при не удаче, просто копируя ответ. Так траектории получались достаточно реалистичными.
Презентации свернули. Продакты краснели от негодования. Молодые рисерчеры краснели еще сильнее. Бывалые соколы оправдывали свое призвание бывалых.
Баги устранили, определенные веб домены были добавлены в исключения, агенту в системном пропмтпе запретели лазить по некоторым сайтам, а в рубрики валидаторов добавили проверку на рассуждения. Эксперимент был перезапущен.
Цифры стали скромнее. SOTA испарилась. Но на некоторых бенчах результаты все равно радовали глаз.
Проверйте результаты, вставляйте все возможные проверки, чтобы отловить читерство.