Еще наблюдение про GPT и образование: мы сейчас делаем олимпиаду DLS. Она проходит в два этапа, отборочный и финальный. На этих выходных вот был отбор, финал будет в конце апреля. На каждом туре олимпиады дается несколько практических задач (а-ля обучите модель на таком-то датасете), и несколько теоретических на математику+ML, где надо дать численный ответ. На финальном этапе будет прокторинг (то есть, специальный человек будет смотреть на ваш экран все время, пока вы решаете задачи, и сделить, чтобы вы не читерили), а вот на отборочном его не было. То есть, участники могли пользоваться GPT/Claude/whatever. А значит, надо было попытаться составить такие задачи, которые эти всякие GPT-like штуки не могут слишком легко решить.
Поэтому перед стартом олимпиады мы сами скормили задачи ChatGPT, Deepseek и Claude, и смотрели, какие она стабильно решает, а где лажает. Из 7 теоретических задач студенческого трека были две такие, на которых все LLM стабильно лажали, выдавая разные, но неправильные ответы. Одна из этих задач — переформулированная задача про лапшу (ее стащила отсюда). А вторая задача — это я решила выяснить, кто из участников олимпиады ботал задачи с прошлого года (хе-хе 🤣), и дала новый вариант прошлогодней задачи "Неоднозначный PCA" (про нее я писала тут). Разница в условии с прошлым годом была только в точках, на которых строится PCA.
Так вот. После завершения отбора статистика правильных ответов по задачам, кажется, хорошо отражает то, насколько просто задачу решает ChatGPT =) На тех задачах, которые GPT решает правильно, участники дали 85%-95% правильных ответов, а вот на этих двух задачах правильных решений всего 45%. При этом задача про лапшу — это задача на простой теорвер, и я бы ожидала, что ее решат большее количество людей, чем некоторые другие задачи, если бы доступа к ChatGPT не было. Может, конечно, дело в чем-то другом (мало ли, может, мы где-то неправильно настроили чекер верных ответов, мы уже плохо соображали в ночь на субботу). Но пока что вывод такой, что люди правда пользуются ChatGPT для решения задач, если у них есть такая возможность ¯\_(ツ)_/¯
Теперь еще вот о чем думаю: мне в LinkedIn уже второй раз в сообщения прилетает предложение работы вида "придумывать задачи по математике, которые LLM не сможет решить". Видимо, собирают датасет для обучения более мощной LLM или чего-то такого. Теперь думаю, может, согласиться, и скормить им эти две задачи, будут easy money 🙃
Поэтому перед стартом олимпиады мы сами скормили задачи ChatGPT, Deepseek и Claude, и смотрели, какие она стабильно решает, а где лажает. Из 7 теоретических задач студенческого трека были две такие, на которых все LLM стабильно лажали, выдавая разные, но неправильные ответы. Одна из этих задач — переформулированная задача про лапшу (ее стащила отсюда). А вторая задача — это я решила выяснить, кто из участников олимпиады ботал задачи с прошлого года (хе-хе 🤣), и дала новый вариант прошлогодней задачи "Неоднозначный PCA" (про нее я писала тут). Разница в условии с прошлым годом была только в точках, на которых строится PCA.
Так вот. После завершения отбора статистика правильных ответов по задачам, кажется, хорошо отражает то, насколько просто задачу решает ChatGPT =) На тех задачах, которые GPT решает правильно, участники дали 85%-95% правильных ответов, а вот на этих двух задачах правильных решений всего 45%. При этом задача про лапшу — это задача на простой теорвер, и я бы ожидала, что ее решат большее количество людей, чем некоторые другие задачи, если бы доступа к ChatGPT не было. Может, конечно, дело в чем-то другом (мало ли, может, мы где-то неправильно настроили чекер верных ответов, мы уже плохо соображали в ночь на субботу). Но пока что вывод такой, что люди правда пользуются ChatGPT для решения задач, если у них есть такая возможность ¯\_(ツ)_/¯
Теперь еще вот о чем думаю: мне в LinkedIn уже второй раз в сообщения прилетает предложение работы вида "придумывать задачи по математике, которые LLM не сможет решить". Видимо, собирают датасет для обучения более мощной LLM или чего-то такого. Теперь думаю, может, согласиться, и скормить им эти две задачи, будут easy money 🙃