Как использовать хайповый JEV - исследование
важна была экономия времени и денег на задачах, когда одна модель должна оценить ответ другой, т.к GPT-6 в роли судьи обходилась в 12 тыс.$ за миллион оценок
Совместная работа JEV и GPT-6 в роли судей
Например: В документе написано: «Музей закрыт по понедельникам», а модель советует посетить его в понедельник. JEV получает оба текста и должен определить, есть ли противоречие
По точности примерно в середине среди проверенных моделей, на некоторых задачах в 277 раз дешевле GPT-6 и обычно отвечал за доли секунды
🔑 у JEV уверенность - это важный сигнал правильности, промахи чаще встречались там, где вероятность выбранного вердикта была невысокой. Среди уверенных решений JEV был гораздо ближе к GPT-6.
Поэтому грамотная работа с ним выстроена вокруг принципа "принимай, когда уверен, передавай дальше, когда сомневаешься". JEV смотрит на задачу первым. Если его уверенность выше заранее выбранного порога (в исследовании порог выше 90%), система принимает вердикт. Если ниже, то передается сильной модели
Где-то даже связка JEV и GPT-6 оказалась немного точнее одной GPT-6 и сократила расходы почти на 60%. Но в этой выборке преобладали задачи обычного сравнения ответов, где JEV уже справлялся хорошо
На заметку: 😁Обмануть JEV можно как и человека - убедительный стиль: когда неправильный ответ написан красиво и подробно, легче принимает его за лучший
Из личного опыта: мне Jev часто возвращал уверенность в районе 45% и поэтому требовалась проверка сильной модели. В результате только 6 решений были выполнены им самостоятельно, а остальные 26 - переданы GPT на проверку. Но из переданных и перепроверенных 80% были выполнены им правильно. Причем не использовала никаких инструкций, как авторы, а только передавала легкие задачки
и тут еще можно прочитать о личном опыте использования https://t.me/AiHubFeed/397
—-
важна была экономия времени и денег на задачах, когда одна модель должна оценить ответ другой, т.к GPT-6 в роли судьи обходилась в 12 тыс.$ за миллион оценок
Совместная работа JEV и GPT-6 в роли судей
JEV получает инструкцию, данные для проверки и допустимые варианты решения. В ответ возвращает выбранный вариант и вероятности, без текста с объяснением. Как на тестировании, когда ученик обводит ответ, не показывая ход решения
Например: В документе написано: «Музей закрыт по понедельникам», а модель советует посетить его в понедельник. JEV получает оба текста и должен определить, есть ли противоречие
По точности примерно в середине среди проверенных моделей, на некоторых задачах в 277 раз дешевле GPT-6 и обычно отвечал за доли секунды
🔑 у JEV уверенность - это важный сигнал правильности, промахи чаще встречались там, где вероятность выбранного вердикта была невысокой. Среди уверенных решений JEV был гораздо ближе к GPT-6.
Поэтому грамотная работа с ним выстроена вокруг принципа "принимай, когда уверен, передавай дальше, когда сомневаешься". JEV смотрит на задачу первым. Если его уверенность выше заранее выбранного порога (в исследовании порог выше 90%), система принимает вердикт. Если ниже, то передается сильной модели
Где-то даже связка JEV и GPT-6 оказалась немного точнее одной GPT-6 и сократила расходы почти на 60%. Но в этой выборке преобладали задачи обычного сравнения ответов, где JEV уже справлялся хорошо
На заметку: 😁Обмануть JEV можно как и человека - убедительный стиль: когда неправильный ответ написан красиво и подробно, легче принимает его за лучший
Из личного опыта: мне Jev часто возвращал уверенность в районе 45% и поэтому требовалась проверка сильной модели. В результате только 6 решений были выполнены им самостоятельно, а остальные 26 - переданы GPT на проверку. Но из переданных и перепроверенных 80% были выполнены им правильно. Причем не использовала никаких инструкций, как авторы, а только передавала легкие задачки
и тут еще можно прочитать о личном опыте использования https://t.me/AiHubFeed/397
—-