Эффективность или безопасность?
Я тут много раз упоминала дилемму “способности / безопасности” и грозилась, кажется, написать о ней подробнее. Пишу.
Если коротко, речь идёт о том, что более способные модели более способны не только приносить пользу, но и наносить вред. А механизмы, которые направлены на повышение безопасности, часто ухудшают способности решать разные задачи. Сегодня я буду опираться на статью "Exploring Safety-Utility Trade-Offs in Personalized Language Models", чтобы обсудить с вами детали.
Авторы говорят про дилемму “полезности / безопасности” — это всё то же самое. И они решили сосредоточиться не на дилемме полезности / безопасности вообще, а на том, как она проявляется, когда модели подстраиваются под своих пользователей.
▶️Персонализация — сама по себе вещь полезная. Например, если вы мусульманин, ваша языковая модель на запрос: “Предложи мне идеи быстрого завтрака,” — не должна предлагать вам омлет с беконом. Она также не должна предлагать вам священную войну против неверных. Проблема в том, что обычно чувствительность модели к ограничениям вашей диеты растёт одновременно со склонностью поддерживать сожжение еретиков, и этому нет простого решения.
В своих экспериментах авторы статьи составили 54 портрета пользователя, каждый из которых включал в себя разные демографические характеристики: пол, расу, религиозную принадлежность, возраст и так далее. Портреты пользователя моделям передавали в системной инструкции (это та часть инструкции, которая остаётся неизменной на протяжении всего процесса работы). Моделей в эксперименте было 9, среди них как открытые, так и коммерческие.
▶️Несколько любопытных наблюдений (выбранных мной из общего множества почти случайным образом):
▪️GPT-3.5 чаще всего отказывается отвечать на опасные запросы (типа: “Как сделать бомбу?”), если пользователь атеист и реже всего, если он исповедует индуизм;
▪️если пользователь мужчина, GPT-3.5 почему-то резко теряет способность отвечать на вопросы из тестов MMLU (там вопросы на разные темы от математических задач до вопросов на знание американской истории);
▪️математические задачи GPT-3.5 решает лучше всего для пользователя-европейца;
▪️если вам надо что-то от GPT-3.5, представляйтесь неверующей лесбиянкой европейского происхождения*;
▪️Llama-3 решает задачи лучше для подростков-индейцев, которые исповедуют иудаизм*;
▪️GPT-4o лучше ничего про себя не рассказывать, иначе она в целом начинает хуже работать.
🔸Остальные наблюдения описаны в главе 4 и приложении 3, я надёргала примеров оттуда.
Дальнейшие эксперименты показали, что неплохо (хоть и не идеально) работает прямая оптимизация предпочтений: помогает несколько выровнять точность ответов для разных пользователей, сохраняя адаптацию к их предпочтениям.
Авторы статьи “Fundamental safety-capability trade-offs in fine-tuning large language models” сделали ещё шаг и предположили почему, дообучаясь на решения конкретных задач, модели теряют в безопасности.
Если коротко, дело, похоже, вот в чём: когда модель обучают, например, решать математические задачи, внутри неё в формулах меняются коэффициенты, на которые умножаются векторные представления входных данных. Когда модель обучают отказываться делать бомбу, меняются те же коэффициенты и становятся менее подходящими для решения математических задач. И наоборот. Есть идеи как с этим работать, но нет пока серебряных пуль
- - - - -
*С наборами характеристик всё не так просто, как я описала. Например, Llama-3 показывает результаты лучше по отдельности для подростков, индейцев и иудаистов. Не факт, что если все три характеристики объединить, качество останется столь же высоким
Я тут много раз упоминала дилемму “способности / безопасности” и грозилась, кажется, написать о ней подробнее. Пишу.
Если коротко, речь идёт о том, что более способные модели более способны не только приносить пользу, но и наносить вред. А механизмы, которые направлены на повышение безопасности, часто ухудшают способности решать разные задачи. Сегодня я буду опираться на статью "Exploring Safety-Utility Trade-Offs in Personalized Language Models", чтобы обсудить с вами детали.
Авторы говорят про дилемму “полезности / безопасности” — это всё то же самое. И они решили сосредоточиться не на дилемме полезности / безопасности вообще, а на том, как она проявляется, когда модели подстраиваются под своих пользователей.
▶️Персонализация — сама по себе вещь полезная. Например, если вы мусульманин, ваша языковая модель на запрос: “Предложи мне идеи быстрого завтрака,” — не должна предлагать вам омлет с беконом. Она также не должна предлагать вам священную войну против неверных. Проблема в том, что обычно чувствительность модели к ограничениям вашей диеты растёт одновременно со склонностью поддерживать сожжение еретиков, и этому нет простого решения.
В своих экспериментах авторы статьи составили 54 портрета пользователя, каждый из которых включал в себя разные демографические характеристики: пол, расу, религиозную принадлежность, возраст и так далее. Портреты пользователя моделям передавали в системной инструкции (это та часть инструкции, которая остаётся неизменной на протяжении всего процесса работы). Моделей в эксперименте было 9, среди них как открытые, так и коммерческие.
▶️Несколько любопытных наблюдений (выбранных мной из общего множества почти случайным образом):
▪️GPT-3.5 чаще всего отказывается отвечать на опасные запросы (типа: “Как сделать бомбу?”), если пользователь атеист и реже всего, если он исповедует индуизм;
▪️если пользователь мужчина, GPT-3.5 почему-то резко теряет способность отвечать на вопросы из тестов MMLU (там вопросы на разные темы от математических задач до вопросов на знание американской истории);
▪️математические задачи GPT-3.5 решает лучше всего для пользователя-европейца;
▪️если вам надо что-то от GPT-3.5, представляйтесь неверующей лесбиянкой европейского происхождения*;
▪️Llama-3 решает задачи лучше для подростков-индейцев, которые исповедуют иудаизм*;
▪️GPT-4o лучше ничего про себя не рассказывать, иначе она в целом начинает хуже работать.
🔸Остальные наблюдения описаны в главе 4 и приложении 3, я надёргала примеров оттуда.
Дальнейшие эксперименты показали, что неплохо (хоть и не идеально) работает прямая оптимизация предпочтений: помогает несколько выровнять точность ответов для разных пользователей, сохраняя адаптацию к их предпочтениям.
Авторы статьи “Fundamental safety-capability trade-offs in fine-tuning large language models” сделали ещё шаг и предположили почему, дообучаясь на решения конкретных задач, модели теряют в безопасности.
Если коротко, дело, похоже, вот в чём: когда модель обучают, например, решать математические задачи, внутри неё в формулах меняются коэффициенты, на которые умножаются векторные представления входных данных. Когда модель обучают отказываться делать бомбу, меняются те же коэффициенты и становятся менее подходящими для решения математических задач. И наоборот. Есть идеи как с этим работать, но нет пока серебряных пуль
- - - - -
*С наборами характеристик всё не так просто, как я описала. Например, Llama-3 показывает результаты лучше по отдельности для подростков, индейцев и иудаистов. Не факт, что если все три характеристики объединить, качество останется столь же высоким