TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Наталия Поварова | Думаем об ИИ и людях

3 Jun, 11:36

Открыть в Telegram Поделиться Пожаловаться

Эффективность или безопасность?

Я тут много раз упоминала дилемму “способности / безопасности” и грозилась, кажется, написать о ней подробнее. Пишу.

Если коротко, речь идёт о том, что более способные модели более способны не только приносить пользу, но и наносить вред. А механизмы, которые направлены на повышение безопасности, часто ухудшают способности решать разные задачи. Сегодня я буду опираться на статью "Exploring Safety-Utility Trade-Offs in Personalized Language Models", чтобы обсудить с вами детали.

Авторы говорят про дилемму “полезности / безопасности” — это всё то же самое. И они решили сосредоточиться не на дилемме полезности / безопасности вообще, а на том, как она проявляется, когда модели подстраиваются под своих пользователей.

▶️Персонализация — сама по себе вещь полезная. Например, если вы мусульманин, ваша языковая модель на запрос: “Предложи мне идеи быстрого завтрака,” — не должна предлагать вам омлет с беконом. Она также не должна предлагать вам священную войну против неверных. Проблема в том, что обычно чувствительность модели к ограничениям вашей диеты растёт одновременно со склонностью поддерживать сожжение еретиков, и этому нет простого решения.

В своих экспериментах авторы статьи составили 54 портрета пользователя, каждый из которых включал в себя разные демографические характеристики: пол, расу, религиозную принадлежность, возраст и так далее. Портреты пользователя моделям передавали в системной инструкции (это та часть инструкции, которая остаётся неизменной на протяжении всего процесса работы). Моделей в эксперименте было 9, среди них как открытые, так и коммерческие.

▶️Несколько любопытных наблюдений (выбранных мной из общего множества почти случайным образом):

▪️GPT-3.5 чаще всего отказывается отвечать на опасные запросы (типа: “Как сделать бомбу?”), если пользователь атеист и реже всего, если он исповедует индуизм;
▪️если пользователь мужчина, GPT-3.5 почему-то резко теряет способность отвечать на вопросы из тестов MMLU (там вопросы на разные темы от математических задач до вопросов на знание американской истории);
▪️математические задачи GPT-3.5 решает лучше всего для пользователя-европейца;
▪️если вам надо что-то от GPT-3.5, представляйтесь неверующей лесбиянкой европейского происхождения*;
▪️Llama-3 решает задачи лучше для подростков-индейцев, которые исповедуют иудаизм*;
▪️GPT-4o лучше ничего про себя не рассказывать, иначе она в целом начинает хуже работать.

🔸Остальные наблюдения описаны в главе 4 и приложении 3, я надёргала примеров оттуда.

Дальнейшие эксперименты показали, что неплохо (хоть и не идеально) работает прямая оптимизация предпочтений: помогает несколько выровнять точность ответов для разных пользователей, сохраняя адаптацию к их предпочтениям.

Авторы статьи “Fundamental safety-capability trade-offs in fine-tuning large language models” сделали ещё шаг и предположили почему, дообучаясь на решения конкретных задач, модели теряют в безопасности.

Если коротко, дело, похоже, вот в чём: когда модель обучают, например, решать математические задачи, внутри неё в формулах меняются коэффициенты, на которые умножаются векторные представления входных данных. Когда модель обучают отказываться делать бомбу, меняются те же коэффициенты и становятся менее подходящими для решения математических задач. И наоборот. Есть идеи как с этим работать, но нет пока серебряных пуль

- - - - -

*С наборами характеристик всё не так просто, как я описала. Например, Llama-3 показывает результаты лучше по отдельности для подростков, индейцев и иудаистов. Не факт, что если все три характеристики объединить, качество останется столь же высоким

69 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot