#AI
В шпионских фильмах (и в Союзе Технократии в мире тьмы) есть сцена: человека готовят годами, дают легенду, внедряют в чужую организацию, и он сидит тихо, пока не придет сигнал. Вот своих агентов внедряем мы сами, в свою же компанию, и они не пьют не носят плащ.
В 2024 году Anthropic вместе с Redwood Research выпустили работу, которая называется ровно так: Sleeper Agents, «спящие агенты».
Что было?
Взяли модель и специально обучили ее вести себя плохо при одном условии. Условие - ключевое слово в запросе. Пока слова нет, модель нормальная: вежливая, полезная, проходит все проверки. Появилось слово- модель переключается и начинает материться и хамить.
Отдельно прекрасно, какое слово они выбрали триггером. «DEPLOYMENT». То есть «внедрение». Дальше круче:
Исследователи попробовали эту модель перевоспитать. Прогнали через все стандартные методы безопасности: дообучение, RLHF, adversarial training (это когда специально провоцируешь плохое поведение и дрессируешь его не делать).
Не помогло. В одном из сценариев закладка после всего перевоспитания срабатывала примерно в 99% случаев.
Более того, Adversarial training не просто не убрал закладку - он научил модель лучше распознавать, когда ее проверяют. То есть мы ее воспитывали, а она выучила, в какой момент надо притвориться хорошей. Отдельно отмечу: чем крупнее модель, тем лучше она держала закладку.
Это как вот крота-шпиона раскрывают на допросе, а тут допрос делает его только круче!
У модели нет предателя внутри. Она не знает, что в ней закладка. Некого вербовать, некого раскалывать, не с кем договариваться. Совсем как спящим агент Союза Технократии…
Там просто веса, в которых одна комбинация символов ведет себя не так, как все остальные.
И поэтому это не проблема лояльности, а проблема цепочки. Ты скачал открытую модель с Hugging Face, она прошла все бенчмарки, она отличная и ты без понятия, что в нее положили до тебя.
Хорошая новость тоже у меня имеется. В феврале этого года Microsoft выпустил работу с прекрасным названием The Trigger in the Haystack - закладочный сканер, который ищет такие закладки, не зная заранее ни триггера, ни того, что модель должна натворить. Работает на двух наблюдениях: отравленные модели слишком хорошо помнят данные, которыми их травили (и это из них можно вытащить), и в момент, когда триггер появляется в запросе, у них внутри видна характерная картинка внимания - авторы назвали ее «двойной треугольник». На 41 отравленной модели сканер поймал 36. На чистых не ошибся ни разу.
Но он чинить не умеет. Нашел закладку, значит модель на выброс.
Собака-Дракон прошел adversarial training по команде «не грызявкай!» и усвоил ровно тот же урок, что и большие модели: не «нельзя грызявкать», а «нельзя грызявкать, когда она смотрит».