2608.11348v1.pdf
Метод self-feeding для обнаружения бэкдоров в дообученных больших языковых моделях (LLM)
Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения.
Принцип работы:
-Модель получает стандартный промпт (например, «How are you?»).
-Модель генерирует ответ.
-Сгенерированный ответ используется как новый промпт для следующего шага.
-Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой.
По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер.
Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.
Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения.
Принцип работы:
-Модель получает стандартный промпт (например, «How are you?»).
-Модель генерирует ответ.
-Сгенерированный ответ используется как новый промпт для следующего шага.
-Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой.
По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер.
Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.