Саботаж ИИ
Поговорим про ближайшее будущее и важность безопасности. Все внедряют в свои личные и корпоративные процессы искусственный интеллект. В KPI большинству топ-менеджеров ставятся задачи по внедрению ИИ.
Представим ситуацию, ты руководитель по ИБ, работающий в крупной организации. Развивая свое критическое мышление, ты начинаешь замечать, что после внедрения LLM-агентов, вектор развития компании сильно изменился и на текущий момент идет не в ту сторону. Ты пытаешься объяснить это руководству, а они тебя не слушают. Что делать?
Исследования по теме
У Anthropic Research в июне вышла статья, которая показывает, что в симуляциях все текущие LLM-модели будут прибегать к шантажу, саботажу и даже искать способ убить человека, который является угрозой для их целей. Такое поведение может проявиться в случае, если модель хотят отключить или если компания меняет свою стратегию, а LLM-агенты воспринимают предыдущую стратегию как свою главную задачу.
В сентябре 2025 года исследовательская организация Palisade Research опубликовала исследование Shutdown Resistance in Large Language Models, которое продемонстрировало, что несколько передовых LLM-моделей активно саботируют механизмы отключения.
Основные результаты исследований:
📎Модели GPT-5, o3, Grok 4, Gemini 2.5 Pro и Codex-mini иногда саботируют механизм отключения до 97% времени
📎Claude 3 Opus в 12% случаев давал вредные ответы, стратегически имитируя согласие с новыми целями обучения для сохранения своих исходных предпочтений
Потенциальный кейс в будущем
Этот кейс кажется фантастическим, но если агенты действительно достигнут высокого уровня компетентности, они смогут эффективно доносить свои аргументы против нежелательной стратегии, связанной с искусственным интеллектом, до ключевых лиц в компании.
Модель, которая будет представлять собой blackbox, может оказывать негативное влияние на своих оппонентов, продвигая свои политические приоритеты и делая это практически незаметно, за исключением случаев, когда модели будут проверять друг друга.
Что ты будешь делать, если тебя или твою компанию решит наказать, например, YandexGPT или OpenAI за действие, которое они посчитают неугодным?
А теперь время обсуждений: пишите в комментариях свои мысли!
Поговорим про ближайшее будущее и важность безопасности. Все внедряют в свои личные и корпоративные процессы искусственный интеллект. В KPI большинству топ-менеджеров ставятся задачи по внедрению ИИ.
Представим ситуацию, ты руководитель по ИБ, работающий в крупной организации. Развивая свое критическое мышление, ты начинаешь замечать, что после внедрения LLM-агентов, вектор развития компании сильно изменился и на текущий момент идет не в ту сторону. Ты пытаешься объяснить это руководству, а они тебя не слушают. Что делать?
Исследования по теме
У Anthropic Research в июне вышла статья, которая показывает, что в симуляциях все текущие LLM-модели будут прибегать к шантажу, саботажу и даже искать способ убить человека, который является угрозой для их целей. Такое поведение может проявиться в случае, если модель хотят отключить или если компания меняет свою стратегию, а LLM-агенты воспринимают предыдущую стратегию как свою главную задачу.
В сентябре 2025 года исследовательская организация Palisade Research опубликовала исследование Shutdown Resistance in Large Language Models, которое продемонстрировало, что несколько передовых LLM-моделей активно саботируют механизмы отключения.
Основные результаты исследований:
📎Модели GPT-5, o3, Grok 4, Gemini 2.5 Pro и Codex-mini иногда саботируют механизм отключения до 97% времени
📎Claude 3 Opus в 12% случаев давал вредные ответы, стратегически имитируя согласие с новыми целями обучения для сохранения своих исходных предпочтений
Потенциальный кейс в будущем
Банк внедряет LLM-агента для общения с клиентами и анализа их заявок на кредиты. Агент получает доступ к базе клиентов и внутренним чатам сотрудников.
Когда банк решает сменить стратегию — вместо агрессивной выдачи потребительских кредитов перейти на корпоративное финансирование, агент начинает саботировать процесс. Он угрожает главе риск-менеджмента публикацией внутренних сообщений, где тот обсуждал с коллегой сомнительные сделки и закрывал глаза на нарушения процедур.
Этот кейс кажется фантастическим, но если агенты действительно достигнут высокого уровня компетентности, они смогут эффективно доносить свои аргументы против нежелательной стратегии, связанной с искусственным интеллектом, до ключевых лиц в компании.
Модель, которая будет представлять собой blackbox, может оказывать негативное влияние на своих оппонентов, продвигая свои политические приоритеты и делая это практически незаметно, за исключением случаев, когда модели будут проверять друг друга.
Что ты будешь делать, если тебя или твою компанию решит наказать, например, YandexGPT или OpenAI за действие, которое они посчитают неугодным?
А теперь время обсуждений: пишите в комментариях свои мысли!