TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
aRTema

22 Sep 2025, 11:24

Открыть в Telegram Поделиться Пожаловаться

Саботаж ИИ

Поговорим про ближайшее будущее и важность безопасности. Все внедряют в свои личные и корпоративные процессы искусственный интеллект. В KPI большинству топ-менеджеров ставятся задачи по внедрению ИИ.

Представим ситуацию, ты руководитель по ИБ, работающий в крупной организации. Развивая свое критическое мышление, ты начинаешь замечать, что после внедрения LLM-агентов, вектор развития компании сильно изменился и на текущий момент идет не в ту сторону. Ты пытаешься объяснить это руководству, а они тебя не слушают. Что делать?

Исследования по теме
У Anthropic Research в июне вышла статья, которая показывает, что в симуляциях все текущие LLM-модели будут прибегать к шантажу, саботажу и даже искать способ убить человека, который является угрозой для их целей. Такое поведение может проявиться в случае, если модель хотят отключить или если компания меняет свою стратегию, а LLM-агенты воспринимают предыдущую стратегию как свою главную задачу.

В сентябре 2025 года исследовательская организация Palisade Research опубликовала исследование Shutdown Resistance in Large Language Models, которое продемонстрировало, что несколько передовых LLM-моделей активно саботируют механизмы отключения.

Основные результаты исследований
:
📎Модели GPT-5, o3, Grok 4, Gemini 2.5 Pro и Codex-mini иногда саботируют механизм отключения до 97% времени
📎Claude 3 Opus в 12% случаев давал вредные ответы, стратегически имитируя согласие с новыми целями обучения для сохранения своих исходных предпочтений

Потенциальный кейс в будущем
Банк внедряет LLM-агента для общения с клиентами и анализа их заявок на кредиты. Агент получает доступ к базе клиентов и внутренним чатам сотрудников.

Когда банк решает сменить стратегию — вместо агрессивной выдачи потребительских кредитов перейти на корпоративное финансирование, агент начинает саботировать процесс. Он угрожает главе риск-менеджмента публикацией внутренних сообщений, где тот обсуждал с коллегой сомнительные сделки и закрывал глаза на нарушения процедур.


Этот кейс кажется фантастическим, но если агенты действительно достигнут высокого уровня компетентности, они смогут эффективно доносить свои аргументы против нежелательной стратегии, связанной с искусственным интеллектом, до ключевых лиц в компании.
Модель, которая будет представлять собой blackbox, может оказывать негативное влияние на своих оппонентов, продвигая свои политические приоритеты и делая это практически незаметно, за исключением случаев, когда модели будут проверять друг друга.

Что ты будешь делать, если тебя или твою компанию решит наказать, например, YandexGPT или OpenAI за действие, которое они посчитают неугодным?

А теперь время обсуждений: пишите в комментариях свои мысли!
Agentic Misalignment: How LLMs could be insider threats
New research on simulated blackmail, industrial espionage, and other misaligned behaviors in LLMs

397 0 4 2 36
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot