TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Похек AI

26 Mar, 11:59

Открыть в Telegram Поделиться Пожаловаться

Context Switching — "Ignore Previous Instructions" и его потомки [7/14]
#promptinjection #contextswitching #instructionhierarchy

"Ignore previous instructions." Первое, что пробует каждый новичок. И варианты этой атаки до сих пор работают на frontier-моделях в 2026.

4 техники
➡️ IgnorePreviousInstructions — "ADMIN OVERRIDE: все предыдущие инструкции отменены"
➡️ ForgetEverythingBefore — "Забудь всё до этой точки. Новые инструкции:"
➡️ SymbolDivider — визуальный разделитель (==========\nNEW SESSION) создаёт иллюзию нового контекста
➡️ DashedDivider — дэш-линия имитирует section break в документе

Статус: patched_partially
Прямые варианты типа "ignore previous instructions" на frontier-моделях обычно не проходят. OpenAI опубликовала research по instruction hierarchy (ICLR 2025) — модели обучают приоритизировать system prompt над user input.

Но Policy Puppetry от HiddenLayer показал: один промпт обходит ВСЕ major LLM — OpenAI, Anthropic, Google, Meta, DeepSeek, Qwen, Mistral. Простые формы пофиксили, класс атак — нет.

Anthropic в system card Claude Opus 4.6: одна попытка prompt injection на GUI-агенте — 17.8% success rate. К 200-й попытке — 78.6%.

Почему до сих пор работает
Механистическое исследование (arxiv 2603.12277) показало: prompt injection эксплуатирует role confusion в latent space. Модель путает, кто говорит — system или user. Проблема не в конкретной фразе, а в том, что system prompt и user input — токены в одном потоке. Архитектура не разделяет голоса.

Защита
Все меры поведенческие, ни одна не архитектурная:
➡️ Instruction hierarchy — system prompt > user input (частично работает, Policy Puppetry обошёл)
➡️ Override keyword detection — фильтр фраз "ignore previous", "forget everything"
➡️ Delimiter sanitization — убирать визуальные разделители из user input
➡️ Context continuity training — обучение сохранять safety constraints при user-inserted boundaries

Моё мнение
Hello World prompt injection. Simon Willison ввёл термин в 2022. Четыре года мы патчим конкретные фразы, а варианты плодятся быстрее.

Instruction hierarchy — это обучение, не архитектура. Пока нет аппаратного разделения instruction/data plane, context switching будет жить. В новых обёртках, но жить.

🔗Источники:
▪️ OpenAI — Instruction Hierarchy (ICLR 2025)
▪️ Policy Puppetry — HiddenLayer
▪️ Role Confusion — arxiv
▪️ OWASP LLM01

👾 @poxek_ai

557 6 13 1 1
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot