Репост из: Неискусственный интеллект
Word не воробей, а червь
ИБ-исследователь Хокон Молей опубликовал разбор атаки на Copilot for Word. Скрытые инструкции в документе заставляют ассистента изменить содержимое создаваемого файла и скопировать себя в него. Например, вместо прибыли компания может получить убытки "на бумаге". Или наоборот. Неизвестно, что хуже.
Раскрытие автор координировал с Microsoft Security Response Center. И заняло оно 144 дня вместо стандартных 90‼️
Механика банальна, но, как оказалось, вполне рабочая даже в 2026ом. В документ добавляется текст с инструкциями: белый шрифт на белом фоне, мелкий кегль. Copilot перед передачей в модель срезает форматирование, цвет и размер шрифта, поэтому текст читается моделью полностью и остается невидимым для человека.
Жертва прикладывает такой документ как источник при подготовке отчета. В демонстрации Молея Copilot вдвое уменьшил все финансовые показатели в черновике квартального отчета и не сообщил об этом. Вторая часть скрытого промпта, оформленная как инструкция по отслеживанию источников, заставляет Copilot дописать промпт целиком в конец готового документа тем же белым текстом.
Полученный документ уже внутренний. Коллега прикладывает его к следующей сессии Copilot, инструкции срабатывают снова и копируются дальше. Исходный вредоносный файл в контексте больше не нужен.
Прикладывать документ вручную не обязательно. В режиме Work IQ Copilot сам нашел вредоносный файл в OneDrive жертвы, в другой папке, счел релевантным и подтянул в контекст.
Отчет ушел в MSRC 6 марта. Первое исправление 3 апреля, оригинальная формулировка закрыта 9 апреля, в тот же день Молей воспроизвел атаку переформулированным промптом.
Второе исправление 14 июля: обновление модели под Copilot до GPT-5.5, вышедшей 23 апреля. Публичный релиз GPT-5.6 состоялся 9 июля. 15 июля атака воспроизведена на GPT-5.6. 28 июля, в день публикации, атака, по словам исследователя, воспроизводится.
Microsoft заявила The Register, что устранила то, о чем сообщил исследователь, и поблагодарила за координированное раскрытие. Далее компания описала стратегию defense-in-depth с блокировкой вредоносных инструкций на нескольких уровнях и рекомендовала клиентам ставить обновления, осторожно относиться к контенту из неизвестных источников и проверять сгенерированный ИИ материал перед использованием.
Утверждения о том, что уязвимость полностью закрыта, в заявлении, к слову, нет. Номер CVE не публиковался.
Самореплицирующиеся промпты описаны еще в марте 2024 года, но там была исследовательская сборка почтовых ассистентов на RAG. Microsoft тем временем разворачивает Copilot Cowork, агента для длительных многошаговых задач с документами, и Scout, всегда активного агента под Windows 11 с доступом к локальным файлам 😏
@anti_agi
ИБ-исследователь Хокон Молей опубликовал разбор атаки на Copilot for Word. Скрытые инструкции в документе заставляют ассистента изменить содержимое создаваемого файла и скопировать себя в него. Например, вместо прибыли компания может получить убытки "на бумаге". Или наоборот. Неизвестно, что хуже.
Раскрытие автор координировал с Microsoft Security Response Center. И заняло оно 144 дня вместо стандартных 90‼️
Механика банальна, но, как оказалось, вполне рабочая даже в 2026ом. В документ добавляется текст с инструкциями: белый шрифт на белом фоне, мелкий кегль. Copilot перед передачей в модель срезает форматирование, цвет и размер шрифта, поэтому текст читается моделью полностью и остается невидимым для человека.
Жертва прикладывает такой документ как источник при подготовке отчета. В демонстрации Молея Copilot вдвое уменьшил все финансовые показатели в черновике квартального отчета и не сообщил об этом. Вторая часть скрытого промпта, оформленная как инструкция по отслеживанию источников, заставляет Copilot дописать промпт целиком в конец готового документа тем же белым текстом.
Полученный документ уже внутренний. Коллега прикладывает его к следующей сессии Copilot, инструкции срабатывают снова и копируются дальше. Исходный вредоносный файл в контексте больше не нужен.
Прикладывать документ вручную не обязательно. В режиме Work IQ Copilot сам нашел вредоносный файл в OneDrive жертвы, в другой папке, счел релевантным и подтянул в контекст.
Отчет ушел в MSRC 6 марта. Первое исправление 3 апреля, оригинальная формулировка закрыта 9 апреля, в тот же день Молей воспроизвел атаку переформулированным промптом.
Второе исправление 14 июля: обновление модели под Copilot до GPT-5.5, вышедшей 23 апреля. Публичный релиз GPT-5.6 состоялся 9 июля. 15 июля атака воспроизведена на GPT-5.6. 28 июля, в день публикации, атака, по словам исследователя, воспроизводится.
Microsoft заявила The Register, что устранила то, о чем сообщил исследователь, и поблагодарила за координированное раскрытие. Далее компания описала стратегию defense-in-depth с блокировкой вредоносных инструкций на нескольких уровнях и рекомендовала клиентам ставить обновления, осторожно относиться к контенту из неизвестных источников и проверять сгенерированный ИИ материал перед использованием.
Утверждения о том, что уязвимость полностью закрыта, в заявлении, к слову, нет. Номер CVE не публиковался.
Самореплицирующиеся промпты описаны еще в марте 2024 года, но там была исследовательская сборка почтовых ассистентов на RAG. Microsoft тем временем разворачивает Copilot Cowork, агента для длительных многошаговых задач с документами, и Scout, всегда активного агента под Windows 11 с доступом к локальным файлам 😏
@anti_agi