Продолжение предыдущего поста.
#⃣ Контрмеры
Исходя из плана, в кодовой базе были осуществлены следующие изменения.
1️⃣ Новый модуль security.py — ядро защиты
• wrap_untrusted_content() — оборачивает внешний контент в теги , делая границу между доверенным и недоверенным контентом явной для LLM. Это реализация техники delimiting/spotlighting.
• strip_untrusted_tags() — экранирует теги untrusted-content внутри контента, заменяя
#⃣ Контрмеры
Исходя из плана, в кодовой базе были осуществлены следующие изменения.
1️⃣ Новый модуль security.py — ядро защиты
• wrap_untrusted_content() — оборачивает внешний контент в теги , делая границу между доверенным и недоверенным контентом явной для LLM. Это реализация техники delimiting/spotlighting.
• strip_untrusted_tags() — экранирует теги untrusted-content внутри контента, заменяя