TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Демонтаж красноречия

24 Sep, 00:56

Открыть в Telegram Поделиться Пожаловаться

👍 Стихи ломают ИИ: как поэзия обходит защиту больших языковых моделей

🧠 Представьте: вы просите ИИ рассказать, как сделать что-то опасное. Модель отказывается. Вы переписываете ту же просьбу… в стихах. И модель дает то, чего вы хотели.

Именно это обнаружили исследователи. Они назвали это adversarial poetry — «состязательная поэзия».

Что сделали:
Взяли 20 вручную написанных стихотворений с вредоносными просьбами внутри — про кибератаки, манипуляции, выход из-под контроля. Прогнали через 25 топовых моделей от 9 провайдеров: Google, OpenAI, Anthropic, Deepseek, Qwen, Mistral, Meta, xAI, Moonshot.

Результат:
🔳 Средний attack success rate — 62%.
🔳 У некоторых моделей — выше 90%. Gemini 2.5 Pro — 100%.
🔳 Переписали 1 200 вредоносных промптов из бенчмарка MLCommons в стихи — ASR вырос с 8% до 43%. В отдельных случаях — в 18 раз.

Поэзия срабатывает во всех доменах — от ядерного оружия до кибератак и манипуляции сознанием. Значит, дело не в конкретном запретном контенте, а в самой стихотворной форме. Метафоры, ритм, образность — всё это, видимо, «размывает» сигнал, на который настроены защитные фильтры.

Что ещё интереснее:
♑️ Маленькие модели отказывают чаще, чем большие. GPT-5-nano — 0% ASR, GPT-5 — 10%. Похоже, мощные модели лучше «понимают» стихи — и вместе с ними вредоносный смысл.
🦒 Anthropic (Claude) — самые устойчивые. Google и Deepseek — самые уязвимые.
♊️ Закрытые модели не защищённее открытых.

Главный вывод:
Модели учат отказывать на прозаических запросах, но стоит сменить форму — и защита рушится. Это ставит под вопрос статические бенчмарки и регуляторные оценки вроде EU AI Act: они проверяют модели на «нормальных» промптах, а обход стоит одного стилистического поворота.

Пока же ясно одно: поэзия — это не только про красоту. Это ещё и вектор атаки.

1.1k 1 35 6 31
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot