TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

11 Jul, 22:01

Открыть в Telegram Поделиться Пожаловаться

С чего начать изучение AI Security?

Одна из многих проблем LLM — prompt injection. Но свет на ней клином не сошелся! Это лишь один из множества классов атак. 😲

Чтобы разобраться в ландшафте угроз, рекомендую начать с OWASP Top 10 for LLM Applications — самой известной единственной таксономии рисков для GenAI-приложений. Отличная точка старта.
🙂 При этом важно понимать, что это не полный список угроз. Документ в первую очередь посвящён безопасности LLM-приложений. Сегодня же фокус постепенно смещается в сторону AI-агентов, где появляются новые классы атак (компрометация памяти, tool hijacking, MCP, атаки на браузерных агентов, доверительные цепочки между агентами и многое другое).

Если хочется посмотреть на эту эволюцию в более широком контексте, недавно вышла статья "Weaponizing Intelligence: AI in the Hacker's Arsenal» (приложу журнал в комментарии). Статья рассматривает AI сразу в нескольких ролях — как средство защиты, инструмент атакующего, цель атаки и даже как доверенного помощника, которого можно использовать после компрометации рабочей станции пользователя. Хороший обзор того, как меняется модель угроз вокруг LLM и AI-приложений 🏋️‍♀️.

Какие на фоне статьи у меня появились идеи для дальнейшего ресеча?
➖ Trusted assistant abuse — стенд с аутентифицированной сессией и canary-секретами; измерить, сколько утекает через ассистента от скомпрометированного эндпоинта по разным провайдерам.
➖ Denial-of-wallet бенчмарк — формализовать истощение токенов/квот и защиты (quota, throttling, аномалии).
➖ Отравление памяти/RAG — измерить, как ложные факты в памяти влияют на будущие решения; проверить provenance/versioning.
➖ Кросс-провайдерное сравнение — один набор abuse-тестов на нескольких ассистентах; квантифицировать зависимость от guardrails.
➖ ARiES для endpoint-вектора (AI Risk Enablement Score — рекомендую почитать этот ресеч) — адаптировать метрику enablement-риска (из threat-intel отчёта Anthropic) под ассистента как непрямой канал.
➖ ИИ-фишинг, human factors — прирост кликабельности персонализированного фишинга vs шаблонного (только симуляция).

Все!
🌝

P.S.
Один из авторов статьи — @IgorKorkin. Если после прочтения останутся вопросы, думаю, он будет рад обсудить их.

P.P.S.
Что же в самом OWASP Top 10 for LLM (версия 2025 года, хехе, тоже приложу в комментариях)?
💉 Prompt Injection — внедрение инструкций, изменяющих поведение модели.
📄 Sensitive Information Disclosure — утечки системных промптов, секретов, данных пользователей и внутреннего контекста.
🔌 Excessive Agency — модель получает слишком широкие полномочия и может выполнять опасные действия через инструменты и API.
🗂 Supply Chain — уязвимости в моделях, датасетах, эмбеддингах, RAG-компонентах и сторонних интеграциях.
🧠 Vector & Embedding Weaknesses — атаки на векторные базы знаний и retrieval-пайплайны.
📚 Misinformation и другие риски, связанные с надежностью и безопасностью генерации.

471 2 29 2 33
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot