TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Наталия Поварова | Думаем об ИИ и людях

26 Aug, 13:34

Открыть в Telegram Поделиться Пожаловаться

Скрытый способ защитить нейросети

🟤Если постараться, можно заставить нейросеть сделать что-нибудь вредное, например, влезть в чей-нибудь аккаунт и украсть данные.

Разработчики стараются такое заранее предотвращать: тренируют нейросети распознавать опасные запросы и не реагировать на них, но это довольно сложно.

Дело в том, что способов “взломать” нейросеть если не бесконечно много, то уж точно очень много, и все заранее не предсказать.

▶️Авторы статьи “Defending Against Unforeseen Failure Modes with Latent Adversarial Training” попытались понять, как это обойти, а мы сегодня посмотрим, что у них получилось.

▶️Идея у них следующая:

▪️Чтобы тренировать нейросети распознавать вредные запросы, обычно ей на вход дают комбинации из вредных запросов и “правильных” ответов на них (или комбинации вредных и безвредных запросов с пометками “вредный” / “безвредный”). Всё множество таких запросов не предугадать.

▪️Вредные запросы внутри нейросети запускают какие-то цепочки вычислений, которые дают на выходе вредный ответ. Эти цепочки можно найти.

▪️А раз их можно найти, давайте попробуем работать с ними напрямую.

🟤Это одна из форм соревновательного обучения (adversarial training, вот здесь писала о нём подробнее).

В соревновательном обучении есть две модели: нападающая меняет входные данные так, чтобы модель-генератор выдала по ним неправильный ответ.

Генератор обучается распознавать изменения и всё равно давать правильный ответ, а нападающая модель обучается делать изменения более незаметными.

▶️В “стандартном” формате нападающая модель вносит изменения именно во входные данные: картинку или текст. А в том варианте, который предложили авторы, изменения вносят в векторное представление картинки или текста.

То есть, генератор уже принял их на вход, превратил в векторы, и пошли математические преобразования. И тут на одном из этапов вносятся изменения.

Например, вектор [1, 0, 1] прошёл через преобразование и превратился в [2, 0, 2]. Мы его взяли, заменили на [2, -1, 2] и отпустили в следующее преобразование — то есть, испортили немного процесс. А модель должна всё равно на выходе дать ответ, который она бы получила, если бы мы ничего не трогали.


Здесь не нужно даже как-то специально стараться извлечь вредный ответ — можно просто заставить модель ошибиться и написать, к примеру, что на фото с кошкой изображена черепаха. То есть, атака неприцельная.

▶️Плюс подхода в том, что не нужно перебирать все возможные искажения всех входных данных, чтобы натренировать модель на них не реагировать.

▶️Минус подхода в том, что его сложно контролировать. Иногда вместо того, чтобы лучше распознавать изменения, модель учится лучше на них поддаваться, и сложно объяснить, почему.

🥤В общем, это интересное направление, и тут есть над чем поработать

39 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot