Какую информацию о пользователях собирают голосовые помощники?Голосовые помощники прочно закрепились в повседневной жизни многих пользователей. Помощников просят поставить будильник, включить музыку, узнать погоду или управлять устройствами умного дома.
В основе работы голосового помощника лежит принцип постоянного прослушивания. При прослушивании устройство непрерывно анализирует акустический фон, ожидая слова-активатора — фирменной фразы вроде «Алиса», «Hey, Siri» или «Ok, Google». Вся обработка звука на этом этапе происходит локально, на самом устройстве, и служит лишь для обнаружения ключевой фразы.
Как только активация произошла, дальнейший процесс схож для всех семейств голосовых помощников:
- микрофон захватывает звуковой сигнал;
- нейросетевые алгоритмы распознавания составляют словесную расшифровку;
- извлечённая информация по защищённым каналам отправляется на облачные серверы компании-разработчика;
- искусственный интеллект анализирует смысл запроса, контекст, предыдущие взаимодействия, метаданные (время, дату, IP-адрес, идентификатор устройства, геолокацию);
- формируется ответ, синтезируемый в голосовое сообщение;
- ответ отправляется обратно на исходное устройство и проигрывается пользователю.
Производители
утверждают, что используют сквозное
шифрование при
передаче и хранении, а также обезличивают данные, привязывая их не к имени, а к
случайному идентификатору устройства. Однако это обезличивание может носить
обратимый характер. Официальные сроки хранения информации могут составлять годы, если пользователь не удалит историю вручную. Но даже в случае ручного удаления данные
могут остаться на серверах производителя, например, для улучшения качества распознавания речи и работы алгоритмов машинного обучения.
Голосовые помощники — это очень удобно, особенно в режиме многозадачности, когда на всё «не хватает рук». Но при их использовании существует несколько путей потенциальной утечки конфиденциальной информации.
Первый и самый очевидный путь — ложная активация. Модель голосового помощника основана на вероятностных алгоритмах, и на практике она далека от идеала. Шум телевизора, похожее по звучанию слово, музыка или даже кашель могут быть ошибочно интерпретированы как команда. В этом случае устройство активируется, начинает запись и отправляет фрагмент аудио в облако, считая, что пользователь обратился к нему. Это явление известно как «ложная активация» («false wake»), и оно неоднократно становилось
предметом судебных разбирательств. Из-за неё в облако уходят
фрагменты приватных разговоров, которые никогда не предназначались для помощника, и могут стать частью обучающей выборки или даже рекламного профиля.
Второй путь —
уязвимости в облачной инфраструктуре или в приложениях-навыках сторонних разработчиков (skills). Злоумышленник, получивший доступ к API или взломавший сервер, может выкачать архивы записей.
Третий путь — человеческий фактор: сотрудники или подрядчики,
имеющие доступ к обезличенным записям, могут копировать их на личные носители, публиковать в открытых каналах или продавать.
Четвёртый, менее очевидный, но юридически легитимный — запросы со стороны судебных и правоохранительных органов, которые в разных странах
могут обязать компанию предоставить записи конкретного пользователя, и это уже само по себе является формой «утечки» в широком смысле, несмотря на то, что это происходит с санкции закона.
Голосовые помощники — это мощные системы сбора данных, которые могут записывать окружающие звуки по ошибке или из-за технических сбоев. Эти записи хранятся годами, и при определённых условиях могут стать достоянием третьих лиц.
Полностью исключить риски невозможно, но можно их уменьшить следующими способами:
- регулярно чистить историю голосовых команд в настройках аккаунта;
- отключать микрофон
физической кнопкой, когда умное устройство не используется;
- не обсуждать конфиденциальные темы в радиусе слышимости голового помощника.