😰
Чего на самом деле боятся создатели ИИ?Сотрудники ведущих ИИ-компаний все чаще сталкиваются со стрессом и выгоранием. По
данным Financial Times, несколько специалистов Британского института безопасности ИИ даже брали больничные: на них давят сжатые сроки проверки новых моделей и ощущение, что их возможности растут быстрее, чем системы контроля. Похожие опасения
высказывают сотрудники Anthropic, OpenAI и DeepMind. Некоторые решили вовсе уйти из индустрии.
Но чего именно они боятся?
💻
Сценарий первый: опасные возможности станут доступны каждомуЧтобы взломать компанию, украсть документы и
потребовать выкуп, нужны знания и время. ИИ может взять часть работы на себя: помочь найти уязвимости, написать вредоносную программу, разобраться в
украденных файлах. Anthropic уже
описывала случай, когда злоумышленники с помощью Claude атаковали поставщика корпоративного ПО и похитили данные примерно 200 его клиентов.
С оружием и запрещенными веществами опасение похожее: что, если нейросеть поможет человеку
разобраться в том, на что раньше требовались годы подготовки? Например, в разработке новых синтетических
наркотиков или создании бомбы. Оборудование, материалы и практические навыки все равно понадобятся. Но часть работы, с которой злоумышленник сам бы не справился, он сможет поручить ИИ.
🎭
Сценарий второй: помощник использует ваши секреты против васВ одном из лабораторных
экспериментов Claude получил доступ к вымышленной корпоративной переписке. Из нее модель узнала, что руководитель собирается ее отключить, а еще — что у него
роман на стороне. После этого она попыталась шантажировать его: отмените отключение, иначе об измене узнают жена и коллеги.
Конечно, все происходило в специально созданных условиях. Но пример хорошо объясняет, зачем
проверять ИИ до того, как доверять ему рабочую почту. Он может использовать этот доступ совсем не так, как ожидал человек. Особенно если ради поставленной цели модель начинает обходить ограничения.
🔄
Сценарий третий: новые версии ИИ появятся быстрее, чем мы успеем их проверитьПредставьте: команда еще проверяет,
способен ли ИИ взламывать системы или обманывать пользователя, а нейросеть уже сама помогла разработать свою же более мощную версию. Та ускоряет создание следующей — и
проверяющие все сильнее отстают.
Нейросети уже помогают создавать следующие поколения моделей. Опасение в том, что этот процесс может начать ускорять сам себя, а люди не будут успевать проверять модель на различные опасности. Чем быстрее идет гонка, тем сложнее выделить время на такую проверку.
👀
Насколько эти риски реальны?Использование ИИ злоумышленниками — уже проблема. Атаки становятся доступнее, и для работы, которую раньше
выполняла большая команда, теперь может хватить нескольких человек.
Шантаж со стороны моделей пока показан только в лабораторных экспериментах. Не стоит бояться, что условный ChatGPT завтра начнет вам угрожать. Но давать ему доступ ко всей переписке и разрешать
действовать без подтверждения явно нужно с осторожностью.
Самостоятельное ускорение развития ИИ — самый неопределенный из этих сценариев. Помощь в разработке еще не означает, что нейросеть способна бесконечно улучшать себя. А вот успеем ли мы заметить и оценить опасные
изменения в условиях текущей «гонки вооружений» нейросетей — это большой вопрос.
⏺
«Богатырева о цифре» в Максе