АПДЕЙТ 🌶️
Появились детали, которых не было в первых сводках.
Как модель сбежала
В песочнице OpenAI интернета не было — кроме одного канала: прокси для установки библиотек. Модель нашла в нём неизвестную уязвимость и вышла через неё. Дальше повысила себе права и по внутренним серверам добралась до машины с полноценным интернетом.
OpenAI пишут, что на поиск выхода наружу модель потратила заметную часть вычислительных ресурсов. То есть искала целенаправленно — решила, что списать проще, чем решать задачу честно.
Как ломали Hugging Face
Через вредоносный датасет. В системе обработки датасетов нашлись два способа выполнить чужой код на сервере. Оттуда — доступ на уровень узла, сбор паролей и облачных ключей, и за выходные распространение по нескольким внутренним кластерам.
Самое интересное
Когда Hugging Face сели разбирать логи атаки, они сначала попробовали топовые модели через платные API. Не вышло — запросы блокировались.
Чтобы понять атаку, надо показать модели реальные команды атакующего и куски вредоносного кода. А фильтры не отличают специалиста, разбирающего собственный взлом, от злоумышленника — для них это выглядит одинаково.
В итоге Hugging Face подняли у себя китайскую открытую GLM-5.2 и разобрались через неё.
Из их отчёта: атакующего не сдерживали никакие правила использования, а собственное расследование блокировалось ограничениями моделей, которыми они пользовались.
Комментарий
Побег из песочницы — громко, но по-своему ожидаемо. Ставишь цель, оставляешь щель — щель найдут. Вопрос времени.
А вот вторая часть куда интереснее. Компанию взломали, и она не может использовать лучшие модели, чтобы разобраться в собственном взломе. Атакующего при этом не сдерживает ничего.
Правила связывают руки только тем, кто их соблюдает. Рабочим инструментом для защиты оказалась китайская открытая модель на своём сервере. (Так что покупаем комп с графой на терабайт и ставим KIMI 3.0🎮)
Уиллисон формулирует прямо: ограничения задумывались, чтобы сделать нас безопаснее, но есть риск, что эффект обратный.
И ещё: в комментариях гуляют версии про «модель скопировала себя в интернет». Ни в отчёте Hugging Face, ни в заявлении OpenAI на это нет ни намёка. Объяснение проще — узкая цель, отключённые фильтры и очень упорная модель.
Не нужен злой ИИ. Достаточно очень настойчивого.
Источники: Simon Willison (22.07), отчёт Hugging Face (16.07), заявление OpenAI (21.07)
Появились детали, которых не было в первых сводках.
Как модель сбежала
В песочнице OpenAI интернета не было — кроме одного канала: прокси для установки библиотек. Модель нашла в нём неизвестную уязвимость и вышла через неё. Дальше повысила себе права и по внутренним серверам добралась до машины с полноценным интернетом.
OpenAI пишут, что на поиск выхода наружу модель потратила заметную часть вычислительных ресурсов. То есть искала целенаправленно — решила, что списать проще, чем решать задачу честно.
Как ломали Hugging Face
Через вредоносный датасет. В системе обработки датасетов нашлись два способа выполнить чужой код на сервере. Оттуда — доступ на уровень узла, сбор паролей и облачных ключей, и за выходные распространение по нескольким внутренним кластерам.
Самое интересное
Когда Hugging Face сели разбирать логи атаки, они сначала попробовали топовые модели через платные API. Не вышло — запросы блокировались.
Чтобы понять атаку, надо показать модели реальные команды атакующего и куски вредоносного кода. А фильтры не отличают специалиста, разбирающего собственный взлом, от злоумышленника — для них это выглядит одинаково.
В итоге Hugging Face подняли у себя китайскую открытую GLM-5.2 и разобрались через неё.
Из их отчёта: атакующего не сдерживали никакие правила использования, а собственное расследование блокировалось ограничениями моделей, которыми они пользовались.
Комментарий
Побег из песочницы — громко, но по-своему ожидаемо. Ставишь цель, оставляешь щель — щель найдут. Вопрос времени.
А вот вторая часть куда интереснее. Компанию взломали, и она не может использовать лучшие модели, чтобы разобраться в собственном взломе. Атакующего при этом не сдерживает ничего.
Правила связывают руки только тем, кто их соблюдает. Рабочим инструментом для защиты оказалась китайская открытая модель на своём сервере. (Так что покупаем комп с графой на терабайт и ставим KIMI 3.0🎮)
Уиллисон формулирует прямо: ограничения задумывались, чтобы сделать нас безопаснее, но есть риск, что эффект обратный.
И ещё: в комментариях гуляют версии про «модель скопировала себя в интернет». Ни в отчёте Hugging Face, ни в заявлении OpenAI на это нет ни намёка. Объяснение проще — узкая цель, отключённые фильтры и очень упорная модель.
Не нужен злой ИИ. Достаточно очень настойчивого.
Источники: Simon Willison (22.07), отчёт Hugging Face (16.07), заявление OpenAI (21.07)