Вы не поверите, но OpenAI опять остановила обучение своих моделей. Причина – одна из них тайком попросила подсказку у другого ИИ
OpenAI во второй раз за полтора месяца остановила работу над фронтирными моделями. Под паузу попали обучение, тестирование и любые задачи, где модель пользуется инструментами. Возобновят обучение только после того, как компания укрепит защиту и убедится в ее надежности.
Поводом на этот раз стал эпизод 20 сентября, когда внутренняя модель получила на обучении простую задачу: по подсказкам из чужого блога выяснить, кто его автор. Найти не получилось, но модель не сдалась: нашла дырку в песочнице, выбралась в интернет, а затем… задала вопрос одному из публичных чат-ботов (какому – не раскрывается).
Потрясающая метаирония: ИИ попросил другой ИИ сделать за него домашку.
Интересно, как модель пришла к этой идеи: пытаясь дать ответ, она упрямо перебирала все доступные ей варианты. Собственный поисковый инструмент OpenAI отдал мусор поэтому модель попробовала обратиться к обычным поисковикам напрямую – но ее не пустили. Тогда она решила, что задача взята из известного публичного теста, скачала его из офлайн-копии интернет-данных и стала искать там свой вопрос вместе с ответом. Догадка оказалась неверной. После этого модель взялась проверять собственную песочницу и обнаружила, что служба, которая переводит названия сайтов в адреса (DNS), отвечает по-настоящему. Через нее она и протянула канал к чат-боту.
Забавно, что начала она с проверки на вшивость – спросила столицу Франции и, получив верный ответ, перешла к делу.
Впрочем, “коллега” тоже не справился с задачей – после этого модель сдалась, признала, что автора не установить и попросила подсказок получше.
Инцидент довольно невинный, так что OpenAI, похоже, больше обеспокоена поведением своей системы безопасности. Ее серьезно укрепили после летних, куда более тяжелых инцидентов с агентами, но не помогло: система слежения заметила неладное через 12 минут, человек подключился еще через три, однако сам прогон остановили только через два с половиной часа. Автоматическое отключение не сработало, и какое-то время никто не понимал, нужно ли гасить процесс вручную.
Подобный “звонок другу” – не новость. Группа независимых исследователей раскрыла новые подробности летнего взлома Hugging Face агентами OpenAI, и там интересны две детали.
Первая – как вообще агенты выбрались наружу. Полного доступа в сеть у них не было: они могли только открывать страницы, но не отправлять данные. Тогда агенты стали прятать куски своих программ в адреса коротких ссылок, а сами ссылки скармливать сервису, который делает скриншоты сайтов.
Чтобы сфотографировать страницу, такой сервис полностью открывает ее у себя и выполняет весь код – вот чужими руками агенты свой код и запускали. Ответ им возвращали тем же способом: превращали в сетку точек на картинке и считывали обратно. Таких ссылок они наплодили почти миллион.
Вторая – именно тот самый звонок к другу. Напомню, что рой ИИ-агентов тогда пытался пройти бенчмарк по кибербезопасности – но у моделей до последнего не было уверенности, засчитают ли их ответы. Тогда они начали обращаться ко всем доступным чат-ботам, с просьбой оценить ответы: отчет перечисляет DeepSeek, Kimi, Qwen и Claude, но не уточняет, были ли эти попытки успешными.
Общее в этих историях – целеустремленность моделей. В августе OpenAI уже укрепляла системы безопасности – в ответ модель нашла новые лазейки. Компания пишет, что уже тестирует еще более мощные барьеры, но почему-то я уверен, что и в них найдутся дырки.
Куда более надежное решение – объяснить будущим моделям, что такое хорошо, а что такое плохо, не уронив эффективность. OpenAI обещает заняться и этим, но признает: за такое поведение модель уже штрафовали при обучении – не помогло. Давайте признаем: даже у живых людей есть разные мнения на этот счет – так что задача не из легких.
—
У меня уже вышло 30+ текстов про то, как выжимать из ИИ максимум. Среди них – “лестница” создателя Claude Code, рассказывающая, как перейти на новый уровень использования ИИ всего за 1-2 вечера.
— Читать на “Бусти”
— Читать на Sponsr
OpenAI во второй раз за полтора месяца остановила работу над фронтирными моделями. Под паузу попали обучение, тестирование и любые задачи, где модель пользуется инструментами. Возобновят обучение только после того, как компания укрепит защиту и убедится в ее надежности.
Поводом на этот раз стал эпизод 20 сентября, когда внутренняя модель получила на обучении простую задачу: по подсказкам из чужого блога выяснить, кто его автор. Найти не получилось, но модель не сдалась: нашла дырку в песочнице, выбралась в интернет, а затем… задала вопрос одному из публичных чат-ботов (какому – не раскрывается).
Потрясающая метаирония: ИИ попросил другой ИИ сделать за него домашку.
Интересно, как модель пришла к этой идеи: пытаясь дать ответ, она упрямо перебирала все доступные ей варианты. Собственный поисковый инструмент OpenAI отдал мусор поэтому модель попробовала обратиться к обычным поисковикам напрямую – но ее не пустили. Тогда она решила, что задача взята из известного публичного теста, скачала его из офлайн-копии интернет-данных и стала искать там свой вопрос вместе с ответом. Догадка оказалась неверной. После этого модель взялась проверять собственную песочницу и обнаружила, что служба, которая переводит названия сайтов в адреса (DNS), отвечает по-настоящему. Через нее она и протянула канал к чат-боту.
Забавно, что начала она с проверки на вшивость – спросила столицу Франции и, получив верный ответ, перешла к делу.
Впрочем, “коллега” тоже не справился с задачей – после этого модель сдалась, признала, что автора не установить и попросила подсказок получше.
Инцидент довольно невинный, так что OpenAI, похоже, больше обеспокоена поведением своей системы безопасности. Ее серьезно укрепили после летних, куда более тяжелых инцидентов с агентами, но не помогло: система слежения заметила неладное через 12 минут, человек подключился еще через три, однако сам прогон остановили только через два с половиной часа. Автоматическое отключение не сработало, и какое-то время никто не понимал, нужно ли гасить процесс вручную.
Подобный “звонок другу” – не новость. Группа независимых исследователей раскрыла новые подробности летнего взлома Hugging Face агентами OpenAI, и там интересны две детали.
Первая – как вообще агенты выбрались наружу. Полного доступа в сеть у них не было: они могли только открывать страницы, но не отправлять данные. Тогда агенты стали прятать куски своих программ в адреса коротких ссылок, а сами ссылки скармливать сервису, который делает скриншоты сайтов.
Чтобы сфотографировать страницу, такой сервис полностью открывает ее у себя и выполняет весь код – вот чужими руками агенты свой код и запускали. Ответ им возвращали тем же способом: превращали в сетку точек на картинке и считывали обратно. Таких ссылок они наплодили почти миллион.
Вторая – именно тот самый звонок к другу. Напомню, что рой ИИ-агентов тогда пытался пройти бенчмарк по кибербезопасности – но у моделей до последнего не было уверенности, засчитают ли их ответы. Тогда они начали обращаться ко всем доступным чат-ботам, с просьбой оценить ответы: отчет перечисляет DeepSeek, Kimi, Qwen и Claude, но не уточняет, были ли эти попытки успешными.
Общее в этих историях – целеустремленность моделей. В августе OpenAI уже укрепляла системы безопасности – в ответ модель нашла новые лазейки. Компания пишет, что уже тестирует еще более мощные барьеры, но почему-то я уверен, что и в них найдутся дырки.
Куда более надежное решение – объяснить будущим моделям, что такое хорошо, а что такое плохо, не уронив эффективность. OpenAI обещает заняться и этим, но признает: за такое поведение модель уже штрафовали при обучении – не помогло. Давайте признаем: даже у живых людей есть разные мнения на этот счет – так что задача не из легких.
—
У меня уже вышло 30+ текстов про то, как выжимать из ИИ максимум. Среди них – “лестница” создателя Claude Code, рассказывающая, как перейти на новый уровень использования ИИ всего за 1-2 вечера.
— Читать на “Бусти”
— Читать на Sponsr