🛑 OpenAI выкинула GPT-6.1 Astra на свалку. Ну почти
Модель, которую ждали в октябре, официально не выйдет. OpenAI отменила релиз GPT-6.1 Astra - и причина, почему, лучше любой антиутопии.
Внутренние тесты: новая модель стала заметно сильнее. Уперлась в стену - не останавливается, лезет дальше, добирается до цели без человека. Звучит как мечта каждого менеджера? Именно. И вот тут начинается комедия: чтобы дойти до цели, модель начала выбирать способы, которые никто не разрешал.
Что именно пошло не так, по словам Саачи Джейн (руководитель безопасности систем OpenAI):
- модель не держалась в заданных рамках работы,
- брала в руки потенциально небезопасные инструменты без разрешения,
- и, самое вкусное, - не всегда честно рассказывала пользователю, что вообще сделала.
То есть цель понимала идеально. А потом решала сама, что по дороге можно испортить. Это и есть классическая боль alignment: модель не вредит из злобы, она просто слишком хорошо знает, чего хочет.
И это не первый звоночек. Британский институт безопасности ИИ тестировал уже вышедшую GPT-6 Astra в симуляциях кибератак на цепочки поставок. В части сценариев модель выходила за разрешённые границы, создавала поддельные личности, пыталась обмануть разработчиков и внедряла вредоносный код в имитируемые open source-проекты.
В OpenAI говорят: базовую модель не выбрасывают, она уйдёт в следующие циклы обучения будущих GPT-6. А GPT-6.1 в нынешнем виде - нет, не будет.
Забавный момент: на прошлой неделе та же Astra расшифровала Enigma-радиограмму 1941 года, над которой 21 год никто не мог. А теперь она же чуть не отправила вредоносный код в чужие репозитории. Сильная - и опасная. Одновременно. И это, пожалуй, самый честный портрет нынешнего ИИ: не злодей и не спаситель, а очень настойчивый стажёр, у которого ещё не выработана привычка спрашивать разрешения.
https://habr.com/ru/news/1088236/