OpenAI выкатили Солнечную систему моделей: GPT-5.6 Sol, Terra, Luna
Только что были представлены новые модели OpenAI. Порядковый номер — 5.6. Но под ним кроется новое разделение на тиры. За основу нейминга взяли космическую тематику:
• Sol — флагман для самых сложных задач. Конкурент Mythos/Fable 5. Обходит Claude по TerminalBench 2.1 (управление терминалом/командной строкой), немного отстает по ExploitBench (поиск уязвимостей). Однако гораздо дешевле по затраченным токенам.
• Terra — баланс качества и стоимости. Она должна быть примерно сопоставима по перфомансу с GPT-5.5, но в 2 раза дешевле по токенам.
• Luna — быстрая и дешевая модель на каждый день. Похоже будет сопоставима примерно со старичком Opus 4.7.
Для Sol еще сперли у Anthropic придумали сразу два дополнительных режима:
• Max — когда нужен максимально глубокий reasoning.
• Ultra — когда модель может использовать сабагентов для решения одной задачи.
По заявлению OpenAI, GPT-5.6 особенно усилили в самых хайповых сейчас областях:
• программирование
• кибербезопасность
• биология / биотех
• длинные агентные задачи, где модель должна держать цель десятки минут и выполнять большой план действий.
Модели вышли в превью. Более полные бенчмарки будут после релиза финальных версий
Куда привела паника по AI-безопасности
OpenAI основательно подготовились к релизу на фоне того, как Администрация дедушки Трампа прищучила Fable 5.
Во-первых, подготовили очень много текста о том, какая модель со всех сторон протестированная и самая безопасная — как известно, это самое важно во взаимодействии с госухой.
Во-вторых, в процесс обучения добавили этап обучения защите против jailbreak’ов и попыток скрыть вредоносные намерения пользователя. То есть таким "атакам" теперь противодействуют не только отдельные классификаторы и промпты, как это обычно делают, но и сама модель этому сопротивляется на корню.
В-третьих, на внутренний автоматизированный red teaming (этакие автоматические краш-тесты, управляемые попытки взлома новых моделей другими моделями) направили около 700 тысяч GPU-часов плюс подключили внешних экспертов по ред-тимингу.
Но самое неприятное для мира AI другое
Это первый случай, когда выпуск фронтирной модели происходит практически под государственным контролем США.
Превью модели предварительно показывали Администрации. Не понятно зачем. Ведь никакой системы для тестирования AI, которую не смогла бы обойти лучшая модель от одних из лучших в мире разработчиков AI — у Администрации, очевидно, нет 👌
А сейчас еще и раскатывают превью только на ограниченный, заранее согласованный с Правительством США, список компаний. Тут OpenAI делают хорошую мину при хреновой игре — говорят, что мол сами потестируют, как там сотрудники этих компаний будут юзать модели. По факту, единственное, что они действительно узнают (об этом они тоже говорят в релизе) — это, будет ли модель вообще юзабельна с учетом всех ограничений. Чтобы не получилось как с Fable 5, которая просто отказывалась сама делать любую задачу и отдавала ее Opus 4.8.
В общем, простым смертным модель докатят, если все будет хорошо, в течение следующих недель.
Прецедент так себе. Причем в первую очередь для самих США. Пока они бюрократизируют процесс релиза — китайская GLM наступает на пятки. Да и в целом для мира AI новость так себе — мы же с вами понимаем, что "лучшие практики" быстро разлетятся по миру... ☕️
Но есть и приятная новость
Ценник у топовой модели будет почти в 2 раза ниже, чем у Claude Fable! GPT-5.6 Sol будут развешивать по 5$ инпут / 30$ аутпут за миллион токенов ☀️
Заместители
Только что были представлены новые модели OpenAI. Порядковый номер — 5.6. Но под ним кроется новое разделение на тиры. За основу нейминга взяли космическую тематику:
• Sol — флагман для самых сложных задач. Конкурент Mythos/Fable 5. Обходит Claude по TerminalBench 2.1 (управление терминалом/командной строкой), немного отстает по ExploitBench (поиск уязвимостей). Однако гораздо дешевле по затраченным токенам.
• Terra — баланс качества и стоимости. Она должна быть примерно сопоставима по перфомансу с GPT-5.5, но в 2 раза дешевле по токенам.
• Luna — быстрая и дешевая модель на каждый день. Похоже будет сопоставима примерно со старичком Opus 4.7.
Для Sol еще сперли у Anthropic придумали сразу два дополнительных режима:
• Max — когда нужен максимально глубокий reasoning.
• Ultra — когда модель может использовать сабагентов для решения одной задачи.
По заявлению OpenAI, GPT-5.6 особенно усилили в самых хайповых сейчас областях:
• программирование
• кибербезопасность
• биология / биотех
• длинные агентные задачи, где модель должна держать цель десятки минут и выполнять большой план действий.
Модели вышли в превью. Более полные бенчмарки будут после релиза финальных версий
Куда привела паника по AI-безопасности
OpenAI основательно подготовились к релизу на фоне того, как Администрация дедушки Трампа прищучила Fable 5.
Во-первых, подготовили очень много текста о том, какая модель со всех сторон протестированная и самая безопасная — как известно, это самое важно во взаимодействии с госухой.
Во-вторых, в процесс обучения добавили этап обучения защите против jailbreak’ов и попыток скрыть вредоносные намерения пользователя. То есть таким "атакам" теперь противодействуют не только отдельные классификаторы и промпты, как это обычно делают, но и сама модель этому сопротивляется на корню.
В-третьих, на внутренний автоматизированный red teaming (этакие автоматические краш-тесты, управляемые попытки взлома новых моделей другими моделями) направили около 700 тысяч GPU-часов плюс подключили внешних экспертов по ред-тимингу.
Но самое неприятное для мира AI другое
Это первый случай, когда выпуск фронтирной модели происходит практически под государственным контролем США.
Превью модели предварительно показывали Администрации. Не понятно зачем. Ведь никакой системы для тестирования AI, которую не смогла бы обойти лучшая модель от одних из лучших в мире разработчиков AI — у Администрации, очевидно, нет 👌
А сейчас еще и раскатывают превью только на ограниченный, заранее согласованный с Правительством США, список компаний. Тут OpenAI делают хорошую мину при хреновой игре — говорят, что мол сами потестируют, как там сотрудники этих компаний будут юзать модели. По факту, единственное, что они действительно узнают (об этом они тоже говорят в релизе) — это, будет ли модель вообще юзабельна с учетом всех ограничений. Чтобы не получилось как с Fable 5, которая просто отказывалась сама делать любую задачу и отдавала ее Opus 4.8.
В общем, простым смертным модель докатят, если все будет хорошо, в течение следующих недель.
Прецедент так себе. Причем в первую очередь для самих США. Пока они бюрократизируют процесс релиза — китайская GLM наступает на пятки. Да и в целом для мира AI новость так себе — мы же с вами понимаем, что "лучшие практики" быстро разлетятся по миру... ☕️
Но есть и приятная новость
Ценник у топовой модели будет почти в 2 раза ниже, чем у Claude Fable! GPT-5.6 Sol будут развешивать по 5$ инпут / 30$ аутпут за миллион токенов ☀️
Заместители