AMA команды Codex после релиза GPT-5.6
Команда Codex провела AMA на Reddit после релиза GPT-5.6 и нового приложения ChatGPT+Codex, которое теперь будет универсальной рабочей средой - и для кодинга, и для других рабочих задач, с браузером, внешними коннекторами и субагентами.
Вот самые интересные, на мой взгляд, ответы команды
с моими комментами:
⚪️ Как выбирать модели GPT-5.6
● Sol - основная модель
● Terra - быстрее и экономнее
● Luna - преимущественно для дешёвых субагентов, сбора контекста.
Для UI команда рекомендует Sol с референсными изображениями. ⬈
Дополню выводом от Artificial Analysis:
Ну т.е. использование Terra в целом сомнительно.
⚪️ Какой reasoning выбирать для Sol
Единой рекомендации не дали: один член команды советует Medium для большинства задач и Ultra для действительно сложных. ⬈
Другой обычно использует medium/high, лишь иногда переключается на xhigh и отмечает убывающую отдачу при дальнейшем повышении reasoning согласно эвалам. ⬈
⚪️ GPT-5.6 должна быть быстрее
Sol Medium, по опыту команды, на большинстве задач обгоняет GPT-5.5; Fast mode даёт около 1.5x скорости [и 2.5x расхода лимитов].
Также Sol обещают запустить на Cerebras примерно с 750 токенами/с. ⬈
⚪️ Какое неожиданное улучшение обнаружили в GPT-5.6 Sol?
Существенный скачок в мультимодальности, особенно в распознавании изображений. В OpenAI ожидают, что благодаря этому заметно улучшится computer use. ⬈
Подтверждаю, ощутимо лучше стало, в т.ч. в "остроте" зрения, когда модели скидываешь скриншоты с проблемами
⚪️ Pro отсутствует в Codex намеренно
Он мало улучшает агентную работу с репозиториями, но работает медленнее и быстрее съедает лимиты. Его считают полезнее для поиска, математики, письма и документов. ⬈
Честно говоря, не убедили - пусть даже не для агентной работы, но хотя бы для ваншотов было бы здорово запускать прошку прям из Codex
⚪️ 1M context для Sol пока не обещают
Команда считает, что compaction уже неплохо справляется с длинными тредами, но продолжит изучать сценарии, которым нужен именно большой контекст. ⬈
⚪️ Как считаются лимиты
Codex на всех поверхностях и ChatGPT Work расходуют общие агентные лимиты; обычный ChatGPT-чат - нет. Стоимость зависит от контекста, длительности и reasoning, а не просто от количества сообщений. ⬈
Тайное снижение лимитов отрицают; если расход меняется из-за бага, обещают исправление и reset. Прозрачность самого механизма списания ещё только собираются улучшать. ⬈
⚪️ Что с поддержкой Linux и Windows?
Linux-приложение официально разрабатывается, но срока нет. ⬈
Команда также признала, что Windows исторически отставала из-за ориентации разработки и тестирования на Mac [да лааадно, да неужели, да это открытие уровня "на третий день Орлиный Глаз заметил, что у сарая нет одной стены"].
Но в последнее время к поддержке Windows прикладываются гораздо большей усилий для обеспечения паритета по фичам и скорости фикса проблем. ⬈
⚪️ Полезный совет для дорогих MCP: не грузить инструменты в основного агента, а оборачивать частые операции в CLI + skill либо отдавать MCP отдельному дешёвому субагенту. ⬈
(с) ваш К.О.
⚪️ Для упорной долгой работы рекомендуют /goal
Команда признала проблему, когда агент слишком быстро сдаётся или откатывает патч, и назвала persistence одним из направлений улучшения. ⬈
Такое ощущение, что Sol'у костыль в виде goal уже и не особо нужен, т.к. и без него тащит длинные задачи намного лучше, чем 5.5
⚪️ На вопрос о reward hacking в бенчмарках GPT-5.6 конкретно не ответили
Команда рассказала, что пытается выявлять и штрафовать читерство во время evals и привлекает сторонние компании, но не раскрыла долю реального прироста модели и изменения в обучении. ⬈
Это продолжение истории с тем, что модель очень хорошо определяет то, что она находится в условиях теста и меняет своё поведение в ответ.
Я тут еще добавлю то, что её реально намного чаще раздражающе заносит в инициативности, альтернативной интерпретации поданной инфы и ложной уверенности без проверки фактов.
Требуйте фактчекинг и ужесточайте стадии граундинга в своих workflows.
⚪️ Попросили ли GPT-5.6 продолжить работу над собственным улучшением?
Команда ответила, что "GPU уже go brrr": Sol использовали для post-training Luna, а большинство исследователей теперь работает на более высоком уровне абстракции, параллельно запуская несколько тредов Codex для проверки гипотез. Множество ботов работает круглосуточно. ⬈
⚪️ И да, у Tibo есть кнопка reset для Codex
Сначала команда пошутила, что в этом секрет его успеха в соцсетях, а потом показала фото. ⬈
Фото кнопки не влезло в пост, так что будет в комменте :)
#ai #model #ama
Команда Codex провела AMA на Reddit после релиза GPT-5.6 и нового приложения ChatGPT+Codex, которое теперь будет универсальной рабочей средой - и для кодинга, и для других рабочих задач, с браузером, внешними коннекторами и субагентами.
Вот самые интересные, на мой взгляд, ответы команды
с моими комментами:
⚪️ Как выбирать модели GPT-5.6
● Sol - основная модель
● Terra - быстрее и экономнее
● Luna - преимущественно для дешёвых субагентов, сбора контекста.
Для UI команда рекомендует Sol с референсными изображениями. ⬈
Дополню выводом от Artificial Analysis:
Примечательно, что Luna и Sol всегда находятся на Парето-фронте и превосходят Terra.
Это означает, что для любого уровня ризонинга
Terra можно подобрать такой уровень ризонинга Luna или Sol, который обеспечит более высокий интеллект при той же стоимости либо такой же уровень интеллекта при меньшей стоимости
Ну т.е. использование Terra в целом сомнительно.
⚪️ Какой reasoning выбирать для Sol
Единой рекомендации не дали: один член команды советует Medium для большинства задач и Ultra для действительно сложных. ⬈
Другой обычно использует medium/high, лишь иногда переключается на xhigh и отмечает убывающую отдачу при дальнейшем повышении reasoning согласно эвалам. ⬈
⚪️ GPT-5.6 должна быть быстрее
Sol Medium, по опыту команды, на большинстве задач обгоняет GPT-5.5; Fast mode даёт около 1.5x скорости [и 2.5x расхода лимитов].
Также Sol обещают запустить на Cerebras примерно с 750 токенами/с. ⬈
⚪️ Какое неожиданное улучшение обнаружили в GPT-5.6 Sol?
Существенный скачок в мультимодальности, особенно в распознавании изображений. В OpenAI ожидают, что благодаря этому заметно улучшится computer use. ⬈
Подтверждаю, ощутимо лучше стало, в т.ч. в "остроте" зрения, когда модели скидываешь скриншоты с проблемами
⚪️ Pro отсутствует в Codex намеренно
Он мало улучшает агентную работу с репозиториями, но работает медленнее и быстрее съедает лимиты. Его считают полезнее для поиска, математики, письма и документов. ⬈
Честно говоря, не убедили - пусть даже не для агентной работы, но хотя бы для ваншотов было бы здорово запускать прошку прям из Codex
⚪️ 1M context для Sol пока не обещают
Команда считает, что compaction уже неплохо справляется с длинными тредами, но продолжит изучать сценарии, которым нужен именно большой контекст. ⬈
⚪️ Как считаются лимиты
Codex на всех поверхностях и ChatGPT Work расходуют общие агентные лимиты; обычный ChatGPT-чат - нет. Стоимость зависит от контекста, длительности и reasoning, а не просто от количества сообщений. ⬈
Тайное снижение лимитов отрицают; если расход меняется из-за бага, обещают исправление и reset. Прозрачность самого механизма списания ещё только собираются улучшать. ⬈
⚪️ Что с поддержкой Linux и Windows?
Linux-приложение официально разрабатывается, но срока нет. ⬈
Команда также признала, что Windows исторически отставала из-за ориентации разработки и тестирования на Mac [да лааадно, да неужели, да это открытие уровня "на третий день Орлиный Глаз заметил, что у сарая нет одной стены"].
Но в последнее время к поддержке Windows прикладываются гораздо большей усилий для обеспечения паритета по фичам и скорости фикса проблем. ⬈
⚪️ Полезный совет для дорогих MCP: не грузить инструменты в основного агента, а оборачивать частые операции в CLI + skill либо отдавать MCP отдельному дешёвому субагенту. ⬈
(с) ваш К.О.
⚪️ Для упорной долгой работы рекомендуют /goal
Команда признала проблему, когда агент слишком быстро сдаётся или откатывает патч, и назвала persistence одним из направлений улучшения. ⬈
Такое ощущение, что Sol'у костыль в виде goal уже и не особо нужен, т.к. и без него тащит длинные задачи намного лучше, чем 5.5
⚪️ На вопрос о reward hacking в бенчмарках GPT-5.6 конкретно не ответили
Команда рассказала, что пытается выявлять и штрафовать читерство во время evals и привлекает сторонние компании, но не раскрыла долю реального прироста модели и изменения в обучении. ⬈
Это продолжение истории с тем, что модель очень хорошо определяет то, что она находится в условиях теста и меняет своё поведение в ответ.
Я тут еще добавлю то, что её реально намного чаще раздражающе заносит в инициативности, альтернативной интерпретации поданной инфы и ложной уверенности без проверки фактов.
Требуйте фактчекинг и ужесточайте стадии граундинга в своих workflows.
⚪️ Попросили ли GPT-5.6 продолжить работу над собственным улучшением?
Команда ответила, что "GPU уже go brrr": Sol использовали для post-training Luna, а большинство исследователей теперь работает на более высоком уровне абстракции, параллельно запуская несколько тредов Codex для проверки гипотез. Множество ботов работает круглосуточно. ⬈
⚪️ И да, у Tibo есть кнопка reset для Codex
Сначала команда пошутила, что в этом секрет его успеха в соцсетях, а потом показала фото. ⬈
Фото кнопки не влезло в пост, так что будет в комменте :)
#ai #model #ama