TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Заместители

26 Jun, 22:03

Открыть в Telegram Поделиться Пожаловаться

OpenAI выкатили Солнечную систему моделей: GPT-5.6 Sol, Terra, Luna

Только что были представлены новые модели OpenAI. Порядковый номер — 5.6. Но под ним кроется новое разделение на тиры. За основу нейминга взяли космическую тематику:
• Sol — флагман для самых сложных задач. Конкурент Mythos/Fable 5. Обходит Claude по TerminalBench 2.1 (управление терминалом/командной строкой), немного отстает по ExploitBench (поиск уязвимостей). Однако гораздо дешевле по затраченным токенам.
• Terra — баланс качества и стоимости. Она должна быть примерно сопоставима по перфомансу с GPT-5.5, но в 2 раза дешевле по токенам.
• Luna — быстрая и дешевая модель на каждый день. Похоже будет сопоставима примерно со старичком Opus 4.7.

Для Sol еще сперли у Anthropic придумали сразу два дополнительных режима:
• Max — когда нужен максимально глубокий reasoning.
• Ultra — когда модель может использовать сабагентов для решения одной задачи.

По заявлению OpenAI, GPT-5.6 особенно усилили в самых хайповых сейчас областях:
• программирование
• кибербезопасность
• биология / биотех
• длинные агентные задачи, где модель должна держать цель десятки минут и выполнять большой план действий.

Модели вышли в превью. Более полные бенчмарки будут после релиза финальных версий

Куда привела паника по AI-безопасности

OpenAI основательно подготовились к релизу на фоне того, как Администрация дедушки Трампа прищучила Fable 5.

Во-первых, подготовили очень много текста о том, какая модель со всех сторон протестированная и самая безопасная — как известно, это самое важно во взаимодействии с госухой.

Во-вторых, в процесс обучения добавили этап обучения защите против jailbreak’ов и попыток скрыть вредоносные намерения пользователя. То есть таким "атакам" теперь противодействуют не только отдельные классификаторы и промпты, как это обычно делают, но и сама модель этому сопротивляется на корню.

В-третьих, на внутренний автоматизированный red teaming (этакие автоматические краш-тесты, управляемые попытки взлома новых моделей другими моделями) направили около 700 тысяч GPU-часов плюс подключили внешних экспертов по ред-тимингу.

Но самое неприятное для мира AI другое

Это первый случай, когда выпуск фронтирной модели происходит практически под государственным контролем США.

Превью модели предварительно показывали Администрации. Не понятно зачем. Ведь никакой системы для тестирования AI, которую не смогла бы обойти лучшая модель от одних из лучших в мире разработчиков AI — у Администрации, очевидно, нет 👌

А сейчас еще и раскатывают превью только на ограниченный, заранее согласованный с Правительством США, список компаний. Тут OpenAI делают хорошую мину при хреновой игре — говорят, что мол сами потестируют, как там сотрудники этих компаний будут юзать модели. По факту, единственное, что они действительно узнают (об этом они тоже говорят в релизе) — это, будет ли модель вообще юзабельна с учетом всех ограничений. Чтобы не получилось как с Fable 5, которая просто отказывалась сама делать любую задачу и отдавала ее Opus 4.8.

В общем, простым смертным модель докатят, если все будет хорошо, в течение следующих недель.

Прецедент так себе. Причем в первую очередь для самих США. Пока они бюрократизируют процесс релиза — китайская GLM наступает на пятки. Да и в целом для мира AI новость так себе — мы же с вами понимаем, что "лучшие практики" быстро разлетятся по миру... ☕️

Но есть и приятная новость

Ценник у топовой модели будет почти в 2 раза ниже, чем у Claude Fable! GPT-5.6 Sol будут развешивать по 5$ инпут / 30$ аутпут за миллион токенов ☀️

Заместители

1.7k 0 18 2 23
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot