TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

27 Jul, 07:05

Открыть в Telegram Поделиться Пожаловаться

01:01
Главное достижение Claude Opus 5 – 30,2% на ARC-AGI-3

Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.

Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.

Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.

Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.

Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).

“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.

В ARC Prize отмечают, что впервые видят такое поведение у модели.

Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.

Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.

Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.

Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.

Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.

Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.

Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.

Самое время подписаться!

10.7k 0 93 134
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot