TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

21 Jul 2025, 12:53

Открыть в Telegram Поделиться Пожаловаться

Важная история сейчас происходит, которая может разрушить репутацию OpenAI

Произошел скандал на выходных, связанный с OpenAI и якобы их победой золотой медали на международной олимпиаде по математике (IMO).

IMO — самое престижное соревнование по математике для школьников. В этом году к соревнованию людей добавились ИИ-системы от крупных компаний.

IMO установила правила для участия ИИ-лабораторий:
1. Можно тестировать ИИ на задачах IMO
2. НО нельзя публиковать результаты 7 дней после закрытия Олимпиады, чтобы не затмить достижения детей.
3. Плюс нужна независимая проверка результатов ИИ-работ.

В итоге среди участников-людей:
Китай занял 1-е место с командным счетом 231 из 252 возможных. США — 2-е место 216 баллов, Южная Корея — 3-е 203 балла. Порог золотой медали (35 баллов) оказался рекордно высоким.

Заявления ИИ-компаний:

OpenAI
19 июля заявила, что их экспериментальная модель решила 5 из 6 задач IMO 2025, набрав 35 баллов — достаточно для золота. Ключевые утверждения:
- Тестирование проводилось в "стандартных условиях" (4,5 часа на сессию, без инструментов)
- Оценку проводили три бывших медалиста IMO
- Решения доступны на GitHub.

Google DeepMind получила отличные результаты 18 июля, но ничего не опубликовала в паблик, так как таковы правила IMO. Команда работала с официальными координаторами IMO. Отметим, что в феврале этого года Google решил 84% задач на математической олимпиаде.

Кроме этих компаний участвовала лаборатория Harmonic, созданная Владом Теневым, СЕО Robinhood. Их ИИ-модель для математики Аристотель тоже принял участие в IMO. Они заявят официально результаты только 28 июля, согласно правилам.

Тем временем организаторы
IMO подтвердили, что проверили математическую корректность доказательств OpenAI, но не смогли проверить, как эти доказательства были получены. Это критически важное различие между оценкой результата и валидацией процесса.

Независимая проверка MathArena показывает, что при честном тестировании даже самые продвинутые ИИ-модели не могут получить бронзу IMO, не говоря уже о золоте. Paper. GitHub.

Лучший результат был у Gemini 2.5 Pro — 13 баллов (31%)
Все протестированные модели, включая o3 и o4-mini от OpenAI, не достигли даже бронзовой медали (19 баллов).
Без best-of-32 селекции результаты упали бы ниже 10%

Бывшие участники IMO выступили с критикой к OpenAI и отказались
комментировать самоотчетные результаты без раскрытия методологии.

Джозеф Майерс, председатель комитета IMO, заявил, что OpenAI не сотрудничала с IMO для тестирования, и никто из 91 официального координатора не участвовал в оценке их решений.

А между тем в паблике OpenAI заявляет о золоте (35/42), независимые тесты показывают неспособность достичь даже бронзы (19/42).

Эта ситуация
показывает реальность наших дней - противоречие между реальностью и маркетинговыми заявлениями.

Что мы знаем точно?
- Доказательства OpenAI математически корректны
- Процесс их получения не верифицирован независимо
-Публичные модели далеки от заявленного уровня
Что остается неясным?
- Реальные условия тестирования модели OpenAI
- Количество попыток и вычислительных ресурсов
- Возможность воспроизведения результатов.

Для научного сообщества важнее не сам факт решения задач, а понимание того, как это было достигнуто.

3.2k 5 78 53
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot