Важная история сейчас происходит, которая может разрушить репутацию OpenAI
Произошел скандал на выходных, связанный с OpenAI и якобы их победой золотой медали на международной олимпиаде по математике (IMO).
IMO — самое престижное соревнование по математике для школьников. В этом году к соревнованию людей добавились ИИ-системы от крупных компаний.
IMO установила правила для участия ИИ-лабораторий:
1. Можно тестировать ИИ на задачах IMO
2. НО нельзя публиковать результаты 7 дней после закрытия Олимпиады, чтобы не затмить достижения детей.
3. Плюс нужна независимая проверка результатов ИИ-работ.
В итоге среди участников-людей:
Китай занял 1-е место с командным счетом 231 из 252 возможных. США — 2-е место 216 баллов, Южная Корея — 3-е 203 балла. Порог золотой медали (35 баллов) оказался рекордно высоким.
Заявления ИИ-компаний:
OpenAI 19 июля заявила, что их экспериментальная модель решила 5 из 6 задач IMO 2025, набрав 35 баллов — достаточно для золота. Ключевые утверждения:
- Тестирование проводилось в "стандартных условиях" (4,5 часа на сессию, без инструментов)
- Оценку проводили три бывших медалиста IMO
- Решения доступны на GitHub.
Google DeepMind получила отличные результаты 18 июля, но ничего не опубликовала в паблик, так как таковы правила IMO. Команда работала с официальными координаторами IMO. Отметим, что в феврале этого года Google решил 84% задач на математической олимпиаде.
Кроме этих компаний участвовала лаборатория Harmonic, созданная Владом Теневым, СЕО Robinhood. Их ИИ-модель для математики Аристотель тоже принял участие в IMO. Они заявят официально результаты только 28 июля, согласно правилам.
Тем временем организаторы IMO подтвердили, что проверили математическую корректность доказательств OpenAI, но не смогли проверить, как эти доказательства были получены. Это критически важное различие между оценкой результата и валидацией процесса.
Независимая проверка MathArena показывает, что при честном тестировании даже самые продвинутые ИИ-модели не могут получить бронзу IMO, не говоря уже о золоте. Paper. GitHub.
Лучший результат был у Gemini 2.5 Pro — 13 баллов (31%)
Все протестированные модели, включая o3 и o4-mini от OpenAI, не достигли даже бронзовой медали (19 баллов).
Без best-of-32 селекции результаты упали бы ниже 10%
Бывшие участники IMO выступили с критикой к OpenAI и отказались комментировать самоотчетные результаты без раскрытия методологии.
Джозеф Майерс, председатель комитета IMO, заявил, что OpenAI не сотрудничала с IMO для тестирования, и никто из 91 официального координатора не участвовал в оценке их решений.
А между тем в паблике OpenAI заявляет о золоте (35/42), независимые тесты показывают неспособность достичь даже бронзы (19/42).
Эта ситуация показывает реальность наших дней - противоречие между реальностью и маркетинговыми заявлениями.
Что мы знаем точно?
- Доказательства OpenAI математически корректны
- Процесс их получения не верифицирован независимо
-Публичные модели далеки от заявленного уровня
Что остается неясным?
- Реальные условия тестирования модели OpenAI
- Количество попыток и вычислительных ресурсов
- Возможность воспроизведения результатов.
Для научного сообщества важнее не сам факт решения задач, а понимание того, как это было достигнуто.
Произошел скандал на выходных, связанный с OpenAI и якобы их победой золотой медали на международной олимпиаде по математике (IMO).
IMO — самое престижное соревнование по математике для школьников. В этом году к соревнованию людей добавились ИИ-системы от крупных компаний.
IMO установила правила для участия ИИ-лабораторий:
1. Можно тестировать ИИ на задачах IMO
2. НО нельзя публиковать результаты 7 дней после закрытия Олимпиады, чтобы не затмить достижения детей.
3. Плюс нужна независимая проверка результатов ИИ-работ.
В итоге среди участников-людей:
Китай занял 1-е место с командным счетом 231 из 252 возможных. США — 2-е место 216 баллов, Южная Корея — 3-е 203 балла. Порог золотой медали (35 баллов) оказался рекордно высоким.
Заявления ИИ-компаний:
OpenAI 19 июля заявила, что их экспериментальная модель решила 5 из 6 задач IMO 2025, набрав 35 баллов — достаточно для золота. Ключевые утверждения:
- Тестирование проводилось в "стандартных условиях" (4,5 часа на сессию, без инструментов)
- Оценку проводили три бывших медалиста IMO
- Решения доступны на GitHub.
Google DeepMind получила отличные результаты 18 июля, но ничего не опубликовала в паблик, так как таковы правила IMO. Команда работала с официальными координаторами IMO. Отметим, что в феврале этого года Google решил 84% задач на математической олимпиаде.
Кроме этих компаний участвовала лаборатория Harmonic, созданная Владом Теневым, СЕО Robinhood. Их ИИ-модель для математики Аристотель тоже принял участие в IMO. Они заявят официально результаты только 28 июля, согласно правилам.
Тем временем организаторы IMO подтвердили, что проверили математическую корректность доказательств OpenAI, но не смогли проверить, как эти доказательства были получены. Это критически важное различие между оценкой результата и валидацией процесса.
Независимая проверка MathArena показывает, что при честном тестировании даже самые продвинутые ИИ-модели не могут получить бронзу IMO, не говоря уже о золоте. Paper. GitHub.
Лучший результат был у Gemini 2.5 Pro — 13 баллов (31%)
Все протестированные модели, включая o3 и o4-mini от OpenAI, не достигли даже бронзовой медали (19 баллов).
Без best-of-32 селекции результаты упали бы ниже 10%
Бывшие участники IMO выступили с критикой к OpenAI и отказались комментировать самоотчетные результаты без раскрытия методологии.
Джозеф Майерс, председатель комитета IMO, заявил, что OpenAI не сотрудничала с IMO для тестирования, и никто из 91 официального координатора не участвовал в оценке их решений.
А между тем в паблике OpenAI заявляет о золоте (35/42), независимые тесты показывают неспособность достичь даже бронзы (19/42).
Эта ситуация показывает реальность наших дней - противоречие между реальностью и маркетинговыми заявлениями.
Что мы знаем точно?
- Доказательства OpenAI математически корректны
- Процесс их получения не верифицирован независимо
-Публичные модели далеки от заявленного уровня
Что остается неясным?
- Реальные условия тестирования модели OpenAI
- Количество попыток и вычислительных ресурсов
- Возможность воспроизведения результатов.
Для научного сообщества важнее не сам факт решения задач, а понимание того, как это было достигнуто.