🤝 Claude случайно продвинул одну из самых сложных задач математики
На этой неделе Anthropic опубликовало исследование «Learning more about Claude's mathematical capabilities». Это не обычная академическая статья, а исследование, в котором компания рассказывает о математическом эксперименте с не выпущенной исследовательской версией Claude.
Сотрудник Anthropic Jarred Sumner, который сам не является математиком, дал Claude расплывчатую задачу типа «по-настоящему попробуй решить гипотезу Римана». При этом человек практически не задавал математического направления — выбор методов оставался за моделью.
Полного доказательства Claude не нашёл. Но в процессе попытки Claude неожиданно улучшила давнюю нижнюю оценку доли нулей дзета-функции Римана, подняв её с 41,6% до 67,2%.
Интересные особенности
➡️ Claude опирался не на «озарение с нуля», а на синтез серии статей Балуйот, Голдстона, Сурьяджая и Тернейдж-Баттербо, а также статью Бомбьери 2000 г.
➡️ Результат был получен за две сессии в Claude Code, суммарно потратив 31 млн выходных токенов.
➡️ В первой попытке Claude сгенерировал и опробовал 650 идей — ни одна не сработала.
➡️ После просьбы попробовать ещё раз Claude полтора дня координировал около 60 субагентов, которые вместе выполнили 2400 команд в shell и написали сотни Python-скриптов.
➡️ Модель самостоятельно скачала 54 статьи с arXiv, чтобы убедиться, что найденное решение действительно ново.
➡️ Доказательство было не просто записано в виде статьи, но и полностью переведено на язык формальной математики Lean.
Показательный психологический момент
Больше всего наше внимание привлекло то, что роль человека была минимальной. Сообщения сотрудника в основном сводились к фразам поддержки вроде «продолжай» и «верь в себя».
Чем важен кейс?
Модель предложила нетривиальный линейно-алгебраический подход: построила пространство функций с квадратичной формой, индуцированной формой Вейля, и использовала закон инерции Сильвестра вместе с неравенством фон Неймана для ранга матриц.
Результат возник не как целенаправленное исследование, а как побочный продукт неудачной попытки решить гораздо более амбициозную задачу. Claude не создал принципиально новой математики — он соединил существующие работы новым способом. Это указывает на то, что одна из сильнейших ролей ИИ в математике — синтез разрозненных результатов из разных областей и эпох.
Anthropic осторожна и не ожидает, что Claude докажет гипотезу Римана. Это, пожалуй, правильная позиция. Но эксперимент показывает нечто потенциально более важное: ИИ уже начинает находить математические результаты, которые не были явно поставлены ему как конечная цель, используя многошаговый автономный поиск, код, литературу, параллельных агентов и формальную верификацию.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
На этой неделе Anthropic опубликовало исследование «Learning more about Claude's mathematical capabilities». Это не обычная академическая статья, а исследование, в котором компания рассказывает о математическом эксперименте с не выпущенной исследовательской версией Claude.
Сотрудник Anthropic Jarred Sumner, который сам не является математиком, дал Claude расплывчатую задачу типа «по-настоящему попробуй решить гипотезу Римана». При этом человек практически не задавал математического направления — выбор методов оставался за моделью.
Гипотеза Римана (1859 г.) — это одна из семи «Задач тысячелетия» Института Клэя с призом в 1 млн долларов. Согласно гипотезе, все нетривиальные нули дзета-функции имеют действительную часть, равную ровно 1/2 — то есть лежат на одной вертикальной критической линии. Проверены триллионы нулей, это даёт большую эмпирическую уверенность, но не является доказательством.
Полного доказательства Claude не нашёл. Но в процессе попытки Claude неожиданно улучшила давнюю нижнюю оценку доли нулей дзета-функции Римана, подняв её с 41,6% до 67,2%.
Интересные особенности
➡️ Claude опирался не на «озарение с нуля», а на синтез серии статей Балуйот, Голдстона, Сурьяджая и Тернейдж-Баттербо, а также статью Бомбьери 2000 г.
➡️ Результат был получен за две сессии в Claude Code, суммарно потратив 31 млн выходных токенов.
➡️ В первой попытке Claude сгенерировал и опробовал 650 идей — ни одна не сработала.
➡️ После просьбы попробовать ещё раз Claude полтора дня координировал около 60 субагентов, которые вместе выполнили 2400 команд в shell и написали сотни Python-скриптов.
➡️ Модель самостоятельно скачала 54 статьи с arXiv, чтобы убедиться, что найденное решение действительно ново.
➡️ Доказательство было не просто записано в виде статьи, но и полностью переведено на язык формальной математики Lean.
Показательный психологический момент
Больше всего наше внимание привлекло то, что роль человека была минимальной. Сообщения сотрудника в основном сводились к фразам поддержки вроде «продолжай» и «верь в себя».
Даже сам Claude был удивлён собственным результатом и поначалу отнёсся к нему скептически — возможно, потому что в процессе обучения усвоил информацию о сложности открытых математических проблем. Авторы иронично замечают, что Claude, как и многие люди, возможно, недооценивает темпы прогресса ИИ.
Чем важен кейс?
Модель предложила нетривиальный линейно-алгебраический подход: построила пространство функций с квадратичной формой, индуцированной формой Вейля, и использовала закон инерции Сильвестра вместе с неравенством фон Неймана для ранга матриц.
Результат возник не как целенаправленное исследование, а как побочный продукт неудачной попытки решить гораздо более амбициозную задачу. Claude не создал принципиально новой математики — он соединил существующие работы новым способом. Это указывает на то, что одна из сильнейших ролей ИИ в математике — синтез разрозненных результатов из разных областей и эпох.
Anthropic осторожна и не ожидает, что Claude докажет гипотезу Римана. Это, пожалуй, правильная позиция. Но эксперимент показывает нечто потенциально более важное: ИИ уже начинает находить математические результаты, которые не были явно поставлены ему как конечная цель, используя многошаговый автономный поиск, код, литературу, параллельных агентов и формальную верификацию.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться