TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

25 May, 14:11

Открыть в Telegram Поделиться Пожаловаться

Команда Google DeepMind решила 9 проблем Эрдёша с ИИ-агентом

Они это сделали с помощью AlphaProof Nexus - фреймворка для автоматического поиска формальных математических доказательств с помощью LLM в связке с верификатором Lean 4.

Недавно мы писали про формальную верификацию здесь.

Надо отметить разницу с работами OpenAI
, которые тоже говорят о решении задач Эрдёша.

Кроме Google все пишут решения на естественном языке, которые требуют экспертной проверки. А Google использует верификацию автоматическую Lean, где каждый шаг автоматически верифицируется компилятором.

Отметим, что ранее Google запустили коллекцию нерешенных математических задач на Lean.

В итоге из 353 открытых задач Эрдёша AlphaProof Nexus автономно решила 9, включая 2 задачи, открытые с 1970 года. И все это обошлось в несколько сотен $ за задачу.

Отдельно про Nexus читайте тут.

Google DeepMind построили и сравнили 4 конфигурации:

1. Базовый агент - набор независимых подагентов, которые в цикле.

2. Базовый + AlphaProof к базовому добавляется возможность вызывать AlphaProof как инструмент для закрытия отдельных подцелей.

3. Базовый + эволюция - ИИ-агенты работают с общей базой набросков, ранжируют их по Elo через LLM-критика (Gemini Flash), используют алгоритм P-UCB для выбора перспективных направлений.

4. Полная система - комбинация всего: AlphaProof + эволюция + Elo-рейтинги.

Авторы говорят, что базовый агент решил все 9 задач Эрдёша, хотя изначально они запускали полную систему именно потому, что простые агенты плохо работали на соревновательных бенчмарках.

Это означает, что по мере роста базовых способностей LLM сложные архитектуры теряют преимущество на средних задачах.

Полная система остаётся лучше только на самых сложных, там она в 2-5 раз дешевле по стоимости успешного доказательства.

2.3k 2 27 13
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot