Apple создала ИИ-агентов, которые меньше галлюцинируют, математика не позволяет
Смотрите, весь прошлый год мы наблюдали за соревнованием между Google и OpenAI, где они хвастались, что их модели решают сложные задачи на Олимпиадах, решают задачи Эрдеша.
Но кто проверял их работы ?
Модель могла сделать 3 логических прыжка по дороге, пропустить допущение, доказать примером, и это засчитается, потому что результат выглядит убедительно. Но в настоящем математическом доказательстве каждый шаг либо верен, либо нет.
Apple предлагают фреймворк для ИИ-агентов HILBERT, где доказательство проверяет Lean 4 - система, которую невозможно обмануть.
Hilbert - аргумент в пользу того, что архитектура агентного пайплайна сама по себе является конкурентным преимуществом. Не веса модели, ни датасет , а то, как агенты передают задачи друг другу и обрабатывают ошибки.
Apple показала рабочую модель того, как агенты могут:
- декомпозировать задачу рекурсивно
- передавать подзадачи нужному специалисту
- обрабатывать ошибки и пересобирать результат
- верифицировать каждый шаг, а не доверять на слово.
И всё это на задачах, где цена ошибки абсолютна.
Если этот принцип перенести на другие домены - код, юридические документы, научные расчёты, получаешь агентные системы, которым можно доверять не потому что "обычно работает", а потому что каждый шаг проверен.
GitHub.
Смотрите, весь прошлый год мы наблюдали за соревнованием между Google и OpenAI, где они хвастались, что их модели решают сложные задачи на Олимпиадах, решают задачи Эрдеша.
Но кто проверял их работы ?
Модель могла сделать 3 логических прыжка по дороге, пропустить допущение, доказать примером, и это засчитается, потому что результат выглядит убедительно. Но в настоящем математическом доказательстве каждый шаг либо верен, либо нет.
Apple предлагают фреймворк для ИИ-агентов HILBERT, где доказательство проверяет Lean 4 - система, которую невозможно обмануть.
Hilbert - аргумент в пользу того, что архитектура агентного пайплайна сама по себе является конкурентным преимуществом. Не веса модели, ни датасет , а то, как агенты передают задачи друг другу и обрабатывают ошибки.
Apple показала рабочую модель того, как агенты могут:
- декомпозировать задачу рекурсивно
- передавать подзадачи нужному специалисту
- обрабатывать ошибки и пересобирать результат
- верифицировать каждый шаг, а не доверять на слово.
И всё это на задачах, где цена ошибки абсолютна.
Если этот принцип перенести на другие домены - код, юридические документы, научные расчёты, получаешь агентные системы, которым можно доверять не потому что "обычно работает", а потому что каждый шаг проверен.
GitHub.