Faraday от Inherent: 27-миллиардный ИИ-учёный обошёл Claude и GPT-5.5 в воспроизведении исследований
📋 Inherent,- лондонская лаборатория, основанная выходцами из Google DeepMind и в мае вышедшая из тени с посевным раундом в 50 млн долларов от Index Ventures и Radical Ventures, показала Faraday, ИИ-агента, который воспроизводит результаты научных статей без заранее известного ответа.
Агент восстановил результаты 310 задач и обошёл Claude Opus 4.8 и GPT-5.5, хотя сам работает на 27-миллиардной модели Qwen 3.6.
💡 Replica,- это собственный бенчмарк лаборатории: 310 задач из 100 статей по машинному обучению и наукам, где из статьи вырезают ключевой график с результатом, а агент должен восстановить его за 60 минут при ограниченном бюджете GPU.
На задачах машинного обучения Faraday набирает 0,856 против 0,828 у Claude Opus 4.8 и 0,796 у GPT-5.5, а на вынесенных научных задачах 0,791 против 0,748 и 0,729.
Код за него пишет Codex от OpenAI, а саму модель учили с подкреплением, награждая за «исследовательский вкус», то есть за выбор правильного эксперимента вместо подгонки под ожидаемый результат.
💼 Ставка, которую формулирует инвестор Дэнни Раймер: современный ИИ отвечает на вопросы, но не понимает, какие вопросы стоит задавать, а именно открытая любознательность породила пенициллин, микроволновку и GPU.
Цифры получены на собственном бенчмарке, независимых воспроизведений пока нет, поэтому верим, но аккуратно.
Исследовательский вкус, который ещё в июне Джек Кларк называл последним преимуществом человека, теперь становится целью обучения моделей. 🧪
📎 TechCrunch
Там мы и до ИИ озарений, глядишь, доживём.
#Inherent #наука
———
@tsingular
📋 Inherent,- лондонская лаборатория, основанная выходцами из Google DeepMind и в мае вышедшая из тени с посевным раундом в 50 млн долларов от Index Ventures и Radical Ventures, показала Faraday, ИИ-агента, который воспроизводит результаты научных статей без заранее известного ответа.
Агент восстановил результаты 310 задач и обошёл Claude Opus 4.8 и GPT-5.5, хотя сам работает на 27-миллиардной модели Qwen 3.6.
💡 Replica,- это собственный бенчмарк лаборатории: 310 задач из 100 статей по машинному обучению и наукам, где из статьи вырезают ключевой график с результатом, а агент должен восстановить его за 60 минут при ограниченном бюджете GPU.
На задачах машинного обучения Faraday набирает 0,856 против 0,828 у Claude Opus 4.8 и 0,796 у GPT-5.5, а на вынесенных научных задачах 0,791 против 0,748 и 0,729.
Код за него пишет Codex от OpenAI, а саму модель учили с подкреплением, награждая за «исследовательский вкус», то есть за выбор правильного эксперимента вместо подгонки под ожидаемый результат.
💼 Ставка, которую формулирует инвестор Дэнни Раймер: современный ИИ отвечает на вопросы, но не понимает, какие вопросы стоит задавать, а именно открытая любознательность породила пенициллин, микроволновку и GPU.
Цифры получены на собственном бенчмарке, независимых воспроизведений пока нет, поэтому верим, но аккуратно.
Исследовательский вкус, который ещё в июне Джек Кларк называл последним преимуществом человека, теперь становится целью обучения моделей. 🧪
📎 TechCrunch
Там мы и до ИИ озарений, глядишь, доживём.
#Inherent #наука
———
@tsingular