AI-агенты в реальном мире: почему они не работают и как это исправить
→ Хабр
Исследование показывает, что большинство AI-агентов не оправдывают ожиданий при внедрении из-за фундаментальных проблем оценки и надёжности. Для создания реально работающих систем разработчикам необходимо сменить фокус с расширения возможностей на обеспечение «пяти девяток» надёжности.
⭕️ Проблемы оценки — Громкие заявления разбиваются о реальность при детальной проверке.
— Стэнфордские исследователи выявили галлюцинации в "безошибочных" юридических AI.
— Лучшие научные агенты воспроизводят менее 40% опубликованных результатов.
— Sakana.ai заявила о 150-кратном ускорении CUDA-ядер сверх теоретического максимума.
◾️ Бенчмарки обманчивы — Агенты Cognition получили $175 млн при оценке $2 млрд за успехи в S-bench.
— Но в реальном использовании их Devin преуспел только в 3 из 20 задач.
— Claude 3.5 и OpenAI o1 показывают равную точность, но разницу в цене в 11 раз ($57 vs $664).
— Чем больше снижается стоимость LLM, тем выше общее потребление (парадокс Джевонса).
🔹 Надёжность vs возможности — 90% точности недостаточно для коммерческих продуктов.
— Агент с 80% точностью заказов еды — катастрофический провал для пользователя.
— Верификаторы тоже несовершенны: в бенчмарках кода бывают ложноположительные тесты.
— Нужно инженерное мышление первых разработчиков компьютеров с вакуумными лампами.
Видео
→ Все статьи
→ Хабр
Исследование показывает, что большинство AI-агентов не оправдывают ожиданий при внедрении из-за фундаментальных проблем оценки и надёжности. Для создания реально работающих систем разработчикам необходимо сменить фокус с расширения возможностей на обеспечение «пяти девяток» надёжности.
Статья на основе презентации от Sayash Kapoor (соавтор книги и популярного блога «AI Snake Oil», один из самых влиятельных людей в сфере ИИ по версии TIME), очень наглядно и точно открывает проблемы, которые стоят перед AI-агентами и AI-инженерами. Очень рекоменду к чтению/просмотру.
⭕️ Проблемы оценки — Громкие заявления разбиваются о реальность при детальной проверке.
— Стэнфордские исследователи выявили галлюцинации в "безошибочных" юридических AI.
— Лучшие научные агенты воспроизводят менее 40% опубликованных результатов.
— Sakana.ai заявила о 150-кратном ускорении CUDA-ядер сверх теоретического максимума.
◾️ Бенчмарки обманчивы — Агенты Cognition получили $175 млн при оценке $2 млрд за успехи в S-bench.
— Но в реальном использовании их Devin преуспел только в 3 из 20 задач.
— Claude 3.5 и OpenAI o1 показывают равную точность, но разницу в цене в 11 раз ($57 vs $664).
— Чем больше снижается стоимость LLM, тем выше общее потребление (парадокс Джевонса).
🔹 Надёжность vs возможности — 90% точности недостаточно для коммерческих продуктов.
— Агент с 80% точностью заказов еды — катастрофический провал для пользователя.
— Верификаторы тоже несовершенны: в бенчмарках кода бывают ложноположительные тесты.
— Нужно инженерное мышление первых разработчиков компьютеров с вакуумными лампами.
Видео
→ Все статьи