TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Пока вы спали, нейронка думала

29 Apr 2025, 17:32

Open in Telegram Share Report

AI-агенты в реальном мире: почему они не работают и как это исправить

→ Хабр

Исследование показывает, что большинство AI-агентов не оправдывают ожиданий при внедрении из-за фундаментальных проблем оценки и надёжности. Для создания реально работающих систем разработчикам необходимо сменить фокус с расширения возможностей на обеспечение «пяти девяток» надёжности.

Статья на основе презентации от Sayash Kapoor (соавтор книги и популярного блога «AI Snake Oil», один из самых влиятельных людей в сфере ИИ по версии TIME), очень наглядно и точно открывает проблемы, которые стоят перед AI-агентами и AI-инженерами. Очень рекоменду к чтению/просмотру.

⭕️ Проблемы оценки — Громкие заявления разбиваются о реальность при детальной проверке.
— Стэнфордские исследователи выявили галлюцинации в "безошибочных" юридических AI.
— Лучшие научные агенты воспроизводят менее 40% опубликованных результатов.
— Sakana.ai заявила о 150-кратном ускорении CUDA-ядер сверх теоретического максимума.

◾️ Бенчмарки обманчивы — Агенты Cognition получили $175 млн при оценке $2 млрд за успехи в S-bench.
— Но в реальном использовании их Devin преуспел только в 3 из 20 задач.
— Claude 3.5 и OpenAI o1 показывают равную точность, но разницу в цене в 11 раз ($57 vs $664).
— Чем больше снижается стоимость LLM, тем выше общее потребление (парадокс Джевонса).

🔹 Надёжность vs возможности — 90% точности недостаточно для коммерческих продуктов.
— Агент с 80% точностью заказов еды — катастрофический провал для пользователя.
— Верификаторы тоже несовершенны: в бенчмарках кода бывают ложноположительные тесты.
— Нужно инженерное мышление первых разработчиков компьютеров с вакуумными лампами.

Видео

→ Все статьи

1.3k 0 20 7
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot