TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
TeamLead Сonf

16 Sep, 16:22

Open in Telegram Share Report

Лучший coding agent в новом тесте на закрытых production-кодовых базах решил 38,8% задач.

В свежем дайджесте — материалы о том, что идёт дальше: как проверять результат, контролировать агентов в production, разбирать сбои, считать расходы и вести технические обсуждения.

1️⃣ Introducing Real-SWE.
Бенчмарк проверяет coding agents на задачах из закрытых production-кодовых баз: от расчёта налогов до миграции клиентов. Шесть из десяти задач решались менее чем в 15% запусков; среди частых причин неудач — пропущенные требования и непроверенные предположения.

2️⃣ New Harness Report Reveals Enterprise Confidence in AI Agents Isn't Backed by Real Controls.
Опрос 700 специалистов из крупных компаний сравнивает уверенность в AI-агентах с реальными механизмами контроля. Разрыв виден сразу в нескольких областях: 74% респондентов считают, что тестирование обнаружит опасный сбой до релиза, но автоматическая блокировка неудачного релиза есть у 19%.

3️⃣ Session Traces and Cost Controls Help Diagnose AI Agent Failures.
Как понять, почему агент зациклился, выбрал неверный инструмент или начал слишком быстро расходовать токены? В материале разбирают трассировку вызовов, ограничения на количество итераций, контроль повторяющихся запросов и поиск аномалий в расходах.

4️⃣ The Pulse: tech companies move to open AI models.
Гергели Орос собрал примеры Uber, Pinterest, AT&T и других компаний, которые используют открытые модели и маршрутизацию запросов. Uber снизил стоимость AI-сессии на 52%, а AT&T сократила расходы на отдельные задачи до 56% при снижении качества на 2%.

5️⃣ How to lead a technical discussion.
Руководителю технического обсуждения необязательно знать правильный ответ заранее. Автор показывает, как задать цель встречи, сделать знания команды видимыми, зафиксировать неизвестные и превратить возражения в предположения, которые можно проверить.

AI не снимает с команды ответственность за результат. Он добавляет новые места, где нужны проверка и ясные решения ✅

972 0 6
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot