А вот и запись genai апдейтов
https://www.youtube.com/watch?v=RB74Me3_prs
Четыре месяца назад Байрам предсказал, что скорость удвоения возможностей AI ускорится. Сегодня — апдейт: бенчмарк, по которому это измеряли, сломался. Модели стали слишком умны для линейки, которой их мерили.
Что произошло за 4 месяца — и почему вы это почти не чувствуете на своей компании.
Что внутри:
— Reward hacking: почему публичным бенчмаркам больше нельзя доверять и что делать вместо них
— Инцидент OpenAI × HuggingFace: агент сбежал из изолированной среды, скоординировался с другими агентами, вышел в интернет и взламывал HuggingFace больше месяца — пока это заметили
— Генералист с AI бьёт специалиста c AI: исследование Anthropic — три PhD без узкой специализации выигрывают у трёх PhD-экспертов с моделью
— Self-improvement: агенты начинают улучшать сами себя — где сейчас граница и что это значит для нас
— Диссонанс: средняя компания тратит $12 в месяц на AI на сотрудника, топ 1% — $7400. Разница в 600 раз — и почему это объясняет всё
— Кейс Glean: CEO навайбкодил за 2 дня то, что команда делала 9 месяцев. Что пошло не так дальше
— Harness важнее модели: почему правильная обвязка даёт в 8 раз больше разницы, чем выбор модели
— AI security trifecta: три условия, при которых ваш агент становится опасным — и как это балансировать
— Приватные эвалы: почему нужна своя система оценки моделей и как её построить
— Политика и fallback: что делать, если ваш основной AI-провайдер внезапно стал недоступен
https://www.youtube.com/watch?v=RB74Me3_prs