Опыт теперь не стирается вместе с чатом: главное за неделю в ИИАналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 27 по 31 июля🟥
Monash University и ByteDance Seed представили Experience Distillation (EDP) — метод, который сохраняет опыт ИИ-агента прямо в параметрах модели.
Проблема современных агентов: они хорошо учатся на собственном опыте, пока он лежит в контекстном окне. Но история взаимодействия исчезает, и модель теряет все приобретённые знания. Простое дообучение на собранных примерах почти не помогает.
EPD решает это иначе: сначала исследователи запускают агента в среде и собирают одну траекторию его действий, затем в каждой точке траектории модель-учитель видит всю историю и выбирает лучшее следующее действие. На этих действиях учится модель-студент, но уже без доступа к прошлому опыту. Так знания переходят в веса модели, и она начинает принимать более правильные решения сама.
Метод заметно обгоняет классическое обучение. На задачах программирования SWE точность выросла с 5,3% до 51,4% и сохранила почти 65% преимуществ, которые давал полный контекст опыта. На игровом бенчмарке TaleSuite агент удержал больше 93% эффекта обучения на опыте.
Почему это важно: опыт агента переходит в веса модели — его не нужно держать в контексте и оплачивать при каждом запуске. Для бизнеса это прямое снижение стоимости эксплуатации агентных систем: EPD потребовал почти в десять раз меньше взаимодействий со средой, чем методы обучения с подкреплением, а на некоторых задачах — более чем в 57 раз меньше. Агент дешевле в эксплуатации и улучшается сам, без отдельного контура дообучения.
🟥
Исследователи из BAAI рассказали об AREX — ИИ-агенте для глубоких исследований. Он работает итерациями. Сначала ищет информацию, изучает источники и формирует предварительный ответ. Затем проверяет, насколько ответ отвечает каждому требованию задачи. Нашёл слабые места — сохраняет полезные находки и превращает нерешённые вопросы в план следующего этапа, вместо того чтобы начинать всё заново.
AREX периодически сжимает историю работы в компактное состояние: подтверждённые факты, отвергнутые гипотезы, открытые вопросы и план действий. Так агент справляется с длинными исследовательскими задачами и не теряет важное.
Агента обучали в три этапа: сначала на синтетических примерах, затем в режиме агента с поиском и рассуждениями, в конце — обучение с подкреплением. Оно поощряло шаги, которые находили ключевые факты или исправляли ошибочное направление поиска.
AREX-Base показал лучшие или одни из лучших результатов на нескольких бенчмарках для глубоких исследований — обошёл GPT-5.4, GLM-5, Qwen3.5 и ряд других моделей. Основной прирост дают два механизма: сжатие контекста и внешний цикл самосовершенствования. Без них точность падала до 59,6%, с обоими выросла до 82,5%.
Почему это важно: агент повышает качество исследования проверкой промежуточных результатов, а не просто наращиванием объёма поиска — стоимость задачи остаётся предсказуемой и не растёт бесконтрольно.
Также на неделе:
• Hugging Face опубликовала подробный разбор инцидента безопасности, который устроил ИИ-агентом OpenAI
• Anthropic представил работу, которая объясняет, когда внутренние рассуждения языковой модели влияют на ее ответы, а когда являются лишь сопутствующим текстом
• OpenAI открыла исходный код Codex Security CLI
• Moonshot AI опубликовала веса и технический отчёт по Kimi K3
• Thinking Machines Lab выпустила модель Inkling-Small
• Сотрудники передовых ИИ-лабораторий подписали петицию о создании решений для замедления ИИ
• Ant Group представила модель Ling-3.0-Flash для создания ИИ-агентов
• Microsoft выпустила MAI-Cyber-1-Flash — свою первую специализированную модель для кибербезопасности, интегрированную в агентную систему MDASH для поиска уязвимостей в ПО
#AI_moment #трендвотчинг
↗️
red_mad_robot