Держите 2 способа, как сделать ИИ-агента умнее: NVIDIA учит модель, а Microsoft - документ
На этой неделе вышли сразу 2 интересные работы об обучении агентов:
NVIDIA выпустили Polar - инфраструктура для RL-обучения любого агента. Не нужно переписывать Claude Code, Codex или LangChain под конкретный фреймворк. Polar перехватывает API-трафик между агентом и моделью через прокси и строит из него траектории для обучения. Агент работает без изменений кода, веса модели обновляются через GRPO.
А Microsoft выпустили SkillOpt - модель и код не трогает вообще. Вместо этого тренирует текстовый документ с навыком.
На этой неделе вышли сразу 2 интересные работы об обучении агентов:
NVIDIA выпустили Polar - инфраструктура для RL-обучения любого агента. Не нужно переписывать Claude Code, Codex или LangChain под конкретный фреймворк. Polar перехватывает API-трафик между агентом и моделью через прокси и строит из него траектории для обучения. Агент работает без изменений кода, веса модели обновляются через GRPO.
А Microsoft выпустили SkillOpt - модель и код не трогает вообще. Вместо этого тренирует текстовый документ с навыком.