Свежая и крутая идея как ИИ-агентов научить быть эффективными
Исследователи из University of Tübingen придумали способ заставить LLM намного лучше учиться играть в игры/решать задачи, где нужно долго собирать информацию, задавать вопросы и постепенно приближаться к ответу.
Они предлагают ∆Belief-RL - использовать собственные внутренние убеждения модели как источник плотной награды на каждом шаге.
Результаты очень сильные для 2026 года:
- Небольшая модель Qwen3-1.7B натренированная таким способом, обгоняет DeepSeek v3.2 670B в задачах активного поиска информации.
- Хорошо обобщается на задачи, которых вообще не было в обучении.
- Чем больше модель взаимодействует на тесте, тем лучше становится.
- Работает в синтетических играх (20 Questions и аналоги), но идея заявлена как довольно универсальная.
Очень интересная и свежая идея в этом году, когда уже понятно, что просто увеличивать размер LLM недостаточно для настоящих долго работающих агентов.
Исследователи из University of Tübingen придумали способ заставить LLM намного лучше учиться играть в игры/решать задачи, где нужно долго собирать информацию, задавать вопросы и постепенно приближаться к ответу.
Они предлагают ∆Belief-RL - использовать собственные внутренние убеждения модели как источник плотной награды на каждом шаге.
Результаты очень сильные для 2026 года:
- Небольшая модель Qwen3-1.7B натренированная таким способом, обгоняет DeepSeek v3.2 670B в задачах активного поиска информации.
- Хорошо обобщается на задачи, которых вообще не было в обучении.
- Чем больше модель взаимодействует на тесте, тем лучше становится.
- Работает в синтетических играх (20 Questions и аналоги), но идея заявлена как довольно универсальная.
Очень интересная и свежая идея в этом году, когда уже понятно, что просто увеличивать размер LLM недостаточно для настоящих долго работающих агентов.