🤖 Почему инструкция LLM «Ты — [Роль]» не сработает, а «Ты — [Имя]» может дать эффект? Сейчас время агентов на длинных траекториях, фактически на них можно влиять стартовой ролевой установкой, т.к. через 1000 ходов агент уже делает больше действий по своей инициативе, а от начальных целей дрейфует. Какие тут есть заблуждения и рабочие техники?
1. Роль не влияет на точность ответов, а скорее на стиль
Коренная причина в том, что большинство SFT и RL обучений не имеют роли как части контекста. Исследование «Style or Substance? Evaluating Expert Personas in Large Language Models» подтверждает, что роль не работает для качества выводов ИИ.
Конкретно для агентов кодирования бесполезность роли доказана исследованием «On the Limited Effect of Role Prompting in LLM-based Code Vulnerability Detection».
Роли ИИ не влияют при моделировании врачебного консенсуса («Role prompting modulates linguistic style but not clinical decision structure in GPT-5 tumour board simulation»).
2. Вы должны понимать, что агент на длинной траектории уже нечто другое, чем вы хотели
Научные работы вроде «Asymmetric Goal Drift in Coding Agents Under Value Conflict» показывают, что агенты не только просто отклоняются от заданных целей оператором, а начинают дрейфовать больше к общим целям из обучения, таким как безопасность. В целом через 1000 ходов агент уже нечто другое, чем хотел оператор — это научный консенсус (см. также «Diagnosing and Stabilising Drift in Long-Horizon Language-Model Agents», «Asymmetric Goal Drift in Coding Agents Under Value Conflict»).
3. Методы стабилизации на длинных траекториях
Довольно неожиданный вывод из «Cross-Over Trigger Function via Persona Reference Attention and Drift-Resistant Anchoring via Named-Subject Persona Reference Attention (PRACT)». Если писать «ты — сеньор программист» бесполезно, то вот дать имя агенту оказывается влияет на его стабильность, поэтому вы можете довольно часто видеть условные имена агентов у вендоров. Это довольно понятно, как работает: GPT тиражирует своё имя по контексту и через него поддерживает цепочку векторов с целостностью его как личности (персоны). Это значительно уменьшает дрейф ИИ. Примерно такие же выводы в «Cross-Model Evaluation of Symbolic Persona Anchors and Natural-Language Reminders for Long-Context Persona Preservation», но там показано, что разные модели имеют очень разную степень влияния имени агента.
В целом современные методы управления агентами на длинных траекториях вращаются вокруг понятия якорей (имя — их частный случай), технологий сжатия контекста сессии, а также контракта агента. Современный научный консенсус скорее напоминает подход DeepSeek Harness к сжатию сессий с сохранением их полного лога.
Однако более важным является подход «Якоря + Контракт» (Anchors and Contracts, AC). Тут типичный пример работы от китайских коллег: «Anchors and Contracts for Long-Horizon Practice: AC Paradigm V6 Technical Report (TRAE-Tuned)».
📌 Если подвести итог:
• Задание ролей агентам почти бесполезно, влияние их сводится к задачам где было обучение ИИ на роли прямо как в roleplay
• Задание имён агентам и применение других якорных понятий работает
• Стартовый контракт агента на сессии является более критичным, чем инструкции, как ему действовать внутри сессии, т.к. агент быстро дрейфует от skills к практикам из своего обучения
https://zenodo.org/records/20471461