CoRT: награда для LLM больше не размазывается по всему ответу
В обучении с рубриками ответ модели оценивают сразу по нескольким критериям: точность, формат, стиль и полнота.
Проблема в том, что методы вроде GRPO обычно превращают эти оценки в одно число. В результате одинаковый сигнал получают все токены ответа — и полезные, и ошибочные.
CoRT распределяет награду точнее.
Один и тот же ответ оценивается в двух условиях:
- с исходным промптом и критериями;
- с похожим промптом, но без критериев.
Затем метод сравнивает вероятность каждого токена.
Если токен стал заметно вероятнее благодаря рубрике, значит он связан с её требованиями и получает больший вес при обновлении модели.
CoRT при этом:
- не требует отдельной модели для оценки токенов;
- не использует ручную разметку;
- не меняет итоговую награду за весь ответ;
- не запускает дополнительную генерацию;
- добавляет только один проход для пересчёта вероятностей.
В экспериментах метод в большинстве сравнений обошёл обычный response-level GRPO. Средний прирост составил 4,4 процентного пункта.
Идея простая: если критерий выполнили конкретные части ответа, основную награду должны получать именно они.
Paper:
https://huggingface.co/papers/2607.25659
В обучении с рубриками ответ модели оценивают сразу по нескольким критериям: точность, формат, стиль и полнота.
Проблема в том, что методы вроде GRPO обычно превращают эти оценки в одно число. В результате одинаковый сигнал получают все токены ответа — и полезные, и ошибочные.
CoRT распределяет награду точнее.
Один и тот же ответ оценивается в двух условиях:
- с исходным промптом и критериями;
- с похожим промптом, но без критериев.
Затем метод сравнивает вероятность каждого токена.
Если токен стал заметно вероятнее благодаря рубрике, значит он связан с её требованиями и получает больший вес при обновлении модели.
CoRT при этом:
- не требует отдельной модели для оценки токенов;
- не использует ручную разметку;
- не меняет итоговую награду за весь ответ;
- не запускает дополнительную генерацию;
- добавляет только один проход для пересчёта вероятностей.
В экспериментах метод в большинстве сравнений обошёл обычный response-level GRPO. Средний прирост составил 4,4 процентного пункта.
Идея простая: если критерий выполнили конкретные части ответа, основную награду должны получать именно они.
Paper:
https://huggingface.co/papers/2607.25659