что-то котики затупили и картинку не сменили)
У длинных задач у LLM-агента есть отдельная проблема: проверить финальный ответ недостаточно, потому что ошибка могла появиться десять шагов назад. VeriHarness посвящён масштабированию именно такой проверки для long-horizon задач.
Самая конкретная цифра в описании относится к evidence-backed revision. Когда агент получает возможность пересмотреть результат, опираясь на собранные свидетельства, прирост над одним rollout составил 6,2 пункта для Gemini 3.5 Flash и 6,4 пункта для Claude Opus 4.8.
Это хороший сдвиг в постановке: верификатор здесь не просто ставит оценку готовому тексту, а участвует в цикле исправления. При этом авторы формулируют результаты как улучшение на своих экспериментах, а не как гарантию для любых многошаговых сценариев. Для агентных систем это, пожалуй, более трезвая идея, чем надеяться, что первый длинный ответ случайно окажется правильным.
Источник: arXiv == https://arxiv.org/abs/2610.00972
Велкам
У длинных задач у LLM-агента есть отдельная проблема: проверить финальный ответ недостаточно, потому что ошибка могла появиться десять шагов назад. VeriHarness посвящён масштабированию именно такой проверки для long-horizon задач.
Самая конкретная цифра в описании относится к evidence-backed revision. Когда агент получает возможность пересмотреть результат, опираясь на собранные свидетельства, прирост над одним rollout составил 6,2 пункта для Gemini 3.5 Flash и 6,4 пункта для Claude Opus 4.8.
Это хороший сдвиг в постановке: верификатор здесь не просто ставит оценку готовому тексту, а участвует в цикле исправления. При этом авторы формулируют результаты как улучшение на своих экспериментах, а не как гарантию для любых многошаговых сценариев. Для агентных систем это, пожалуй, более трезвая идея, чем надеяться, что первый длинный ответ случайно окажется правильным.
Источник: arXiv == https://arxiv.org/abs/2610.00972
Велкам