Microsoft выступил Капитаном Очевидностью против откровенного мошенничества вендоров
LLM, когда они обучают ИИ на специальных агентах, чтобы выбить много «попугаев» в табличках бенчмарков, а реально выдают разработчикам совсем других агентов, которые не приближаются к показателям из бенчей.
В чём-то эту тенденцию сломал
DeepSeek, который впервые стал и обучать, и тестировать
LLM на своём
DeepSeek Harness. Вы можете быть уверены, что в
DSH эта
LLM выбивает бенчи, что показывают маркетологи.
Самая большая разница тут у
Anthropic с SWE-тестами типа
SWE Bench. Просто там манипуляции с бенчами были такие, что Дарио решил даже раскрыть, как это делает, т.к. если бы он скрыл и его поймали, то его бы объявили мошенником. Конечно, никакого
Claude Code нет там и близко. Если брать
SWE Bench, то стандартное тестирование требует
Zero Agent, т.е. у которого есть только Bash и средство редактирования текстового файла и ВСЁ. До
DSH именно на
Zero Agent и показывал бенчи
DeepSeek. На деле такой сверхлёгкий агент обычно и применяется для обучения
LLM, т.к. там очень критична скорость работы обвязки, чтобы суперкластер не ждал агента даже миллисекунды.
В чём разница SWE-агентов
Anthropic для бенчей от
Claude Code? Если почитать «статьи под звёздочкой», то там видны такие приёмы в основном:
1.
Brute Force по дереву вариантов решений. Идея на деле классическая: строится
Decision Tree, далее сканируются его ветки субагентами. Это работает уже 2 года для получения лидерских бенчей, но создаёт чудовищный перерасход токенов, несовместимый с нормальной эксплуатацией.
2. «Временные и изоляционные тесты». Это интересный приём, и странно, почему вендоры
LLM его как-то в конечные агенты не перекладывают. Для
LLM для фикса бага очень важно обрубить лишние семантические связи, т.е. изолировать его. Для этого тот же
Claude обучен писать специальные «тесты на изоляцию» и другие «динамические тесты». После фикса он их удаляет. Эти тесты полностью не совпадают по логике с
TDD и классикой автотестов, ну и что? Значит, надо меньше молиться на
TDD и автотесты и применять передовое ИИ-тестирование, раз оно как раз работает. Что это «выглядит необычно для разработчиков» — то проблемы разработчиков: надо обучить новой технологии, а не скрывать её от них.
Но основной инсайт тут в том, что никакой оптимизации
Claude на
Claude Code на
Reinforcement Learning нет, есть загрузки сессий на
SFT, но это не то же самое, что
RL-обучение, а скорее нейросеть запоминает типовые фиксы и типовое поведение. Именно запоминает, генерализует, но не понимает с той глубиной, как это на
RL получается. Поэтому в новом виде бага или доработки такое обучение не сработает.
https://arxiv.org/abs/2608.17528