В Стэнфорде придумали, как сделать ИИ-агентов умнее без дообучения
LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает: в эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5
При этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу. Сам фреймворк бесплатный и опенсорсный
Прокачиваем агентов — здесь
Хакспейс
LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает: в эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5
При этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу. Сам фреймворк бесплатный и опенсорсный
Прокачиваем агентов — здесь
Хакспейс