2 свежих кейса: как делать ИИ-агентов быстрее и дешевле без смены модели
DoorDash поделились примером, как перестать зависеть от выбора ИИ-моделей.
Команда построила DashBench - бенчмарк под свою кодовую базу, и это дало им независимость от моделей. С DashBench они обнаружили, что Kimi K2 + Fable 5 уже обходит их текущий харнесс.
Из этого вытекает вывод, что проблема не в ИИ-модели, а в харнессе и в том, как оценивать результат.
Это яркая иллюстрация ко вчерашнему нашему посту.
И ещё один кейс от компании RightNow AI, они создали компилятора агентного поведения, который доказывает тоже самое, но с другой стороны стека.
Их AUTO записывает живые прогоны агента, находит детерминированные паттерны и компилирует их в верифицированный артефакт.
Стоимость задачи падает очень сильно. Но главное - это не мощность модели решает, остаётся ли система корректной, а точность калибровки и верность оценщика.
DoorDash поделились примером, как перестать зависеть от выбора ИИ-моделей.
Команда построила DashBench - бенчмарк под свою кодовую базу, и это дало им независимость от моделей. С DashBench они обнаружили, что Kimi K2 + Fable 5 уже обходит их текущий харнесс.
Из этого вытекает вывод, что проблема не в ИИ-модели, а в харнессе и в том, как оценивать результат.
Это яркая иллюстрация ко вчерашнему нашему посту.
И ещё один кейс от компании RightNow AI, они создали компилятора агентного поведения, который доказывает тоже самое, но с другой стороны стека.
Их AUTO записывает живые прогоны агента, находит детерминированные паттерны и компилирует их в верифицированный артефакт.
Стоимость задачи падает очень сильно. Но главное - это не мощность модели решает, остаётся ли система корректной, а точность калибровки и верность оценщика.