Ревью коммитов. Claude - мсье синиор, а gemini и codex джунята?
Сейчас эксперементирую с агентами-ревьюверами.
Флоу такой - Claude (opus 4.8) исполняет всю основу, периодически спрашивает у фейбла ревью планов, а на коммитах в репозиторий (через хук) вызывается .sh скрипт, который дёргает двух ревьюверов (5 моделей) :
- gemini (flash 3.5 и 3.1 pro)
- codex (Sol, Terra, Luna)
Claude скармливает им диффы изменений и передаёт контекст изменений. После чего адьютирует их ответы, делает выводы о правильности находок и либо отклоняет, либо перерабатывает и снова на ре-ревью (лимит в 3 хопа).
Работает замечательно. Gemini модельки показывают хороший перфоманс и относительно дёшевы (на моих объёмах вайбкодинга выходит около 20$).
Модельки от open ai пытался через api дёргать (5.3 и 5.4 mini) - обе не показали себя с хорошей стороны (mini слишком тупая, много false-positive, а 5.3 жрала больше gemini и эффективность была ниже).
Сейчас же, с новыми моделями open ai, я подумал, что докупить подпискочку за 20$ и "запрячь" все три модели - является отличной идеей.
Я параллельно собираю статистику по всем моделям, через месяцок приду со статистикой по эффективности.
Есть ощущение, что от gemini оставлю только дешёвый и качественный flash и буду юзать codex.
Сейчас эксперементирую с агентами-ревьюверами.
Флоу такой - Claude (opus 4.8) исполняет всю основу, периодически спрашивает у фейбла ревью планов, а на коммитах в репозиторий (через хук) вызывается .sh скрипт, который дёргает двух ревьюверов (5 моделей) :
- gemini (flash 3.5 и 3.1 pro)
- codex (Sol, Terra, Luna)
Claude скармливает им диффы изменений и передаёт контекст изменений. После чего адьютирует их ответы, делает выводы о правильности находок и либо отклоняет, либо перерабатывает и снова на ре-ревью (лимит в 3 хопа).
Работает замечательно. Gemini модельки показывают хороший перфоманс и относительно дёшевы (на моих объёмах вайбкодинга выходит около 20$).
Модельки от open ai пытался через api дёргать (5.3 и 5.4 mini) - обе не показали себя с хорошей стороны (mini слишком тупая, много false-positive, а 5.3 жрала больше gemini и эффективность была ниже).
Сейчас же, с новыми моделями open ai, я подумал, что докупить подпискочку за 20$ и "запрячь" все три модели - является отличной идеей.
Я параллельно собираю статистику по всем моделям, через месяцок приду со статистикой по эффективности.
Есть ощущение, что от gemini оставлю только дешёвый и качественный flash и буду юзать codex.