Совет из моделей: зачем я собрал консилиум нейросетей
Недавно пересел на Orca как на оркестратор — и это редкий случай, когда инструмент прям заходит. Несколько папок, куча параллельных агентов, каждый в своём git worktree, удобный MD-редактор, встроенный браузер. Всё в одном окне, ничего не теряется.
И вот там я наткнулся на штуку, которая поменяла мой подход. Через Orca можно запустить рой агентов, которые проверяют и доделывают работу друг друга: управляющий раздаёт задачу дочерним (Claude Code, Codex, Grok), ждёт их анализ и сводит результат.
Смотрю на это и ловлю дежавю — где-то я такое уже видел. Ну конечно: LLM Council Карпатого. Та же механика, только в чате: вопрос уходит нескольким моделям, каждая отвечает сама, потом анонимно рецензирует чужие ответы, а «председатель» сводит вердикт. Тогда показалось игрушкой. А тут дошло, зачем оно на самом деле.
Модель с контекстом будет поддакивать сама себе. Она уже приняла решение, вложилась в него — и на вопрос «всё ли ок?» радостно ответит, что всё ок. Нужен второй взгляд без этого багажа: модель, которая не защищает своё решение, а разбирает чужое.
И это не просто ощущение — это замерено. Together AI в работе Mixture-of-Agents собрали слоёный «совет» из открытых моделей среднего калибра: Qwen-110B, Llama-3-70B, WizardLM, Mixtral. На AlpacaEval 2.0 эта сборка выдала 65,1% против 57,5% у GPT-4o — тогдашнего флагмана. Поодиночке ни одна из них к нему даже не приближалась. Кучка средних умов с разными датасетами обучения обошла передовую модель — именно за счёт того, что смотрели на задачу по-разному и правили слепые зоны друг друга.
Я под это сделал кастомный скилл, называется «совет». Но запускаю его далеко не всегда. В большинстве случаев зарядил одну флагманскую модель — и она себе спокойно работает. Совет на рутине — вчетверо дороже, втрое дольше, а прироста ноль.
Окупается он на дорогих развилках: выбор архитектуры, схема данных, которую потом не переделать, решение, которое сам не можешь оценить.
С насморком консилиум не собирают. А перед операцией второе мнение — нормальная практика.
Я, например, DeepSeek'у архитектуру не доверю, а OpenAI после 5.5 реабилитировал. А вы каких «врачей» зовёте — и кому даёте право резать?
@analyst_exe
Недавно пересел на Orca как на оркестратор — и это редкий случай, когда инструмент прям заходит. Несколько папок, куча параллельных агентов, каждый в своём git worktree, удобный MD-редактор, встроенный браузер. Всё в одном окне, ничего не теряется.
И вот там я наткнулся на штуку, которая поменяла мой подход. Через Orca можно запустить рой агентов, которые проверяют и доделывают работу друг друга: управляющий раздаёт задачу дочерним (Claude Code, Codex, Grok), ждёт их анализ и сводит результат.
Смотрю на это и ловлю дежавю — где-то я такое уже видел. Ну конечно: LLM Council Карпатого. Та же механика, только в чате: вопрос уходит нескольким моделям, каждая отвечает сама, потом анонимно рецензирует чужие ответы, а «председатель» сводит вердикт. Тогда показалось игрушкой. А тут дошло, зачем оно на самом деле.
Модель с контекстом будет поддакивать сама себе. Она уже приняла решение, вложилась в него — и на вопрос «всё ли ок?» радостно ответит, что всё ок. Нужен второй взгляд без этого багажа: модель, которая не защищает своё решение, а разбирает чужое.
И это не просто ощущение — это замерено. Together AI в работе Mixture-of-Agents собрали слоёный «совет» из открытых моделей среднего калибра: Qwen-110B, Llama-3-70B, WizardLM, Mixtral. На AlpacaEval 2.0 эта сборка выдала 65,1% против 57,5% у GPT-4o — тогдашнего флагмана. Поодиночке ни одна из них к нему даже не приближалась. Кучка средних умов с разными датасетами обучения обошла передовую модель — именно за счёт того, что смотрели на задачу по-разному и правили слепые зоны друг друга.
Я под это сделал кастомный скилл, называется «совет». Но запускаю его далеко не всегда. В большинстве случаев зарядил одну флагманскую модель — и она себе спокойно работает. Совет на рутине — вчетверо дороже, втрое дольше, а прироста ноль.
Окупается он на дорогих развилках: выбор архитектуры, схема данных, которую потом не переделать, решение, которое сам не можешь оценить.
С насморком консилиум не собирают. А перед операцией второе мнение — нормальная практика.
Я, например, DeepSeek'у архитектуру не доверю, а OpenAI после 5.5 реабилитировал. А вы каких «врачей» зовёте — и кому даёте право резать?
@analyst_exe