TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
analyst_exe | инженерное мышление в IT

13 Jul, 16:57

Открыть в Telegram Поделиться Пожаловаться

Совет из моделей: зачем я собрал консилиум нейросетей

Недавно пересел на Orca как на оркестратор — и это редкий случай, когда инструмент прям заходит. Несколько папок, куча параллельных агентов, каждый в своём git worktree, удобный MD-редактор, встроенный браузер. Всё в одном окне, ничего не теряется.

И вот там я наткнулся на штуку, которая поменяла мой подход. Через Orca можно запустить рой агентов, которые проверяют и доделывают работу друг друга: управляющий раздаёт задачу дочерним (Claude Code, Codex, Grok), ждёт их анализ и сводит результат.

Смотрю на это и ловлю дежавю — где-то я такое уже видел. Ну конечно: LLM Council Карпатого. Та же механика, только в чате: вопрос уходит нескольким моделям, каждая отвечает сама, потом анонимно рецензирует чужие ответы, а «председатель» сводит вердикт. Тогда показалось игрушкой. А тут дошло, зачем оно на самом деле.

Модель с контекстом будет поддакивать сама себе. Она уже приняла решение, вложилась в него — и на вопрос «всё ли ок?» радостно ответит, что всё ок. Нужен второй взгляд без этого багажа: модель, которая не защищает своё решение, а разбирает чужое.

И это не просто ощущение — это замерено. Together AI в работе Mixture-of-Agents собрали слоёный «совет» из открытых моделей среднего калибра: Qwen-110B, Llama-3-70B, WizardLM, Mixtral. На AlpacaEval 2.0 эта сборка выдала 65,1% против 57,5% у GPT-4o — тогдашнего флагмана. Поодиночке ни одна из них к нему даже не приближалась. Кучка средних умов с разными датасетами обучения обошла передовую модель — именно за счёт того, что смотрели на задачу по-разному и правили слепые зоны друг друга.

Я под это сделал кастомный скилл, называется «совет». Но запускаю его далеко не всегда. В большинстве случаев зарядил одну флагманскую модель — и она себе спокойно работает. Совет на рутине — вчетверо дороже, втрое дольше, а прироста ноль.

Окупается он на дорогих развилках: выбор архитектуры, схема данных, которую потом не переделать, решение, которое сам не можешь оценить.

С насморком консилиум не собирают. А перед операцией второе мнение — нормальная практика.

Я, например, DeepSeek'у архитектуру не доверю, а OpenAI после 5.5 реабилитировал. А вы каких «врачей» зовёте — и кому даёте право резать?

@analyst_exe

322 0 5 2 5
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot