Ещё один квартал ожидания светлого AI-будущего
Заметил, что мы оцениваем языковые модели по критериям которые не имеют прямого отношения к качеству результата. Очень ждем обновлений ЛЛМ в надежде, что вот-вот и мы окажемся в светлом ИИ будущем, где агенты вершат правосудие и стоят в очереди АСГМ.
Вчера произошла утечка Claude Code (512 000 строк кода которые Anthropic случайно опубликовала в открытый доступ) «Ты прав, это была моя ошибка, хочешь я верну все как было?». Код моментально проанализировали (даже пересобранное репо на гитхабе набрало 100к+ звезд). Подтвердилось то о чем мы с вами говорим:
1. Преимущество не в модели, а в архитектуре
Claude Code работает лучше конкурентов, потому что правильно устроена обвязка вокруг модели - кэширование, память, параллельные агенты.
Можно взять более дешёвую модель и получить сопоставимый результат за счёт правильной архитектуры. Не всегда стоит ожидать новых моделей или вкладывать большой бюджет, чтобы ваше решение дало качественный результат.
2. Два режима работы (большинство путает Агентность и Пайплайн)
Имеем четкое разделение:
➡️Пайплайн - жёсткий порядок действий. Пришёл договор → чеклист → отчёт. Предсказуемо и дёшево.
➡️Агент - следующий шаг зависит от результата предыдущего. Нашёл судебные дела → копает связанные компании → оценивает риски с учётом найденного.
Простое правило: можешь нарисовать блок-схему до того как увидел документ - нужен Пайплайн. Блок-схема зависит от содержания - нужен агент.
3. Мультиагентная оркестрация (три задачи по цене одной)
Большинство AI-систем запускают агентов последовательно или параллельно но каждый платит полную цену за понимание контекста заново.
В Claude Code агенты получают готовый контекст от родителя без повторных вычислений. Пока один анализирует договор — второй параллельно проверяет контрагента, третий ищет судебную практику.
Для юридического проекта параллельный анализ может обходиться примерно как последовательный. Стоимость проектов при таком подходе должна уменьшиться.
4. 29% ложных утверждений у текущей модели
Внутренние бенчмарки Anthropic показывают регрессию с 16% до 29% галлюцинаций в последней версии. RAG будет жить)
5. И на горизонте KAIROS
В утечке нашли готовую, но не выпущенную функцию: фоновый агент который работает пока ты не за компьютером. Мониторит изменения, обновляет статусы задач, консолидирует память сессий. Единственный вопрос - как KAIROS будет вести себя с теми же 29% галлюцинаций без человека в контуре
Предлагаю перестать ожидать новых умных моделей с целью закрыть свои потребности, сравнивать имеющиеся друг с другом, а создавать индивидуальную методологию, оркестровые системы и определять необходимость и цели использования.
Заметил, что мы оцениваем языковые модели по критериям которые не имеют прямого отношения к качеству результата. Очень ждем обновлений ЛЛМ в надежде, что вот-вот и мы окажемся в светлом ИИ будущем, где агенты вершат правосудие и стоят в очереди АСГМ.
Вчера произошла утечка Claude Code (512 000 строк кода которые Anthropic случайно опубликовала в открытый доступ) «Ты прав, это была моя ошибка, хочешь я верну все как было?». Код моментально проанализировали (даже пересобранное репо на гитхабе набрало 100к+ звезд). Подтвердилось то о чем мы с вами говорим:
1. Преимущество не в модели, а в архитектуре
Claude Code работает лучше конкурентов, потому что правильно устроена обвязка вокруг модели - кэширование, память, параллельные агенты.
Можно взять более дешёвую модель и получить сопоставимый результат за счёт правильной архитектуры. Не всегда стоит ожидать новых моделей или вкладывать большой бюджет, чтобы ваше решение дало качественный результат.
2. Два режима работы (большинство путает Агентность и Пайплайн)
Имеем четкое разделение:
➡️Пайплайн - жёсткий порядок действий. Пришёл договор → чеклист → отчёт. Предсказуемо и дёшево.
➡️Агент - следующий шаг зависит от результата предыдущего. Нашёл судебные дела → копает связанные компании → оценивает риски с учётом найденного.
Простое правило: можешь нарисовать блок-схему до того как увидел документ - нужен Пайплайн. Блок-схема зависит от содержания - нужен агент.
3. Мультиагентная оркестрация (три задачи по цене одной)
Большинство AI-систем запускают агентов последовательно или параллельно но каждый платит полную цену за понимание контекста заново.
В Claude Code агенты получают готовый контекст от родителя без повторных вычислений. Пока один анализирует договор — второй параллельно проверяет контрагента, третий ищет судебную практику.
Для юридического проекта параллельный анализ может обходиться примерно как последовательный. Стоимость проектов при таком подходе должна уменьшиться.
4. 29% ложных утверждений у текущей модели
Внутренние бенчмарки Anthropic показывают регрессию с 16% до 29% галлюцинаций в последней версии. RAG будет жить)
5. И на горизонте KAIROS
В утечке нашли готовую, но не выпущенную функцию: фоновый агент который работает пока ты не за компьютером. Мониторит изменения, обновляет статусы задач, консолидирует память сессий. Единственный вопрос - как KAIROS будет вести себя с теми же 29% галлюцинаций без человека в контуре
Предлагаю перестать ожидать новых умных моделей с целью закрыть свои потребности, сравнивать имеющиеся друг с другом, а создавать индивидуальную методологию, оркестровые системы и определять необходимость и цели использования.