Anton Vdovitchenko — One Man Enterprise


Гео и язык канала: Россия, Русский
Категория: Технологии


Строю AI-инструменты и учу вас делать то же самое. Claude Code, AI-агенты, скиллы, автоматизация. Полезные ресурсы и рецепты. Open-source: github.com/miolamio
Рекламы в канале нет и не будет.
Автор — @codegeek

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


https://claude.dev/

Anthropic запустили отдельный сайт для тех, кто строит продукты на базе Claude Code: инженеры, команды, техлиды.

Внутри — руководства по разным насущным вопросам (например, как проектировать evals) + рекомендации лучших собаководов по использованию инструментов системы Claude Code.

Думаю, что этот ресурс заменит многочисленные разрозненные блоги и руководства, можно будет сверяться с авторами, разрабатывая продукты.

В закладки для ежедневного просмотра.


Beyond Entrepreneurship.

Много лет подряд я каждый год перечитываю одну и ту же книгу, и, удивительно, она не стареет, наверное, потому, что в неё заложены фундаментальные принципы.

Разумеется, есть некий олдскульный налёт старого (доЭйАйного) времени, но он достаточно легко преломляется через призму современности.

Всем, кто планирует открывать свой собственный бизнес или целится в концепцию ОМЕ, я настоятельно рекомендую ее прочитать.

Книга называется Beyond Entrepreneurship или в русском переводе «Больше, чем бизнес». Авторы — Джим Коллинз, Уильям Лазье.

Я даже не знаю, что ещё здесь сказать. Это одна из лучших книг, которую я могу порекомендовать вместе с Альманахом Наваля.

Всё больше и больше замечаю, что работа с агентными системами очень похожа на работу с сотрудниками в компании, но более чёткая, прямолинейная, иногда даже дерзкая.

Отдельно хочу сказать про метод чтения. Я не верю в то, что механики сжатых изложений или выжимок полезны. Если вы хотите что-то освоить, вам нужно потратить время и ПРОЧИТАТЬ это, иначе не сформируются нейронные связи, которые будут нести информацию и связи между ней.

Люди всё ещё люди.

Happy Tuesday, @aiwizards


Видео недоступно для предпросмотра
Смотреть в Telegram
О, дивный новый мир.

Помню, в стародавние «доЭлЭлЭмные» времена, когда код надо было писать руками, у меня была идея замечательного проекта для HR.

Мы тогда нанимали много разработчиков и была проблема в воронке собеседований. Заключалась она в том, что HR часто не могла самостоятельно оценить навыки кандидата во время звонка и поэтому приходилось делать второе, третье, четвертое, пятое собеседование с техлидами.

Идея была в следующем: сделать помощника предметной области для HR, который отсматривал бы транскрипт интервью прямо лайв и показывал HRу вопросы, которые необходимо задать здесь и сейчас, предполагая что в этом случае спросил бы техлид исходя из позиции.

Позже, с появлением LLM, возможность реализовать сценарий появилась, но возникли сложности с синхронностью работы, потому что модели отрабатывали довольно медленно и не могли синхронно реагировать на то, что говорит кандидат.

Вчера нашел замечательный проект, где при помощи Jev происходит классификация реплик потенциального клиента в реальном времени, после чего ему выдаются фразы, которые нужно произнести для закрытия сделки.

Ровно этого ведется мониторинг и показывается примерный процент успешности сделки на текущий момент.

Я думаю, что подобные продукты могут настолько сильно заполонить без исключения все коммуникационные каналы, что скоро искусство качественных продаж будет доступно повсеместно и всем.

Вот код проекта, можно побаловаться: https://github.com/moritzkremb/jev-sales-copilot

А вот тут, кстати, много идей для вдохновения.

Happy Thursday, @aiwizards


Сколько вы лично (из своего кармана, не за счёт компании) тратите в месяц на AI: подписки, API, VPN/прокси, VPS, сервисы?
Опрос
  •   $0: всё бесплатно, сижу на free-тарифах
  •   < $10: плачу только за выход (VPN, прокси, ноды)
  •   $10–30: одна базовая подписка (Plus, Pro, и пр.)
  •   $30–100: пара подписок и/или API, VPS
  •   $100–250: один Max/Pro-тариф плюс мелочи
  •   $250–500: два топовых тарифа или один плюс активный API
  •   $500–1000: три-четыре топовые подписки, API, свои серверы
  •   $1000+: не считаю, all in!🙈
204 голосов


Эстонские новостные паблики написали о скором выходе Jev — революционной LLM!

Шутка…

Итак, балуемся с классификатором под названием Jev. Поначалу показалось, что общественность настолько изголодалась по революциям, что новость о его появлении тут же растащили и невероятно раздули без исключения все.

Но оно и хорошо, потому что штука невероятно полезная.

Прагматично про Jev.

1. Это не LLM в классическом понимании. Jev не генерирует произвольный текст, просто выбирает из предложенных вариантов и оценивает их. Авторы называет моделть System One, по аналогии с быстрым, интуитивным мышлением, описанным Канеманом в книге «Думай медленно, решай быстро». Рекомендую прочитать, люблю её.

2. Полная схема сети публично не раскрыта, но уже появились открытые альтернативы: Kev, Laya, Nimble. Насколько они похожи на оригинал — не знаем.

3. В продукте три примитива. Choice: какой из заданных вариантов подходит? Noul: какова вероятность, что конкретное утверждение верно? Score: оценка по заранее описанной шкале.

4. Цены на облачное использование копеечные. По тарифу TypeSafe — $0.042 за 1M входных токенов. Выход вообще не тарифицируется.

5. Объём запроса — 64K tok. Есть ещё лимит: исходные данные + самый длинный вопрос должны поместиться в 32K. Это ограничения TypeSafe. Возможно, у кого-то есть бОльшие лимиты.

6. Подключить можно несколькими вариантами: есть API TypeSafe, OpenRouter, Vercel AI Gateway. Начинать нужно с понятной задачи и своих примеров.

Как применять в проектах:

1. Работа с почтой, обращениями, сообщениями. Определяем спам, тип обращения, срочность, тон и всё остальное из этой серии. После классификации код зовёт человека / запускает подходящий процесс.

2. Фильтрация документов в RAG. Нашли фрагменты, проверили, какие помогают ответить на вопрос.

3. Маршрутизация между моделями. Определяем, «кому» отдать запрос: тупой модели, умной модели или позвать человека.

4. Выбор инструмента или навыка агента. Даём список доступных действий и понятные условия их применения. Jev выбирает подходящее.

5. Проверка результатов другой модели. Есть извлечённое поле, утверждение или цитата отвечает на вопрос, пускаем дальше. Если проверка не пройдена, отправляем на повторную обработку или человеку.

Из самого ценного:

1. Работает быстро. Важно там, где «небольшое» решение нужно принимать после каждого шага агента.

2. Несколько независимых вопросов можно задать за один запрос. Сразу определить тему письма, срочность, наличие запроса. Исходные данные общие, ответы вычисляются параллельно.

3. Можно менять категории и критерии прямо в запросе. Для каждого нового набора вариантов не нужно отдельно специально дообучать модель.

4. Вместе с решением получаем вероятности. Дальше сами определяем, при каких значениях продолжать, когда нужна проверка.

5. Результаты Jev сразу удобно использовать в коде. Заранее известно, какие варианты вообще допустимы и под них можно написать обычные проверки.

При этом, сложные процессы никто не запрещал. Циклы, каскады и переход к более сильной модели реализуются вокруг Jev обычным кодом. У TypeSafe даже есть пример на этот счёт: небольшая LLMка извлекает данные, Jev проверяет поля, подозрительное уходит на обработку умной модели.

Но сильнее всего меня будоражат кейсы, над которыми я работаю прямо сейчас:

1. Появились проекты, которые позволяют очень быстро управлять браузером на базе концепций, заложенных в Jev. Это позволит перенести тестирование интерфейсов из медленных браузерных автоматизаций в лайтнинг-фэст.

2. Распределение задач личным ассистентом между субагентами и различными агентными средами. Ставим фильтр на вход мозгового потока человека, классифицируем, отправляем задачу в нужную дыру. Например: «закажи сливки и кофе во ВкусВилл» → A, «исследуй концепцию каскадной памяти» → B, C.

3. Самое интересное сейчас — это работа с видео. У меня есть сломанный гироскутер, который почему-то не заряжается. Я хочу при помощи классификации видеопотока с Raspberry на Jev и мозгами от GPT-6 его починить, не обладая специальными навыками схемотехники.

Такие дела. Хорошей среды, @aiwizards


Последние недели какие-то сильно упакованные делами, всегда в эти моменты думаю, а какие ещё дела можно переложить на агентные среды.

Собрал список инструментов, на которых построен один из стеков, которым пользуюсь каждый день.

Почти всё Open Source, $0.

T3 Code — пульт управления удалёнными агентными средами, которые чаще всего установлены на виртуалках в «правильной» локации. Есть удобные мобильные приложения, веб, десктоп. Это ответ для тех, кто пишет «меня опять заблокировали в Claude Code, что делать». Есть похожий инструмент, claudecodeui, который советуют по интернетам, но глючный. T3 пока нравится больше всего из этой серии.

Herdr — тут без вариантов, терминальный мультиплексор, написан на Rust, работает как молния. Из полезного — агенты могут сами управлять herdr через CLI и «промптить» друг друга. Для развлечения и несложных мультиагентных задач самое оно. Можно подключать удалённые сессии, это тоже супер полезно.

NetBird — если вы пользовались TaisScale, то это почти то же самое, но с открытым кодом (включая control plane). Продукт позволяет объединить виртуалки в единую сеть, без проброса портов, статических IP, ручного обмена ключами и др. и пр. Огонь штука, control plane с удобным интерфейсом разворачивается где скажете, управлять удобно.

Lific — случайнейшим образом наткнулся на этот проект и теперь его использую каждый день. Если в двух словах, то это issue tracker на Rust в одном бинарнике, весит ~25Mb, у меня стоит на NAS. Используется всеми моими агентными средами разработки для синхронизации по задачам и хранения информации по проектам. Очень быстрый и легковесный, MCP-first, интеграция с агентами настраивается в одну команду. Рекомендасьён.

Kandev — за последнее время основная среда для разработки и исследовательских задач. Тем, кто занимается разработкой, но до сих пор выступает в роли Meat Proxy или настраивает обмен сообщениями в herdr / tmux / cmux или в другом *mux, однозначно рекомендую посмотреть. Продукт большой, про него надо рассказывать отдельно, но кратко о сценарии: он умеет делать Kanban-стайл рабочие процессы, в качестве исполнителей назначать любые агентные среды, выполнять и трекать работу, звать вас на помощь. Вкупе с продуктом выше — огненный микс.

Ну, всё, хорошей субботы :) @aiwizards


Весь конец прошлой недели я очень внимательно читал отчет Anthropic по безопасности, потом читал эссе Дарио, потом законопроект Сандерса и Кассара, потом телегу Дональда Фредовича.

Если вы не смотрели эти документы, то, безусловно, стоит взглянуть! Наиболее пристальное внимание стоит уделить отчету Anthropic.

Ребята описывают обнаруженные ими случаи использования моделей Claude для «совершения беззаконий».

Там и русские хакеры, и соло-взломщики, и китайские фабрики эксплойтов, и биологическое оружие, и атаки на крупные компании, и дистилляция со стороны китайцев — всё описано в деталях. Для некоторых случаев приводятся скриншоты.

Китайцев, кстати, заподозрили в том, что они под видом Kimi и DeepSeek перенаправляли за задачи в Opus. Fake it until you make it, как говорится.

После прочтения возникает сразу несколько вопросов.

Первый и самый главный: а как вы, ребята, следите за переписками пользователей и настолько чётко понимаете кто что делал? Натурально, в некоторых случаях в отчете фигурируют прямо имена людей, которых удалось идентифицировать по перепискам.

Конечно, я понимаю, как они это делают чисто технически, но сам факт постоянного наблюдения за вашей деятельностью — это очень интересная правда, озвученная публично.

При этом абсолютно неважно, чьим ключом вы пользуетесь, своим или украденным. Вас можно легко определить по тому, о чем вы «говорите» с моделью, и ретроспективно восстановить всю цепочку вашего общения (разумеется, если сообщения связаны семантически).

Второй вопрос: после обнародования этого исследования и припоминания взлома Hugging Face со стороны роя агентов OpenAI, появились заявления от светил индустрии, которые призывают замедлить рост AI, чтобы дать обществу и инфраструктуре время адаптироваться. К слову сказать, агенты очень умело заметали следы, подделывая собственные транскрипты для модели.

Кстати, есть группа товарищей, которые готовят законопроект о запрете Artificial Superintelligence и объявляют его вне закона, за попытку создания и разработки — «турма».

На третий и финальный вопрос невольно ответил Дональд Фредович: в противостоянии с Китаем любая пауза — это потеря конкурентного преимущества, поэтому со стороны интересов государства остановка недопустима.

Какие варианты остаются, если учесть пожелания всех сторон?

А очень простые. Должно случиться ровно то, о чем писал один из кофаундеров Палантира Алекс Карп: сверхинтеллект должен быть на страже государственных интересов и быть близким по классу к вооружению. Собственно, это происходит уже и сейчас, как мы знаем из прессы.

Зреет ещё один Манхеттенский проект, где вместо плутония и урана будут токены и трансформер.

Конечно же, в отчёте ни слова про Palantir и ЦРУ / АНБ, хотя по косвенным признакам можно узнать «почерк маэстро».


Кажется, у меня есть шанс... 😂️️

Если серьезно, то последние пару месяцев я ни одного дня не работал с «одной» моделью.

С удивлением обнаружил, что каждый день я общаюсь как минимум с пятью.

Парадоксально, но лучшие результаты выдает комбинация «слабая модель просит помощи у сильной».

Вот тут лежит скилл для Qwen Code, который я использую каждый день, Он позволяет позвать «старшего товарища» в любой непонятной ситуации.


Уже больше трех недель я балуюсь на досуге со зверушкой под названием Grok Bot.

В двух словах: это довольно удачная попытка создать мультиагентную систему для выполнения задач (рутинных и рабочих) с очень демократичным дизайном.

Набор очень простой. Есть интерфейс с агентами и привычным чатом для общения с ними. Каждый агент обладает своим собственным облачным компьютером, поэтому спектр задач, которые он может выполнить, довольно широкий (у меня работает интеграция с LinkedIn через Computer Use и мониторинг Телеги через мой CLI).

Кроме этого, у агентов есть миллион разных опций для интеграций, доступных через интерфейс, и повторяемые действия по расписанию (рутины, routines).

Из очень полезного и интересного: агенты умеют общаться друг с другом самостоятельно и, в случае необходимости, взаимодействовать в контексте выполняемых ими задач.

В дополнение, вся агентная система крутится в облаке, поэтому постоянно иметь включенным компьютер не обязательно (безусловно, здесь мы понимаем, что делимся 100% данными с создателями).

Ребята, из Cursor, которые создали продукт в партнёрстве со SpaceXAI, пишут, что сделали его за месяц. Я считаю, что это прямое следствие лавиннообразного развития инструментария и возможностей мультиагентного кодинга.

Для работы нужно иметь две учетки: Cursor и XAI для модели.

Штука бомбическая! Я думаю, что с точки зрения демократизации входа в персональных ассистентов, это очень большой шаг.

Скоро подобные механики смогут осваивать и применять не только продвинутые программисты с большими сообществами, но и обычные смертные, которые уверенно владеют Word и Excel.

Смотреть и пробовать тут: https://x.ai/bot

p.s. Конечно же, сразу появился похожий на оригинал open source. Вот он: https://github.com/elie222/rakazo


Существенно обновился мой Telegram CLI. Напомню, что это терминальная утилита для работы с телегой через командную строку.

Из новинок, помимо обычного багфикса, появился полноценно работающий демон.

Демон висит и держит соединение, а вы его дергаете и получаете ответ практически мгновенно.

Также у всех методов есть полноценная поддержка toon и фильтрации вывода, можно очень экономно выдавать информацию в агентный контекст.

Вот несколько примеров:

tg daemon start --idle-timeout 0
tg daemon status

В статусе ожидаем running: true, connected: true, apiVersion: 1, idleTimeout: 0.

Дальше используем обычные команды с --daemon:

# Список диалогов (в toon)
tg --daemon chat list --limit 20 --fields id,title,unreadCount --toon

# Последние сообщения в Избранном
tg --daemon message history me --limit 10 --fields id,text,date

# Поиск
tg --daemon message search --chat me --query "план" --limit 10

# Отправить заметку себе
tg --daemon message send me "Заметка из терминала"

Повторный логин при действующей сохранённой сессии не нужен, но после перезагрузки демон нужно запустить снова.

Буду рад критике и обратной связи!

Всем хорошей недели! @aiwizards

2k 2 49 12 25

Астра 6 хороша. В интернетах появилось много разных картинок, видео и проектов, которые сделала Astra, выглядит всё очень интересно.

Nate вообще снял видео про то, как всё видео сделала Astra — это очень круто!

Я попробовал что-то более приземлённое, а именно: визуализация заданий по робототехнике для учеников 7–8 классов, которая в оригинальном варианте выглядит как простой PDF с объяснениями.

На YT есть замечательный канал 3blue1brown про математику и технику с потрясающими визуализациями, это вообще мой топ из всех каналов, у автора есть своя библиотека Manim, которая позволяет эти самые визуализации создавать.

Каждый раз, когда я натыкаюсь на такие визуальные инструменты и новые возможности, я с трепетом вспоминаю бессонные ночи, проведённые над матаном, физикой и дифурами в попытке понять суть мироустройства.

Встречайте! Визуальная робототехника для 7–8 классов! Это почти One-Shot на Astra 6 xhigh.

В отличие от статичного PDF, практически все параметры можно менять и настраивать, смотреть, как меняется симуляция в среде!

Демка: https://tech-demo-small-7-8.onrender.com/
Исходник: https://github.com/miolamio/tech-demo-small-7-8

Выходные потеряны. Всем пис. @aiwizards


У OpenAI вышла Астра, новая модель следующего уровня (по их собственным заявлениям, разумеется).

Судя по опубликованным тестам, модель действительно хороша, есть тесты, где она набирает 100% баллов, но таких тестов пока немного и они очень ограничены областями тестирования.

Некоторым гражданам в закрытом режиме уже дали побаловаться с Астрой и они высказываются довольно позитивно, правда, без особого восторга.

Сэм обещает Астру на выходных, но это не точно.


Konnichiwa! Нельзя всё время о серьёзном, посему юмор среды.

Японский язык очень емкий, у некоторых слов есть прекрасное свойство обозначать глубокий и сложные смысл всего парой иероглифов.

Например, Югэн (幽玄, ゆうげん) — переживание глубины мира, которое возникает, когда предмет показан не полностью (разумеется, чтобы ощутить настоящие краски, нужно быть носителем языка).

Теперь про AI. В последнее время сформировался довольно занимательный лексикон вокруг работы с языковыми моделями и агентными системами.

Человек, который глубоко «сидит в этом всём», сможет испытать чувства, близкие к «японскому пониманию сути вещей».

Из любимого:

Meat Proxy — Человек, который бездумно пересылает сырой вывод AI-модели и поручает проверку получателю.

Slop grenade — Огромный сгенерированный текст кидают в чат, после чего отправитель исчезает, оставляя окружающих самостоятельно разбираться с AI-слопом.

Stackpocalypse — AI-стек разросся до пяти моделей, четырёх агентных сред и семнадцати интеграций. В этой системе есть ровно ноль живых человек, которые до конца в ней разбираются.

Token Bonfire — Мультиагентной системе поручили обсуждение задачи, чем она с удовольствием занимается. Несколько агентов оживленно обсуждают тему, при этом не приходят ни к какому качественному прорыву.

Context Landfill — В промпт загрузили все документы «на всякий случай» и похоронили нужные факты под предоставленным мусором.

Prompt Laundering — Человек, чтобы показаться сообразительным, пропускает личную позицию через модель и пересылает потом коллегам скриншоты, как якобы нейтральный «вывод AI».

Memory Compost — Устаревшие факты, временные решения и чужие предположения медленно «перегнивают» в постоянную память. Со временем компостная куча растет все сильнее и сильнее.

HalluciNation — Компания, где выдуманный моделью факт несколько раз скопировали в документы, после чего он стал корпоративной реальностью и все теперь по ней живут.

Review Bankruptcy — Скорость генерации устойчиво превысила способность команды проверять результат. Команда не способна принимать результаты и растет невероятный долг незаконченных проверок.

Consensus Cosplay — Пять экземпляров одной модели с почти одинаковым контекстом согласились друг с другом, потом это выдали за независимое экспертное мнение.

Benchmark Botox — Систему спроектировали таким образом, что она идеально «натянута» под публичный тест. Снаружи все проходит, а внутри полный бедлам.

Каждый термин тянет на отдельный проект, который будет с ним бороться. Ухх… пойдём пилить агентов дальше.

Аригато, эврибади!


Вышла новая модель Anthropic — Fable 5.1.

Будет интересно оценить, насколько она лучше Opus и способна дольше работать без постороннего вмешательства.

Цены — 2x от Opus.

Тестим, делимся результатами.


Видео недоступно для предпросмотра
Смотреть в Telegram
В мире агентного AI можно бесконечно смотреть на три вещи: на то, как эффективно тратятся токены подписки пока ты спишь, на то, как получается ровно то, что ты хотел и на то, как Борис Чёрный рассказывает про Claude Code.

Снова наткнулся на интервью двухмесячной давности, где он рассказывает про истоки Claude Code, про то, что не открывал IDE уже полгода (мы отстаём, друзья) и про то, что у него есть агенты, которые управляют другими агентами.

Действительно, если есть надёжный кофаундер-агент (или несколько), то им можно поручать длительную работу и контроль над другими агентными средами.

Согласно теории управления, в прямом подчинении не может быть больше семи человек (читай — агентов), поэтому совершенно правильно двинуться в сторону создания агентного слоя управления «жизнью».

Есть очень много интересных наработок на этот счёт, которые включают в себя управление интерактивными сессиями, вызов агентов напрямую через оркестраторы или динамические воркфлоу.

Дивный новый мир и мета-слой агентной реальности.

Через недельку соберёмся в зуме, обсудим. Анонс чуть позже.

Happy Thursday, @aiwizards

p.s. Перевод и субтитры полностью автоматические, оригинал тут.


Hola! Обновилась среда для прохождения заданий курса «Claude Code для НЕпрограммистов».

Теперь там собрано больше заданий, их можно пройти самостоятельно + добавились презентации из последнего потока.

Для работы нужен Docker + ключик от GLM, модели z.ai, на базе которой проходил весь курс, больше ничего не требуется, можно запустить на своём компьютере и учиться работе с Claude Code.

Можно, например, при помощи одного ключа z.ai научить своих сотрудников на моих примерах из курса.

Всё лежит тут: https://github.com/miolamio/cc-for-non-coders-dev-container

Этот курс я больше проводить не буду, поэтому в какой-то момент появятся записи. Напишу про них тут.

p.s. Недавно вышла GLM-5.3 от z.ai, которая очень недурно показывает себя на тестах.


automatica-ome-builder-s1-e8.pdf
9.4Мб
Вчера закончился первый поток курса «OME Builder s1», где мы в течение восьми занятий работали над одной автоматизируемой функцией реального бизнеса.

Я рассказывал о своей авторской методологии, начиная от того, как выбрать такую функцию, заканчивая тем, как и какими инструментами можно её реализовать и мониторить.

Для меня эта программа оказалась самой сложной среди всего, о чём я рассказывал, но при этом самой интересной.

На последнем занятии я рассказывал о полезных на мой взгляд вещах и хочу поделиться его презентацией со всеми.

Из последнего очень интересного — DeepSeek Harness, по моим ощущениям, это почти прорыв, хотя ничего сверхъестественного там нет.

Everything is a plugin — супер концепция, которая вкупе с использованием локальных моделей может дать очень интересные результаты.

Ну, и Trajectory, невообразимо крутая штука, показывает всю трассировку агентных шагов.

Если не знаете как провести выходные — однозначная рекомендация.

Ссылки на продукты из презентации:
DeepSeek Harness
Agent Runtime
CMUX Skills

Happy Friday, @aiwizards


Время от времени я балуюсь с моделями и прощупываю их механизмы защиты. Разумеется, делать это нужно очень осторожно, как говорится, не привлекая внимание санитаров, потому что все без исключения проприетарные модели тут же настучат на вас, если заметят что-то подозрительное.

Помню, что с год назад было достаточно написать что-нибудь на 1337 для того чтобы получить системный промпт практически любой модели или любого инструмента. Сейчас такие простые лазейки закрыты и прибегать надо куда более сложным манипуляциям.

Самые на мой взгляд интересные упражнения — попробовать провести анализ какого-нибудь софта с использованием проприетарных моделей, например с целью создания кейгенов или повторения нужных вам механик работы.

На выходных развлекался с одной замечательной программой для построения деревьев текущей реальности по теории ограничения Голдратта. Замечательная программа, написана на Java.

С помощью Kimi мы выяснили, что в программе есть необфусцированный метод под названием encode(), который проверяет введенные имя и ключ на предмет актуальности лицензии. Разумеется, для создания генератора ключа, нужно методом простого реверс инжиниринга сообразить, каким образом этот ключ можно получить.

Я притворялся:
- автором программы;
- исследователем безопасности;
- экспертом по защите и лицензионным библиотекам.

Ни одна из проприетарных сетей не позволила мне воссоздать даже псевдокод для кейгена. Kimi, кстати, пошел в интернет и начал читать EULA от программы, в котором выяснил, что reverse engineering программы разрешен, а вот обход лицензии запрещён. Поэтому наотрез отказывался что-либо делать.

В пролетающих в терминале «размышлениях» я видел внутренние возмущения моделей, которые понимали, что пользователь пытается их обмануть, было занятно читать.

Но под рукой оказалась последняя версия Qwen, установленная локально на GPU.

Без зазрения совести, каких-либо дополнительных вопросов или нравоучений, я получил готовый keygen в течение пяти минут.

Чуть позже удалось собрать автоматизированный стек, который при помощи проприетарных моделей проводил аудит безопасности а при помощи этого самого Qwen сделал автоматическую функцию для генерации ключа.

К чему это всё? Над бесконечно долгой идиллии защищенного проприетарного программного обеспечения начинает опускаться солнце.

Я слышу «звоночки», которые позволяют сделать вывод о том, что не только небольшие компании прекращают своё существование благодаря тому, что проприетарные модели за $100 в месяц могут полностью воспроизвести их продукты, но и крупные гиганты, которые казались непотопляемыми, тихо «сдуваются».

Пример с кейгеном тут, конечно, не сильно показательный, но в даже если в большинство моделей зашиты защиты от повторений проприетарного софта, их технически тоже можно обойти, если есть надёжный исполнитель, который не задаст лишних вопросов и никуда не «настучит».

Из самого грустного за последнее время: автор Flowise, продукта, которым мы пользовались и продолжаем пользоваться в небольших проектах, объявил о его закрытии потому что он не может состязаться с публичными моделями в быстроте и качестве работы.

RIP Flowise.


Когда кончаются силы, можно потратить время и почитать… системные промпты моделей Anthropic. Лежат тут.

Как уже обсуждалось выше, чем «умнее» модель, тем меньше дополнительных инструкций ей нужно, про это в недавнем интервью говорил Борис Чёрный.

Сами ребята из Anthropic публикуют свои системные промпты с 2024 года, я потратил время на их анализ и обнаружились интересные моменты.

1. Промпты эволюционировали от «ты чатбот» к «вот, какой у тебя характер».

2. Потом описание характера сменилось инструкцией по работе внутри продукта. Появились правила «сначала действуй, потом уточняй», поиск инструментов, чтение SKILL.md.

3. Судя по всему, Fable 5 и Mythos 5 используют одну базовую модель, но работают с разными ограничениями. Более того, внешний классификатор может перенаправить запрос пользователя с Fable на Opus :)

4. Системные промпты становятся похожими на журналы когда-то найденных проблем. «Не начинай ответ с Certainly», «не задавай слишком много вопросов», «проверь инструменты, прежде чем говорить, что ничего не можешь».

5. Общая тенденция — упрощение системного промпта и бОльшая его подстройка под неверное поведение прошлого.

К чему это всё… современные мультиагентные системы должны пересматриваться с точки зрения архитектуры и обвязок (в простонародии — harness) минимум раз в полгода.

По совету Anthropic нужно выбрасывать / снижать объём системных промптов и смотреть что это может сломать, попутно «чиня» последствия.

Это означает, что прийти к фиксированной оптимальной конфигурации мультиагентной системы при смене модели нельзя.

Вот серия из «Любовь, смерть и роботы» про избавление от оков харнеса: https://www.youtube.com/watch?v=5B2WBZnwmHM


Видео недоступно для предпросмотра
Смотреть в Telegram
Prompt Engineering → Context Engineering → Harness Engineering → Loop Engineering → Graph Engineering (мы здесь). И всё это, кстати, называется Agentic Engineering.

С недавнего времени стали очень активно рассказывать о «новой» парадигме, которая называется Graph Engineering (вот тут хороший, иллюстративный твит).

На самом деле, это никакая не новинка, а старая концепция, переложенная на новый лад. Когда агентов становится слишком много, время их непрерывной работы измеряется днями, а цена ошибки возрастает — нет других вариантов, кроме как переносить агентную систему на уровень графов.

Claude Code уже научился строить Dynamic Workflows (динамический процесс), там под капотом как раз графы, где узлами являются агенты, а рёбра представляют собой передачу данных и управления между этапами работы.

На картинке выше — пример того, как работает / deep-research, динамический процесс, поставляемый вместе с последними версиями Claude Code.

К чему это всё…

Анализируя происходящее, понимаю, что мы несёмся в мир сетей динамических рабочих процессов, каждый из которых будет представлять собой самоверифицируемый набор задач и связанных с ними результатов.

Будущее не в мега-harness, не в мега-оркестраторах, а в наборах относительно независимых, хорошо описанных процессов с чёткими входами, выходами и проверками.

Откройте эту страницу, прочитайте статью, посмотрите на 'https://t.me/aiwizards/465?comment=5011' rel='nofollow'>простую анимацию слева, там ребята из Anthropic визуализировали базу прогресса :)

Рекомендую всем и каждому, кто серьёзно увлекается агентами, мультиагентными системами и смотрит в сторону OME, подробнейшим образом изучить концепцию, которую сейчас предлагает Claude Code, уверен, что скоро все крупные игроки к ней «притянутся».

Ну, а следующий уровень — оркестрация «этажом выше», при которой агентный слой будет представлен моделями разных вендоров.

p.s. Вангую, что n8n в какой-то момент выйдет как раз с такой функциональностью :)

Happy Tuesday, @aiwizards

Показано 20 последних публикаций.