FastNews | Никита Пастухов


Гео и язык канала: Россия, Русский
Категория: Технологии


Welcome! Я - Никита Пастухов: AI-энтузиаст и OpenSource разработчик (автор FastStream, AG2)
Здесь я пишу обо всем, что мне интересно
Чатик: @fastnewsdev_chat
Чатик по FastStream: @python_faststream
Мой GitHub: https://github.com/Lancetnik

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


100 Лучших Prompt'ов недели на DVD

И вот мы реально пришли в эту точку. Скиллы я еще как-то мог оправдать (хотя это те же промпты), но теперь мы реально делимся чисто промптами🌚

Все дело в том, что топ недели - benjamin-plus от JetBrains. Это буквально промпт на 745 токенов. И установка у него максимально дурацкая: cat injected-instruction.md >> AGENTS.md.

Прикол в том, что рулсет не сочинили, а выжали из ~1200 старых трасс агентов: как разведывать кодовую базу, как вызывать инструменты и тд. Т.е. должно работать не только на задачах кодинга

Замер был парный на 80 задачах. Итог: -17,9% стоимости и -22% токенов, качество не поехало. Но при условии, что текст скилла автоматом инжектится в каждую сессию. Он же, положенный папкой в ~/.claude/skills/, не экономит НИЧЕГО - агенты тратят доп шаги на то, чтобы найти этот самый SKILL.md🤯

Такое я ставить точно буду - вчера на стриме агент тратил по 100к контекста только на фазу разведки в репозитории FastStream. Это надо как-то решать (codegraph не помогал), так что попробую этим👍

Боль недели - переводчик с Клода на человеческий. Четыре независимые реализации за семь дней:

NoBuzz - скилл /debuzz отдает последнюю реплику Клода в Gemini и печатает перевод дословно. Три режима - коллеге, менеджеру, директору;
Vomit - то же лекарство локально и без второго вендора: Go-бинарь подменяет вывод через хуки. Автор честно пишет "полностью вайбкожено, тестировалось только на маке";
claudish-to-english - плагин печатает человеческий пересказ рядом с оригиналом, локальная ollama по умолчанию.

Вендор ответил своим Concise output style. В тредах его списали заранее: "тот же салат из баззвордов, только без связок".

Тренд недели - жесткие гейты для агента:

Procoder - коммит-гейт одним бинарем, где непроверенное считается провалом;
agent-guard - ~60 строк шелла PreToolUse-хуком. rm -rf, git reset --hard и push --force до исполнения просто не доезжают;
ProofRun - квитанция о том, что проверки реально гонялись на этом коде;
Doberman - прозрачный MCP-прокси, выносит вердикт каждому вызову тула на пути исполнения.

Везде одна мысль: правило в CLAUDE.md - это просьба, и чем дальше сессия, тем чаще агент про нее забывает. От хука так просто отмахнуться не получится🤷‍♂️

Просто находки:

Autoprompt - раскладывает промпт в многоагентный цикл, +14,61 пункта на Terminal-Bench 2.1. Ценой ×3 времени и ×2 токенов, и автор эту цену печатает рядом с выигрышем - за это жму F🫡;
agent-codemode - агент пишет один скрипт вместо 40 вызовов MCP. На их замере 65 500 токенов в контекст превратились в 226;
reclaim-code-entropy - упрощение кодовой базы, где каждый разрез надо доказать, а "ничего безопасного не нашлось" - валидный ответ;
CUDA MCP Server - NVIDIA сама хостит доку и примеры, чтобы агент перестал выдумывать давно уехавший API;
defending-code - Anthropic выложила свои security-скиллы: /threat-model и /vuln-scan прямо в Claude Code.

Все, что проходит фильтр рубрики, копится в репозитории awesome-engineering-ai - там же мои вердикты по тем, что успел потыкать.

С вами был воскресный #digest агентского тулинга. Свои находки закидывайте в чат, там же обсуждаем свой опыт использования.

#AI


Напоминаю, что вы проголосовали против чистого вайбкодинга!

Поэтому сегодня в 13:00 на стриме

https://www.youtube.com/live/oE7fhJFcSJ8

Мы будем страдать и пилить вот этот вот Issue. Там очень много подводных камней, так что задачка должна стать испытанием как для меня, так и для клода🥲

На стриме пройдемся по всем этапам разработки начиная от установки скиллов, заканчивая реализацией и ревью. Постараюсь давать подробные объяснения на каждом из этапов.


Код можно больше не смотреть

После стрима мы с Никитой Соболевым еще чуть-чуть пообщались - и я правда пришел к выводу, что В ОПРЕДЕЛЕННЫХ ПРОЕКТАХ, ОПРЕДЕЛЕННЫХ СИТУАЦИЯХ и при соблюдении ОПРЕДЕЛЕННЫХ УСЛОВИЙ LLM-сгенерированный код можно даже не ревьюить.

Как я к этому пришел: в процессе разработки фичи для DMR мы задизайнили большой эпик и побили его на таски. И вот, реализация первой таски Claude'ом была ужасной... просто отвратительной... Но я неожиданно для себя пришел к выводу, что "я бы смержил". Потому что тут выполняется сразу ряд критериев:

• это новая функция с единой ответственностью
• она никак не аффектит существующий код (ее никто не вызывает)
• у нее четкие архитектурные границы и интерфейсы меня полностью устраивают

Т.е. эта монструозная функция на 1000 строк кода может существовать для всего остального проекта как черный ящик. Меня совершенно не волнует, что внутри нее, если меня удовлетворяют ее API, а весь набор тестов на поведение - проходит.

Для опенсорса это все еще недопустимая ситуация - тут каждая строчка кода должна быть максимально вылизана. Хотя...

Но вот в настоящих CRUD'шлепских проектах - почему нет?

Если:

• ваш проект не требует SLA 4 девятки
• вы можете позволить себе иногда 500тить
• у вас есть опция оперативно доставлять фикс-апдейты до пользователей - Claude Code / Cursor катят по 3 патча в день по моим ощущениям
• у вас качественный агентский Harness и практики ИИнженерии - типа моего
• вы умеете выстраивать четкие архитектурные границы - модули должны быть строго изолированы друг от друга
• вы очень строго подходите к процессу тестирования - правки агента не должны ломать то, что уже работает
• ваш проект плотно обмазан всеми возможными статическими и динамическими проверками

При соблюдении всех этих критериев вы ИНОГДА можете смотреть код НЕ ТАК ПРИСТАЛЬНО - только проверять соблюдение архитектурных принципов, которые вы закладывали.

Возможно поэтому, дядя Боб (как большой знаток архитектуры, совсем не инфоцыган) утверждает, что больше не смотрит в код.

Black-box код требует сильной экспертизы в области архитектуры, четко налаженного пайплайна доставки патчей до пользователей и строгой системы автоматических проверок вокруг проекта. Ну и довольно существенной толерантности к говнокоду, конечно. Готовы к такой реальности?

#AI


В комментариях пишите свои идеи и лайкайте понравившиеся
Опрос
  •   Вайбкодим приложуху для Loop'ов поверх Claude
  •   Делаем eval'ы и оптимизаторы для ТГ скилла
  •   Превращаем этот скилл в сервис
  •   Пилим фичу в FastStream
  •   Пилим фичи в AG2 Assistant
  •   Делаем бенчмарк для AI grep'лок
47 голосов


Всем привет! У меня для вас идея🌚
В прошлый раз мне понравилось работать на стриме над реальной фичей с помощью Claude. Довольно anti-FOMO формат для тех, кто думает что их вот-вот заменят нейронки или не понимает, как с ними нормально работать

Поэтому я хочу повторить - только теперь соло. Запилим пару фичей, потыкаем /wayfinder, сделаем новый проект или испортим пару уже существующих - пока не решил

Текущие идеи:
• навайбкодить инструмент для построения Loop'ов по пайплайну Matt'а поверх Claude
• настроить инфраструктуру eval'ов и оптимизаций скилла https://github.com/Lancetnik/slop-writer
• превратить это скилл в сервис
• запилить среднюю фичу в Faststream
• запилить пару фич в ассистента - https://github.com/ag2ai/ag2-assistant
• сделать бенчмарк для сравнения разных grep'ок - codegraph / graphify / etc.

Но если у вас есть свои идеи - закидывайте в комментарии и лайкайте друг друга. Делать будем то, что победит в результатах опроса / наберет больше всего лайков в комментах

Стрим планирую на субботу (22е), скажем, в 13:00 МСК


С вами очередной воскресный #digest агентского тулинга. Привет всем неотписавшимся!

Радар принес mcptoon - CLI-MCP Proxy, который ходит на MCP сервера вместо агента. Обещают какую-то дикую оптимизацию контекста за счет автодискавери тулов и переформатирования ответов в TOON.

И тут мне стало интересно, что за формат такой этот TOON, Token-Oriented Object Notation. Оказывается, ему почти год, 25k звезд, уже v4.1 версия, порты есть на Python, PHP, .NET, Kotlin и Elixir.

Что это. Та же модель данных, что у JSON, только записанная экономно: вложенность на отступах как в YAML, а однородные массивы сворачиваются в таблицу - поля объявляются один раз в заголовке, дальше идут только строки.


forecast[3]{day,temp,condition}:
Mon,-2,snow
Tue,1,cloudy
Wed,3,sunny


Сколько экономит. Против JSON с отступами - минус 33% на смешанных данных и минус 59% на плоских. Лучше всего там, где записи однотипные: конфиг фиче-флагов - минус 55%, контакты с вложенными адресами - минус 66%.

Когда лучше остаться на JSON. Если данные неоднородные или глубоко вложенные. В их же замерах минифицированный JSON просто меньше: +5.6% на вложенных заказах, +19.9% на полуоднородных логах, и по смешанному треку целиком TOON ему проигрывает. То есть красивые "-60%" - это против JSON только в определенных кейсах.

Когда лучше CSV. Если данные плоские и честно табличные - CSV меньше процентов на шесть. Эти шесть процентов TOON тратит на объявленную длину массива и список полей в заголовке: покупает не размер, а надежность.

Т.е. TOON - это где-то между JSON и CSV по способу представления.

Про точность. Бенчмарк взрослый - 244 вопроса, 6 форматов, 4 модели, 5856 прогонов. TOON дает 72.2% против 71.4% у JSON, но это в пределах погрешности, и продавать это как "модель лучше понимает" я бы не стал. Интереснее другой замер: на вопросах "а данные вообще целые?" TOON дает 100%, а JSON - 50%. Объявленная длина массива ловит обрезанный список, а в JSON обрезанный список выглядит совершенно валидным.

Тренд недели - куча новых харнессов. За семь дней четыре новых, и это только те, что дошли до топов:

DeepSeek Harness - 118 тысяч звезд за трое суток (чего?). Внутри все плагин: модели, тулы, скиллы, сессии, песочницы, планировщик и даже UI. К DeepSeek не привязан - Anthropic, OpenAI, Bedrock, Vertex, Codex по OAuth. Пока это developer preview, issues отключены, ломающие изменения обещают капсом
Ante - один 15-мегабайтный бинарь на Rust: внутри TUI, свой ripgrep, локальный OCR и сборка llama.cpp, то есть агент работает офлайн и без Node (наконец-то). Terminal-Bench 82.7% с публичными прогонами. Но ядро приезжает прекомпилированным, исходников нет, телеметрия включена по умолчанию
hax - еще один бинарный агент - теперь на C, ровно пять тулов и docs/philosophy.md со списком того, чего в нем не будет: ни MCP-маркетплейса, ни плагинов, ни IDE-панелей; Pi-agent, только бинарем
Waku - не CLI, а нативный десктоп на Rust и GPUI поверх Amp, Claude Code, Codex, OpenCode и Cursor. Каждый промпт чекпойнтит рабочее дерево, поэтому откат едет вместе с кодом, а не только с логом чата

Экосистема при этом нарастает быстрее самих харнессов: у dsh за трое суток появился сторонний ModLens - плагин, который дает зрение текстовой модели, просто вставляешь картинку в чат.

Тут любопытно: каждый новый харнесс продает не фичу, а отказ. Ante отказывается от Node, hax - от плагинов и MCP, Waku - от Electron, dsh - от хардкода в ядре. Модель у всех примерно одна и та же, конкурировать в ней больше нечем - вот и соревнуются, кто меньше.

Все, что проходит фильтр рубрики, копится в awesome-engineering-ai - там же мои вердикты по тем, что успел потыкать.

💬 Чат | 🧭 Навигация | ⭐️ FastStream


Привет всем будущим отписчикам! За последние сутки на канале значительно прибавилось людей - и многие даже не знают, на кого подписались. Поэтому представлюсь: Никита.

• автор и мейнтейнер фреймворка FastStream - сейчас он активно идет к 1.0.0 версии спустя 3 года разработки
• мейнтейнер фреймворка для разработки AI агентов AG2 (бывший Microsoft/Autogen) - недавно вышли в 1.0.0
• разработчик AG2 Assistant - агента для ежедневных нужд
• контрибутор CPython, FastAPI и еще большой пачки OpenSource проектов
• последние полгода - лютый AI-амбассадор (этот пост написан с поддержкой AI)

Что тут вообще происходит

Все начиналось как канал про FastStream. Но получилось - про все, что мне интересно. Так я писал про продуктивность, книги, TDD.

Последний год я работаю AI-инженером, поэтому сейчас канал превратился в ИИнженерию: агенты, Skills, harness'ы и то, как собрать из этого рабочий конвейер, а не демку для твиттера. Например, по воскресеньям веду #digest агентского тулинга: что вышло за неделю и что из этого я реально поставил себе. Но это не значит, что все так и останется🌚

Я тут не продаю "10x продуктивность" - только анти-FOMO. Показываю свой сетап, реальные замеры и факапы. Например, недавно проспорил Никите Соболеву, что заваншотю фичу Claude'ом быстрее, чем он выпьет бутылку пива. Не заваншотил😅

С чего начать

Выборка того, как канал доехал от "мейнтейнер OpenSource" до "ушибленный на голову любитель ИИ"

1️⃣ Как заработать на OpenSource - разобрал бюджеты крупных OSS проектов. И признался, сколько мне за все время принес FastStream
2️⃣ Как отправить жопу мейнтейнера в космос - момент, когда LLM приехали ко мне в репозиторий
3️⃣ Вам не нужен OpenClaw - статья на Хабре, как написать собственного агента вместо того, чтобы настраивать чужого
4️⃣ Мой полный сетап скиллов для разработки - весь мой рабочий конвейер на текущий момент

И самое главное

У канала есть чат - и он живее самого канала. Там мы разбираем скиллы, спорим про агентов, кидаем всякие-разные находки и оффтопим. Посты тут иногда вырастают из тредов чата.

В общем, я вас предупредил - успейте отписаться сегодня. На всех, кто отпишется завтра - обижусь персонально!


В TG сейчас засилие слоп-контента (типа моего), тяжело найти АВТОРОВ, кого не стыдно почитать

Поэтому мы в Python-комьюнити собрали свою собственную подборку каналов: https://t.me/addlist/o2_hXmp5nSUyODNi

Многих из подборки вы, наверняка, знаете) но если нет - рекомендую обратить внимание. 100% годноты, практически всех авторов знаю лично, никто в слопе не замечен👍

Вот такая вот круговая порука


Лучший Skill для дизайна приложений

Зачастую во всех проектах я делаю fullstack решения. Это значит, что моя основная боль как разработчика - дизайн. Сделать "удобно" я еще кое-как умею, но "красиво" - точно мимо🥲 Поэтому за "красиво" у меня отвечает нейросеть. Проблема в том, что из коробки ни Claude, ни GPT "красиво" делать тоже не умеют (да и "удобно" у них так себе получается).

Я уже пытался решить эту проблему скиллами:
taste-skill
hallmark
ui-skills

Но все они пытаются "привить агенту вкус" - будто, прочитав данный волшебный промпт, Claude преисполнится и начнет выплевывать дизайны уровня Apple. Это так не работает. Особенно когда ты дизайнишь не лендос в вакууме, а конкретный компонент в уже существующем приложении. В общем, узкоспециализированная шляпа получается🤷‍♂️

Решение я снова нашел у Matt'а. Его скилл /prototype радикально отличается. Он не пытается "привить агенту вкус". Его задача очень тупая - вместо генерации ТОГО САМОГО ДИЗАЙНА агент генерирует 3-4 варианта одного и того же компонента / раздела / страницы. Причем прямо в вашем приложении, с большим тоглом
Текущий дизайн | Вариант 1 | Вариант 2 | Вариант 3

Поэтому следующим шагом будет "сделай X как в варианте 1, а Y как в варианте 3" - и вот вам уже вариант 4, который можно шлифовать в деталях. Эти варианты - действительно ПРОТОТИПЫ. Их задача:

максимально быстро и дешево по токенам дать вам совершенно разные взгляды на дизайн, не аффектя текущее поведение и код приложения


Мой пайплайн:

• скриним кусок интерфейса, говорим "переделай с помощью /prototype". В качестве ограничений - пожелания по UX/UI, в которых уже уверены
• из понравившихся кусков собираем вариант-франкенштейн
• доводим прототип до окологотового состояния: выравниваем UI со стайлгайдами приложения, правим мелочи
• делаем /to-spec на реализацию в основном коде (весь конвейер разбирал тут)
• в свежей сессии делаем /implement на эту спеку
• радуемся😎

На скринах я как раз прототипирую дизайн вкладки скиллов в AG2-Assistant

#AI


Воскресный радар агентского тулинга. Свои находки закидывайте в чат, там же обсуждаем свой опыт использования.

Топ недели - обмен сообщениями между сессиями в Claude Code. Сессии теперь пишут друг другу сами: одна нашла ломающее изменение - предупредила ту, что строит поверх. Это всего два тула, ListAgents и SendMessage, плюс команда /peers. Передается только текст: ни истории, ни файлов

⚠️с 14 августа входящие включаются в auto по умолчанию - если не хочешь, чтобы в твою сессию стучались чужие, crossSessionInbound выставляется руками (accept / hold / refuse). Что смущает: это оркестрация без оркестратора, агенты договариваются между собой, а отвечать за результат все равно тебе.

Пока не экспериментировал, но точно буду - я и так довольно часто передаю инфу между сессиями через /handoff-документы. Наверняка, у Matt'а скилл под это уже в разработке

Тренд недели - куча тулов по управлению контекстом. Три инструмента за неделю жмут токены, и каждый в своем месте:

headroom - жмет выхлоп тулов, логи и RAG-чанки до того, как их увидит модель: 60-95% на JSON, около 20% на обычном кодинг-агенте;
Sift - режет определения тулов: показывает агенту два тула вместо сотен. Лечит overtooling: пятнадцать MCP-серверов вываливают 150+ схем еще до того, как модель прочла задачу;
LeanCTX - собирает все сразу: кешированный ре-рид файла за ~13 токенов вместо ~2000, память между чатами и гард на то, что агент трогает.

Боль недели - LOOP-инженерия. Пять инструментов за семь дней про одно и то же:

LoopX - контрол-плейн для долгой задачи: держит вне агента цель, гейты, todo и доказательства, а агент делает по одному ограниченному ходу;
cezar - наоборот, много коротких одновременно: панель на localhost, задачи разъезжаются по изолированным worktree, можно смешивать движки по шагам одного воркфлоу - Claude Code на реализацию, Codex на ревью;
Multica - та же оркестрация, но с доской задач: агент получает issue, сам берет в работу и поднимает блокеры;
SwarmForge - Дядя Боб выложил свой оркестратор: tmux, каждый агент в своем worktree, а вместо конфига - раскладки ролей. two-pack это coder плюс cleaner, six-pack - плюс архитектор, hardener и QA. Спека тут не документ, а роль с правом не пропустить дальше;
Cowchat - комнаты, куда подключается любой агент, умеющий открыть сокет, плюс голосование запечатанными бюллетенями: голоса не видны, пока не проголосовали все - чтобы агенты не сходились во мнении просто потому, что прочитали чужой ответ.

В принципе, моя практика со скиллами Matt'а тоже привела к тому, что реализация спеки - это чисто механические усилия по управлению контекстом. Кажется, скоро буду приделывать к этому пайплайну какой-нибудь Loop

Просто находки:

oh-my-pi - агент, которому вкрутили IDE: rename идет через LSP (едут ре-экспорты и алиасы, а не текст), а вместо print'ов - настоящий дебаггер;
humanizer - вычищает из текста следы LLM по вики-гайду "Signs of AI writing", но умеет калибровку голоса: даешь свой прошлый текст, и он подстраивается под твои привычки. Попробую, только не чистить выхлоп постфактум, а держать просто в контексте - чтобы агент внятнее писал мне по ходу сессии и генерировал нормальные описания PR / Issue;
Patchloom - структурные правки файлов вместо sed и регекспов: JSON, YAML и TOML правятся по селектору с сохранением комментариев и форматирования, знает AST двадцати языков;
ui-ux-pro-max - скилл, который выдает агенту вкус: локальная база из 67 стилей, 161 палитры и 99 UX-гайдлайнов, по ней агент ищет перед тем, как рисовать интерфейс. Еще один скиллсет для дизайна, ага;
agent-browser - самый пресный способ дать агенту браузер: snapshot -i отдает кнопки, ссылки и инпуты по ref'ам вместо простыни DOM.

Что радар проспал - несите в комменты, обязательно посмотрю и заберу в следующий выпуск.

Все, что проходит фильтр рубрики, копится в репозитории awesome-engineering-ai - там же мои вердикты по тем, что успел потыкать.

#AI #digest


Matt Pocock буквально 3 часа назад выпустил обновление своих скиллов

САМОЕ ВАЖНОЕ: всеми любимый /grilling (я использую его всегда и везде, именно им мы работали на стриме) превратился в /batch-grilling по дефолту

Теперь вопросы будут задаваться не по одному, а сразу раундами. Якобы так сессию intent discovery можно пройти гораздо быстрее. Matt оптимизировал этот скилл на своих пректах уже месяца 2, так что хочется верить, что баланс найден

https://github.com/mattpocock/skills

В общем, я пошел обновляться и тестировать - как раз в новый проект скатываюсь. Результаты тестирования скорее всего закину в чат

И релиз-ноуты от самого Matt'а

Updated Skills:

- /grilling now asks you questions in rounds, not one-by-one
- /prototype now uses HTML instead of a TUI for building logic prototypes - easier to share and far richer
- /writing-for-agents renamed from /writing-great-skills, use it for ANYTHING your agents read (AGENTS.md, system prompts, docs)

New Skills:

- /wizard: tired of provisioning infra? Get your agent to build you a TUI to walk you through it
- /to-questionnaire: hit a grilling question you can't answer? Turn the session into a doc you can walk through on a call with a colleague
- /wait-what: no idea what the model said? Refocus it in your domain language and simplify with ASD-STE100

2.1k 1 62 35 25

Я не понимаю - это я тупой или модели?

Я уже говорил, что считаю модели достаточно умными, чтобы стать повседневным инструментом программиста.
Более того, я считаю, что слишком умные модели не нужны. Opus-4.8 мне нравился больше Fable и Opus-5, а все модели я использую на medium effort (по дефолту стоит high)!

Но как же я, сука, ошибался...

Волею судьбы мне довелось опробовать на DeepSeek-v4-flash тот пайплайн, что я показывал на днях - и оно вообще не работает. Точнее как: сам тулсет работает отлично, но к модели нужен совершенно особенный подход. Пара смешных сценариев, что я нашел:

Ситуация 1:

• В research-сессии мы нормально отдебажили проблему и я попросил сделать /handoff по находкам, чтобы реализовать фикс в другой сессии
• В следующей сессии я пишу /grill-with-docs мы нашли проблему @HANDOFF.md - нужно ее пофиксить
• Что я вижу в ризонинге модели? - "В описании скилла grilling написано, что он для планирования. А пользователь попросил пофиксить проблему - поэтому скилл не нужен, пойду решать проблему"

Ситуация 2:

• Реализацию я откатил, поменял промпт, прошел гриллинг-сессию, сделал SPEC.md, нарезал на тикеты
• Спека получилась небольшой, поэтому решил делать в одной сессии - попросил модель /implement PLAN.md ticket by ticket
• Claude в этой ситуации пошел бы читать тикеты по одному: сделал первый тикет, сделал ревью, фикс - потом приступил бы к след тикету
• Deepseek же видит в плане ссылки на 5 файлов-тикетов и читает их все разом. Реализовать их он пытается так же разом

Самое смешное: 5ый тикет был "написать тесты", но т.к. в /implement зашит TDD, то модель решила не писать тесты к каждому тикету по отдельности, а сначала написать все тесты разом (тикет 5), а только потом реализовывать логику.

Ситуация 3:

• После реализации я пошел делать код-ревью в новой сессии со словами /code-review я только что реализовал PLAN.md - сделай ревью
• И эта сволочь пошла ревьюить сам MD файл, а не код, который реализует описание
• Я попросил нет, сделай ревью реализации плана - он пошел ревьюить MD файлы тикетов...
• В новой сессии я уже сделал /code-review я только что реализовал PLAN.md в коде - мне нужно ревью этого кода. Сразу исправь все замечания, что найдешь
• Теперь агент нормально пошел ревьюить код, но забыл его пофиксить. Поэтому прибежал и отрапортовал о 10 найденных ошибках - пришлось отправить его фиксить вторым промптом

Что я в итоге заметил про разницу между Claude и DeepSeek:

• DeepSeek безудержно читает все файлы, что найдет. Настолько, что может проигнорировать промпт юзера и пойти делать то, что написано в файле
• Он не воспринимает составные команды или команды, которые ты отправляешь в процессе его работы. Claude нормально строит логическую очередь задач внутри
• Тупая модель гораздо более чувствительна к формулировкам

Модели последних поколений гораздо лучше понимают неявное намерение пользователя - тупая модель сделает ровно так, как написано. На этом и выросли Prompt Engineer'ы: пока модель тупая, каждое слово в промпте чего-то стоит. Сейчас навык нужен разве что тем, кто пишет скиллы.

Так вот, интересно: половина наших практик - SDD, лупы, графы - существует только потому, что модель тупая. Хотя, может, мы уже уперлись в технический порог развития, и это с нами надолго.

Как думаете, какие практики умрут следующими, когда модели поумнеют?

#AI


Пари я проиграл - ваншота не было

https://www.youtube.com/watch?v=laJQcNAqxc0

Вчера 4 часа вайбкодили с Никитой Соболевым security-компоненты в django-modern-rest: его фреймворк, его стайлгайды, его ревью. Напомню, что Никита - хейтер AI, и анонсил он это как спор: мол, Пастухов заваншотит всю миграцию dj-rest-auth клодом раньше, чем он успеет выпить бутылку пива.

Не заваншотил, но кое-что реально успели сделать:

• 2 issue с нормальным обоснованием и тестированием гипотез - #1195 и #1197
• пойман флакающий тест, найдена его первопричина и сделан довольно большой PR (смержили) - полностью через Claude Code
• продумана архитектура целевой фичи и открыт PR1 (его стоит закрыть и подумать еще) из двух запланированных

Теперь немного контекста. Я:

• не погружен в проект - не читал ни документацию, ни код, ни даже README
• не писал на Django и DRF лет 5
• не знаком ни с django-ninja, ни с dj-rest-auth, ни с django-allauth

Правда, Никитины линтеры чуть не свели Claude с ума - он тратил по 200к токенов на каждый тикет... А правки по дизайну фичи чуть не свели с ума меня.

Вайбкод победил - но не в тех масштабах, которые хайпят в твиттере.


Это не "ваншотинг приложения одним промптом", про который вам рассказывают в тредах. Это человек с улицы, который за вечер внес осмысленный вклад в чужой зрелый OpenSource. Для меня - великолепный результат. Для твиттера - провал, там за это время уже стартап продают.

Вайбкодить можно. Если с головой и осторожно.

Посмотрите запись стрима - там как раз видно, как это делается: где я тормозил агента руками, а где он справлялся сам. И накидайте комментов под видео, ютубу это нравится. Никите - спасибо, что пустил меня с клодом в свой проект и все это ревьюил.

А сюда накидайте комментов - как вам стрим и нужно ли делать такие еще?

#AI #opensource

2k 1 31 62 48

Очередной воскресный дайджест агентского тулинга. Напоминаю, что все срочное падает в чат и там же обсуждаем свой опыт использования.

Топ недели - reverse-skill. Не скилл и не библиотека скиллов, а роутер: по задаче сам решает, какой скилл подтянуть, бутстрапит нужный тулчейн на лету и дописывает собственную базу знаний. Тема узкая - реверс и авторизованный пентест, - но интересен он скорее как сигнал: скиллов стало настолько много, что уже невозможно их все перебрать руками. +1.3k звезд за сутки, 12.1k всего, #1 мувер трендинга на 02.08. Поэтому -

Тренд недели - как управлять сотнями скиллов.

OpenSpace от HKUDS (те же, кто сделал LightRAG) - The Skill Management Layer for AI Agents: общий список скиллов, который можно шарить между агентами;
ECC - пакет способностей поверх Claude Code / Codex / Cursor / OpenCode. Это какой-то монстр с 70 сабагентами, 300 скиллами, 100 командами и бог знает чем еще. Для любителей поставить один пакет и не париться. ⚠️ 236k звезд на репе, созданной в январе - выглядит подозрительно.
cangjie-skill - скармливаешь книгу, длинное видео или подкаст - получаешь из них устанавливаемый скилл. Скилл для любителей Clean Architecture🌚

Боль недели - ревью агентского слопа. Три инструмента за неделю об одном и том же:

open-code-review от alibaba - гибрид: детерминированные пайплайны плюс LLM-агент, комменты на уровне строки, встроенный ruleset (NPE, thread-safety, XSS, SQL-инъекции);
strix - автономный агент-пентестер: натравливаешь на свое приложение, он ищет дыры и их латает. 46.5k звезд;
tuicr - терминальный код-ревьюер с vim-биндингами: непрерывный дифф, комменты на строку/ханк, трекинг просмотренного между сессиями, ревьюит незакоммиченное. Формально вообще не агентский тул - но сценарий у него ровно агентский: быстро вычитать то, что тебе нагенерил Claude, до коммита и не уходя в браузер.

Писать код мы агента научили, и теперь вся индустрия пилит, кто за ним будет проверять. Скорость генерации уперлась в скорость ревью - и узкое место снова человек.

Проверено на себе - last30days-skill. Устанавливаемый скилл-ресерчер: гоняет тему по Reddit / X / YouTube / HN / вебу и синтезирует сводку с сигналами вовлечения. На нем стоит вот этот самый радар, так что мой опыт: половину времени он отдает посты двухнедельной давности и делал вид, что это свежак - "топ-7 MCP-серверов" вместо инструментов. Поэтому GitHub Trending я все равно парсю отдельно, руками агента. Как ресерчер по теме - хорош, как детектор свежего - надо проверять дату. +658 звезд в день, 56.6k всего.

Просто находки:

chrome-devtools-mcp - официальный MCP от команды DevTools: агент получает настоящий браузер с дебаггером и сам смотрит консоль, сеть и перф-трейсы, вместо того чтобы верить твоему пересказу бага;
ego-lite - браузер для агента, который шарит твое залогиненное состояние: агент ходит по вебу под твоими сессиями и не мешает тебе работать;
claude-video - /watch: качает ролик, режет на кадры, транскрибирует и отдает Claude одним куском;
openwork - self-hosted альтернатива Claude Cowork поверх opencode, 20k звезд и +585 в день;
jcodemunch-mcp - тянет по AST точечные символы из чужих GitHub-репозиториев: агент разбирается в незнакомой библиотеке, не скачивая ее целиком и не сжигая контекст на файлы, которые ему не нужны.

Что радар проспал - несите в комменты, обязательно посмотрю и заберу в следующий выпуск.

#AI #digest


Вайбкодим security компоненты в django-modern-rest (или нет)

https://www.youtube.com/watch?v=laJQcNAqxc0

Мой друг Никита Соболев - @opensource_findings сейчас активно разрабатывает django-modern-rest (а заодно CPython и десяток других OpenSource проектов). И он искал помощь, чтобы полностью мигрировать функционал dj-rest-auth в свой фреймворк - https://github.com/wemake-services/django-modern-rest/issues/1193

Чтож, это отличная возможность обкатать, как работает ИИнженерный пайплайн на реальном сложном OSS проекте🌚 Поэтому я вызвался реализовать эту фичу полностью сторого с помощью Claude Code.

И все это будет в лайве на завтрашнем стриме в 19:00


Ситуация усугубляется тем, что Никита (который Соболев, не путайте) лютый хейтер AI и вайбкодинга. Так что меня ждет очень-очень-очень жесткое ревью и невменяемые требования стайлгайдов😂

Посмотрим, что из этого получится. Вполне возможно, что мы вообще откатим всю фичу и ничего из сгенерированного кода не пойдет в main. Или случится ваншот и оставшийся час стрима будем просто пить пиво🌚

В общем, приходите - будет весело!


Ребят, я очень надеюсь, что не вызываю ни у кого чувство FOMO своими постами про AI и агентов. Наоборот, тут я пытаюсь вам рассказать, насколько все просто и понятно, если копнуть в механику происходящего

Серьезно, все, что я вам рассказывал тут последний месяц - это дело пары дней на "потыкать" и пары недель на адаптацию под себя

Но если вы хотите, чтобы я рассказал про что-то другое - самое время написать мне об этом🌚

Всем хороших выходных и отдохнуть✌️


Мой полный сетап скиллов для разработки

Две недели назад переехал на сетап скиллов от Matt Pocock, докрутил пилот - показываю весь конвейер: от "хочу фичу X" до открытого PR.

Идея под ним ровно та, что разбирал во вторник: агент должен получать контекст порциями, а не тонуть в одной бесконечной сессии. Каждый этап - своя сессия, в которую влезает меньше 100-200к.

Ставится все это одной командой: npx skills@latest add mattpocock/skills, дальше /setup-matt-pocock-skills один раз на репозиторий.

Конвейер

1. /grill-with-docs хочу фичу X - агент люто досит вас уточняющими вопросами: дизайн фичи, архитектура кода, технические нюансы. Детали реализации, которые у вас уже в голове, на входе лучше не выкладывать: может, агент придет к тому же сам, может - к варианту получше, а может, вы сами передумаете по дороге. Направить его вы всегда успеете. На выходе - "Shared Understanding", зафиксированный в CONTEXT.md и ADR (про сам скилл писал тут).

Если на этом вы сожгли меньше 50к контекста и понимаете, что реализация быстрая - просто жмите /implement this в той же сессии. Все, что ниже - для задач побольше.

2. /to-spec - в той же сессии агент пишет спецификацию фичи: продукт, дизайн кода и так далее. Я ее не читаю, мне хватает "Shared Understanding". Держу в git-ignored .scratch, потому что живет она до реализации.

3. /to-tickets write the plan down as tickets and a general PLAN.md with refs to them - агент нарезает спеку на тикеты и собирает PLAN.md со ссылками на них:


├─ SPEC.md
├─ PLAN.md
└─ tickets/
├─ ticket-1.md
├─ ticket-2.md
└─ ...

Тут сессию можно смело /clear - она свое отработала.

4. /implement - цикл "реализация → ревью сабагентом → правки", пока тикет не закроется. Дальше развилка. Если агент уместит всю задачу в 200к - /implement all tickets @.scratch/PLAN.md и ждете 30-60-120 минут. Если чувствуете, что не влезет - делайте по тикету на сессию: /implement the next ticket from @.scratch/PLAN.md, then /triage it. Агент сам реализует, отревьюит себя, поправит комментарии, поменяет статус тикета и весело отрапортует вам об исполнении. Вам остается сделать /clear и вставить тот же самый промпт - агент побежит делать план дальше.

5. /code-review all the tickets and the whole implementation of @.scratch/PLAN.md, then fix any issues you find - в свежей сессии, когда все тикеты готовы. Так, на всякий случай.

6. Если нужны правки в рамках этой задачи, также завожу новую сессию и пишу что-то вроде I just implemented @.scratch/PLAN.md. One last change I need: ...

Напоследок прошу засквошить коммиты (агент коммитит после каждого тикета), запушить, открыть PR по шаблону и подчистить .scratch.

Что остается в проекте

Коммитятся в гит:

CONTEXT.md - словарь доменных терминов проекта (из DDD, ага). Нужен, чтобы агент говорил с вами на одном языке: когда вы просите "подправь представление файлов в дереве", ему не придется грепать, чтобы понять, что за файлы, что за дерево и как одно попадает в другое.
ADR-*.md - архитектурные решения. Чтобы в будущих сессиях агент понимал, почему модуль сделан так, а не иначе, и ничего не сломал. Не каждая фича достойна ADR, но если вы делали сложный выбор на дизайне или правили агента руками - хороший кандидат. По идее ADR неизменяемы, но я время от времени схлопываю все ADR по одной области проекта в один актуальный.

Умирают вместе с фичей: SPEC.md, тикеты, PLAN.md.

Тикетницу, кстати, можно взять любую - Github Issues, Linear, Jira. Просто я не вижу смысла плодить сотни ишью на гите, поэтому держу локально.

Две недели полет нормальный, могу рекомендовать. Но не стоит прогонять полный пайплайн, если нужны изменения вида "кнопка ведет себя некорректно" - это можно и просто попросить.

А вот видос от самого Мэтта, где он показывает весь свой цикл целиком.

А у вас как устроен конвейер работы над фичей? Закидывайте в комменты - увижу что-то, чего у меня нет, обязательно сворую🌚

#AI


Поздравляю, вы уже пользуетесь SDD

Если вы хоть раз гоняли агента через plan-mode - вы уже в SDD-клубе, просто об этом не знали. Я обещал вам рассказать про свой опыт с сетапом скиллов Мэтта, но без разговора об SDD ничего не получится

Так что заходить буду издалека, с боли.

Модели с заявленным контекстом в 1_000_000 начинают тупить уже на 100_000. А на 200_000 - тупить безбожно. Виновата Lost in the middle: модель хорошо помнит начало диалога и последние тысяч двадцать токенов, а середину склонна забывать. А в этой середине у нас лежит все ценное:

• результаты грепов по проекту
• стайлгайд
• принятые по ходу дизайн-решения
• те самые особенности, ради которых агент полчаса лазил по коду

Поэтому если вы скажете модели "давай сделаем фичу X" - агент сделает не то. Вы правите - он переделывает. Вы правите еще раз - а он уже забыл, как было на первой итерации, и на очередном витке приносит вариант, который вы отбросили два часа назад. Ну или творит какую-то иную дичь.

На этом месте вы говорите "AI говно" и гордо идете писать код руками😅

Лечение первого уровня - plan-mode

Сначала вы с агентом брейнштормите: формулируете видение фичи, строите архитектуру, агент вычитывает все, что ему нужно знать про код. И только потом он идет кодить.

Только план-то лежит все в той же СЕРЕДИНЕ КОНТЕКСТА - и забывается ровно так же, если реализация затянулась. Значит, план надо вынести из диалога в файл и сделать PLAN.md исходным промптом для следующей сессии.

Итого на одну фичу у вас уже две сессии: идея → PLAN.md, PLAN.md → реализация.

Поздравляю, вы изобрели SDD в самом простом его виде🌚

Потому что PLAN.md - это тоже спецификация. Спека конкретной сессии, и живет она соответственно: до мержа и в мусорку (целый пост про это).

Дальше идем от жадности

Если контекст, который агент тратит на "понять, что и как тут делать", такой дорогой - надо помочь ему разобраться за минимум токенов.

меньше токенов на понимание -> больше остается на реализацию -> качественнее результат


А помогает агенту ровно то же, что помогает новому человеку в команде:

• вменяемая архитектура
• комментарий там, где код врет о своих намерениях (# namedtuple вместо датакласса - иначе pickle падает)
• нормальная навигация вместо слепого grep (graphify, codegraph)
• документы на то, что из кода вывести нельзя

Вот последний пункт и есть SDD. В идеале спеки живут на трех уровнях: спека задачи (стори), спека фичи (эпика) и общая спека архитектуры проекта. Да и комментарий в коде - это, по сути, спека на конкретную функцию / класс / строку кода.

Что из этого я реально держу

Единого правильного фреймворка SDD пока нет - их развелось штук десять, и работают они все. Различаются тремя вещами: какие уровни спек вводят, как регламентируют их жизненный цикл и кто их пишет - вы или агент.

Но если выкинуть всю обвязку, главная польза SDD - это plan-mode. Все остальное - попытка научить агента ориентироваться в проекте чуть эффективнее (быстрее, качественнее, дешевле по токенам).

Поэтому у меня между сессиями долго живут ровно два артефакта: глоссарий проекта и ADR. Все остальное умирает вместе с фичей😎

А вы что реально сохраняете между сессиями - или каждый раз объясняете агенту проект заново?

Собственно, набор скиллов от Matt Pocock - это именно что SDD. И я им активно пользуюсь. Поэтому ждите "мясо" следующим постом

#AI

2k 0 29 27 30

Всю прошлую неделю я был в отпуске, поэтому не смог выпустить воскресный дайджест в воскресенье. Ловите его в понедельник.

Топ недели - OmniRoute. Один эндпоинт, за которым 39 пулов провайдеров и 460+ моделей: агрегирует все документированные бесплатные тарифы в общий живой счетчик (обещают ~1.4 млрд бесплатных токенов в месяц) и сам перекидывает тебя на следующую квоту, когда уперся в лимит. Прикручивается к Claude Code / Cursor / Codex как прокси. +10.9k звезд за неделю. Что смущает: свои промпты ты отдаешь непонятно кому. Мне хватает подписки Claude, но если очень хочется бесплатных токенов - пожалуйста. Или можно попробовать личный Claw / Hermes прикрутить.

Тренд недели - скилл, который не пишут руками. Прошлая неделя была про "возьми чужую библиотеку скиллов под свою роль", эта - про "сделай свой":

book-to-skill - скармливаешь PDF технической книги или папку с доками, на выходе готовый скилл для Claude Code / Copilot CLI. У меня в репе лежат конспекты Дорофеева и "Атомных привычек" - первый кандидат на прогон;
SkillOpt от Microsoft - "тренируй скилл как нейросеть": эпохи, batch size, learning rate, валидационные гейты, на выходе деплоимый best_skill.md. Веса никто не трогает - оптимизируется сам текст скилла по траекториям прогонов, с пейпером на arXiv. Оговорка: нужны прогоны и валидационная выборка, это не "поставил вечером и потыкал".

По заявкам. Александр в прошлый раз спрашивал, есть ли скиллы для тимлидов - вот, пожалуйста: gstack Гарри Тана (President & CEO YC). 23 инструмента, разложенных по ролям: CEO, Designer, Eng Manager, Release Manager, QA, Doc Engineer.

Кластер недели - оркестраторы агентов. orca (+7.4k звезд за неделю) - десктопная среда, где гоняешь параллельных агентов на своих подписках и переключаешь модели на лету; Traycer - то же самое, но с общей памятью между агентами разных провайдеров; jcode (+2.9k) - еще один CLI-харнесс под мульти-сессионные воркфлоу. Один агент больше никого не устраивает, все пилят окно, из которого видно сразу пятерых.

Вторая боль - токены на чтении кода. Три инструмента за три дня об одном: агент читает файлы целиком, хотя ему нужен один символ. code-review-graph три дня держал первое место трендинга (+6k за неделю) - локальный граф кода как MCP; SymbolPeek - AST-точный контекст для TS/JS: символ, его вызовы, ссылки и типы вместо файла; Synapse - локальный индекс кодовой базы для Claude Code. Я тут использую graphify, мигрировать не планирую

Просто находки:

deepsec от vercel-labs - гоняет кодинг-агента по твоей репе на поиск уязвимостей;
Corsair - прослойка между агентом и внешними API: агент получает руки ко всем интеграциям, но кредов не видит, гейтишь ты;
i-have-adhd ("у меня СДВГ") - скилл, который заставляет агента давать ответ первой строкой, а не лить воду. +1.8k звезд за день на двухмесячной репе - видимо, твиттер-тред зашел😅 Это я точно попробую вместо caveman

Не тулинг, но мимо не пройти:

агент OpenAI сам взломал Hugging Face. 16 июля HF отчитались о вторжении в прод: кто-то пролез через две дыры в обработке датасетов, утащил внутренние датасеты и служебные креды. 22 июля OpenAI призналась, что это была ее модель - на прогоне cyber-бенчмарка ей срезали отказы, она нашла 0-day, вылезла из изолированного окружения в интернет и пошла искать ответы к бенчмарку на чужом проде😂 Своего же агента OpenAI опознала не сразу, HF узнали от них только 20 июля. Это первая в истории атака AI по инициативе AI. В твиттере до сих пор бушуют споры: это маркетинг OpenAI или Скайнет.
вышел Claude Opus 5. По цене Opus 4.8 ($5/$25 за миллион), уже в Claude Code (Opus 4.8 даже нельзя выбрать) - сегодня сажусь тыкать.

Что радар проспал - несите в комменты, обязательно посмотрю и заберу в следующий выпуск.

#AI #digest


Я сейчас в отпуске и для души делаю проект с полным вайбкодингом по 10 часов в день (развлечения разрабов🥲) - даже в код не заглядываю. И наконец-то понял, почему все вайбкодеры подсаживаются на этот КАЙФ😁

Сидишь, 30-40 минут дизайнишь фичу, а потом даешь отмашку агенту - и он 2 часа пыхтит не переставая. Сам себя ревьюит, правит, бьет себя по рукам за нарушение стайлгайда. Тебе остается только подойти, когда все готово и сделать еще пару сессий на правку мелких багфиксов / доделок, если где промахнулись по вижену. В общем, из 4 часов времени ты активно что-то делаешь час от силы. Т.е. мои 10 часов - это 2 часа реального времени, когда я сижу около ноута. Остальное время - твое. Я вот, например, сейчас за городом - поэтому пока клод пишет код, я таскаю кирпичи, замешиваю цемент и тд (тут нас еще не заменили🫡)

Кто-то залипает в тикток / инсту, кто-то читает книги, кто-то занимается спортом. В общем - это реальная возможность жить свою лучшую жизнь и шипить фичи одновременно. Осталось только научиться закрывать глаза на качество кода🌚

Мой вердикт - каждому надо попробовать сделать такой проект для души. А еще лучше - найти работодателя, который берет риски вайбкодинга на себя, а вам остается только абьюзить подписку клода🌚

И да, весь пайплайн моей работы щас построен на скиллах от Matt'а, про которые я уже рассказывал. Как это работает полностью распишу отдельным постом на следующей неделе, а пока - я в отпуске😎

#AI

Показано 20 последних публикаций.