Макеев: как перестать вайбкодить и начать жить


Channel's geo and language: Russia, Russian


Основатель компании Surf.
Рассказываю про: AI SDLC и AI.
Приемная: @vmakeev

Related channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Супер-дизайн


Ну кайф же


Мне очень нравится идея Jev https://typesafe.ai/blog/introducing-system-one-models-and-jev

На вход получают контекст и варианты ответов. Взяли небольшой трансформер, на выходе не генерируют текст, а разом выдают вероятность ответов. Это можно использовать как fuzzy классификатор или как вероятности необходимых в данный момент действий. И это достаточно, чтобы играть в Doom, змейку, Fluppy Bird. Основной кейс применения — это встраивание в пайплайн, где нужна быстрая классификация. У нас в нескольких системах в проде для этого используется Gemini 2.5/3, она относительно быстро определяет по какой ветке алгоритму дальше нужно идти. Но это долго, потому что надо ждать генерация структурированного текста. Получил доступ к Jev, буду тестировать.

Из того, что по этому поводу вчера было в сети, больше всего понравилось это: https://github.com/vllm-project/vllm/pull/57250. У Google был смазанный релиз DiffusionGemma, которая очень быстро умеет генерировать текст с помощью Diffusion, итеративными уточнениями заполняя пропуски. Это очень недооцененная вещь, к которой относятся как у LLM. Но её сила в скорости, в одновременности генерации пропущенных токенов, и еще она умеет заполнять пропуски токенов между правой и левой частью — вписывать в контекст. Ну так оказалось, что DiffusionGemma из коробки может работать как Jev.

И ещё это породило у меня в голове такую конструкцию. Что если у нас будет трансформер, а ниже будет встроенный Jev как орган его мозга, который оценивает вероятность, нужно ли еще итерацию подумать (chain of thounght на уровне латентных векторов, не текстом), или нужно вызвать какой-то tool, или пора напечатать ответ.

Короче, Jev — очень простая идея из серии, жалко, что не я придумал, очень сильно ощущал в ней потребность.


1. Оказалось, что нет исследования, что SDD кому-то исчислимо помог.
2. Если спека не должна быть Вики, то в ней высокоуровневые идеи. Где грань, что должно в них оседать, а что должно сразу в код? А если не соблюсти это? А что-то изменится от дисбаланса?
3. Например, openspec оперирует только сценариями, можно форкнуть и завести свой шаблон спеки. Что будем включать туда? Почему? Это сильно проектспецифичный вопрос, в каждом проекте будут свои необходимости.
4. А что если SDD вообще не будет в проекте? А что если у агента жопа не отвалится, если у меня будет папка docs c md тз в произвольной форме?

Я думаю, что если подключить к openspec/spec-kit к проекту, они не помешают. Но и существенно ничего не привнесут. Наверно, профит может быть, если делать это с умом, понимать, как ты валидируешь требования, как ты валидируешь результат, как приходишь к детерминированности. Короче, думать надо. А вокруг SDD много фетиша, воспринимается как серебрянная пуля. На самом деле что есть что нету.


У инженера осталось две задачи — формулировать смыслы (что надо сделать) и валидировать результ. И это одно и то же, в цикле и много раз. Посмотрел, что получилось, доформулировал. Раньше нажимал build, теперь generate. Формулирование смыслов и валидация — перманентный процесс.


Спека — всегда не полная. Даже если станет в 10 раз толще.
Делать спеку толстой в пытаться сделать водопад — абсурдно, потому что цена изменений реализации почти бесплатная.
Всего не учтешь сразу. Поэтому ценно быстро делать прототипы, смотреть не результат, давать обраную связь агенту, получать обратуню связь от заказчика/пользователя.


• И еще спека не должна превращаться в википедию. Не надо с неё начинать любые изменения в коде. Большая часть изменения должна делаться агентами сразу в коде. В спеке — только фундаментальное.
• И если ваш SDD flow перемудренный, то он не работает.
• И вообще SDD не панацея.


sdd-youtube-research-complete.zip
88.4Kb
10 саммари ютуб видео про SDD, поговорите с этим зипом, сделайте выводы для себя


Сделал CLI-утилиту, которая уже круто показала себя в проектах, называется katana.

Проблема многих проектов — крупные файлы на несколько тысяч строк. Они мешают агентам: их долго читать, и забивается контекст. А агенту тяжело их разрезать — нужно долго читать, а потом долго писать куски нарезки, и т.к. это проходит через LLM, привносится недетерминированность.

katana позволяет агенту архитектурно красиво разбивать файл без его чтения и записи. CLI даёт агенту сигнатуры всего содержимого файла, это работает через AST. Агент проектирует красивое разбиение, возвращает katana JSON с проектом разбиения, katana детерминированно разрезает файл, импорты фиксятся линтером. Профит. Т.е. агенту не пришлось ни читать, ни писать. И работает быстро. И ещё CLI умеет считать lines of code по проекту, чтобы задать приоритеты.

В проектах обычно ставлю максимальную длину файла 700 строк + до 10% превышения, при котором разрезание ещё не срабатывает. Без такой гигиены не будет никакого AI-agent-first.

Можно быстро привести к норме легаси-проект или не запустить новый.

katana пару месяцев жила во внутреннем репозитории и показала эффективность, теперь переехала на GitHub — могут быть баги.

https://github.com/vgmakeev/katana




Запускайте иногда
uv cache prune
для очистки неактуального кеша зависимостей uv.
130 Гб почистил.


Forward from: Директорат Surf обсуждает
Итоги Рейтинга Рунета для Surf — гордимся командой и благодарим клиентов

В этом году мы снова доказали экспертизу в мобильной разработке. Забрали награды и восхищаемся всеми, кто помог достичь этого результата. Наши команды разработки, анализа, тестирования и дизайна, проджекты, девопсы — все они подтвердили профессионализм и оправдали доверие клиентов.

🏆 Достижения Surf в рейтинге:

🟠 3 место — «Подрядчики с экспертизой в отрасли Питание (разработка, интеграция)».

🟠 4 место — «Разработка и развитие мобильных приложений».

🟠 8 место — «Подрядчики с экспертизой в отрасли Торговля (разработка, интеграция)».

🟠 9 место — «Подрядчики крупного бизнеса (разработка, интеграция)».

Планка поднята высоко, в нише заказной разработки участвовали более 1000 агенств, но останавливаться мы не планируем. На полке ещё полно места для наград. Ознакомиться с кейсами, которые принесли нам классные результаты, можно на сайте.


Forward from: [38/100] Витя Тарнавский
Ребятам, которые увлеклись вайбкодингом.

Если вы смогли сегодня что-то навайбкодить – завтра это сможет сделать любой школьник. Вам может казаться что ваш эйджент сворм самый крутой – оглянитесь потом назад после выхода следующего opus/codex.

Ценность перетекает в другие места. Отношения, нетворк, GTM, глубокая доменная экспертиза etc.

Вайбкодинг – новая база. Разобрались, освоили – и вперёд отращивать то, чем вы будете ценны хотя бы через полгода.

2k 0 17 11 46

Forward from: Директорат Surf обсуждает
Привет! С вами Владимир Макеев, CEO Surf. Делюсь крутыми новостями: наша компания взяла сразу четыре престижные награды на Workspace Digital Awards!

Воркспейс одна из самых авторитетных премий в диджитале, победителей тут выбирают лидеры индустрии и представители крупнейших брендов. Конкуренция была жесткой, но мы в очередной раз доказали свой уровень.

Наши результаты в этом году:

🥇 Два золота — мобильное приложение Бургер Кинг и По любви.

🥈 Два серебра — снова одно у Бургер Кинг и мобильное приложение Sellplus (ROWI).

Хочу выразить огромную благодарность нашим клиентам, этот триумф — результат вашего доверия.

Поздравляю всю компанию с большими достижениями. Ну и пишите нам, чтобы сделать проекты, которые завоюют главные рыночные награды.




Наш Head of QA Маша Лещинская написала статью, который стоит прочитать всем, кто работает с AI-разработкой.

Это разбор внутреннего пет-проекта (система бронирования девайсов для QA), который должен был умереть через неделю после релиза. А вместо этого живёт три месяца, оброс 23 фичами и превратился в полигон.

Внутри:
→ Где AI облажался по-крупному. God object на 305 KB. N+1 запросов к Firestore. XSS через innerHTML. Тест для фичи, которой не существует. И главное — как ловить такое до прода, а не после.

→ Где, наоборот, удивил. Например, сам предложил Screenplay pattern + Page Objects на 38 задач — архитектура, которую не каждый сеньор соберёт.

→ Сколько по времени реально стоит фича, если делать «как надо». Спойлер: обеденный перерыв. Но с честными нюансами.

https://habr.com/ru/articles/1038990/


Неделю кайфую от https://herdr.dev/ — агентский UI мечты. Сессии — это проекты/контексты слева сверху. Ниже запущенные агенты со статусами. Справа табы терминала. Я так и не разобрался в warp, чтобы сделать так наглядно. Обычно параллельно работаю с 4 проектами или 4 агентами в одном проекте. И в течение недели переключаюсь между примерно 7 проектами.
UI Zellij мне не зашел. А с tmux тоже не удобно, когда много проектов.
Короче, рекомендую и для работы на локальном компьютере, и на удаленном.


Anthropic сломали Opus-4.7. С конца прошлой недели стал супер-медленным и тупым. Очень его любил.
Пересел на codex gpt-5.5 high — вот где оказался AGI и скорость.
Вывод: компании нужно сидеть на двух стульях.


Forward from: e/acc
кто тут work/life баланс просил?


Я так и не понял, зачем мне OpenClaw/NanoClaw и т.п.

У меня личная ОС на основе письменных рефлексий в Remarked, расшифровок Telemost в Obsidian + git + Claude Code.

Happy — для разработки с телефона https://github.com/slopus/happy, спасибо @nekdenis за совет, идеальный апп, стабильнее remote режима Anthropic. Но не часто этим занимаюсь, по мне это вредно для психического здоровья )

Настроил tailscale, zellij для разработки на удаленном Mac Mini. Но в реальности чаще работаю на Macbook, из какого-нибудь датасета на несколько Гб, который на зальешь в git. Можно перебрость на Mac Mini через Tailscale или Airdrop, но всегда некогда. На самом деле, надо поставить всё на паузу и навести в этом порядок, чтобы всё было Mac Mini-first.

Я чего-то недопонимаю?

2k 0 25 4 17
20 last posts shown.