КайфКодинг


Гео и язык канала: Россия, Русский
Категория: Технологии


ВайбКодинг с Артемом Кругловым,
выпускник МФТИ, AI-гуру и основатель AnyQuery.
Быстрые лайфхаки: короткие видео с приёмами и трюками

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Человек не стал в сотый раз объяснять сыну, что нельзя орать в наушниках посреди ночи. Он написал приложение, которое сворачивает игру, когда тот орёт.

Разработчик под ником omricn выложил 19 августа в r/ClaudeCode утилиту S.T.F.U — Sound Trigger Focus Utility. Она сидит в трее Windows, слушает микрофон и при первом запуске калибруется: помолчи, поговори обычно, а теперь крикни. Дальше работает по порогу между обычным голосом и криком.

Первый крик за сессию — игра сворачивается, играет звук, на весь экран вылезает сообщение, которое надо прокликать четыре раза, и кнопка закрытия после каждого клика прыгает в новое место. Каждый следующий — сразу выброс на рабочий стол и десять секунд с сообщением.

3 405 апвоутов и 683 комментария, верх недели в r/ClaudeCode.

Разговоров хватало минут на двадцать. Это прикидка отца, точнее он не пишет. Приложение меряет громкость каждые двадцать миллисекунд.

Оно специально не прячется: иконка в трее, на первом экране написано, что оно делает, сын знает, что оно стоит. Автор пишет, что иначе оно и не работает — привожу в переводе.

Как скрытая ловушка — будет найдено, вызовет обиду и снесено. Оно и не рассчитано это пережить: любой с правами администратора убьёт любой процесс.


Теперь главное. Единственное, что мешает всё отключить, — ПИН на настройках и на выходе, и сам автор называет его лежачим полицейским, а не замком. А ещё в приложении есть режим, где оно только пишет лог и не вмешивается: автор советует прогнать в нём первую ночь и по отчёту посмотреть, то ли оно ловит.

То есть у ограничителя сначала проверяют журнал и только потом — умеет ли он мешать.

У вас на агенте конструкция та же. Гейт подтверждения, хук, список разрешённых команд живут внутри периметра агента и держатся на том, что он не пошёл в обход. Замок — это то, что снаружи: контейнер без сети, ключ, которого нет на диске, отозванный токен.

Что сделать сегодня. Возьмите самый строгий запрет своего агента и найдите место, где записывается момент, когда агент в него упёрся. Признак простой: если вы не можете утром открыть файл и увидеть время срабатывания — у вас не ограничитель, у вас надежда.

Честности ради, автор сам называет предел своей конструкции: сын научится орать тише, а не реже. Ограничитель меряет громкость — значит, оптимизировать будут громкость. У вашего гейта та же болезнь: он меряет форму команды, а не намерение.

https://old.reddit.com/r/ClaudeCode/comments/1vsk86i/my_son_screams_while_gaming_at_midnight_im_a/

Когда ваш агент последний раз упёрся в ваш запрет — где вы это увидели?


Коммиты на GitHub удвоились за четыре месяца. Столько разработчиков за четыре месяца нигде не появилось.

Влад Фёдоров, технический директор GitHub, разбирает аварию 17 августа — семь часов сорок семь минут — и по дороге приводит цифру: с апреля коммитов в месяц стало 2,9 миллиарда вместо 1,4. Обе августовские аварии он называет отказами по ёмкости, а не по коду. В его формулировке:

Рост объясняет давление на наши системы, но не оправдывает эти аварии.


Слова «агент» в постмортеме нет ни разу.

Счётчик коммитов больше не меряет, сколько работали люди. Если ёмкость своего CI вы планируете от числа людей в команде, база устарела ещё в апреле.

https://github.blog/news-insights/company-news/the-august-17-outage-and-the-work-ahead/


Репост из: e/acc
В Пекине прошла очередная Олимпиада роботов со своей роботической церемонией открытия, 51 спортивной дициплиной.

Больше 2000 роботов из 600+ (больше 90% из Китая) команд сыграли больше тысячи матчей.

Например, в беге победитель пробежал стометровку за 9.39 сек, что больше рекорда человека (9.59 с). Для сравнения, самый быстрый робот в прошлом году пробежал за 21 секунду.

Для почти всех дисциплин в этом году требуется полная автономия, то есть запрещены телеоперации и управление с джойстика. В некоторых случаях типа уборки помещений это возможно, но тогда очки команды делятся на 2.

Выводы:
1. Через несколько лет, я уверен, почти не останется дисциплин, где роботы не превосходят человека
2. Роботика вне Китая это конечно смех. Тесла, наверное, молодцы, но они совершенно не конкурентны по цене
3. Самое веселое это не только победы, но забавные ситуации когда роботы бегуны и теннисисты искрят, ломаются пополам, теряют голову, руки, ступни.


Ваш самый вылизанный промпт — это работа, которую вы сделали за агента. Грейс Кларк спросила об этом своих учеников напрямую, и они согласились.

Грейс учит людей работать с AI, до этого была маркетинг-консультантом. Ученикам она раздавала огромные заготовки промптов — чтобы человек быстрее дошёл до первого результата. На занятии она спросила, не делает ли она этим работу за них. Ей ответили, что делает.

Свой собственный рабочий промпт она к этому моменту уже переделала в обратную сторону.

Было — выверенный кусок текста. Стало — разговор на три-четыре минуты.

Инструкцию к своему главному инструменту она надиктовала с телефона на прогулке. Начала с запрета: никогда меня не интервьюируй, работа не должна ложиться на человека. Дальше — чего она хочет вместо. Её слова:

Он должен изучать тебя и возвращаться с сильной идеей, на которую ты отреагируешь.


Длинный промпт и интервью агента — одна ошибка с двух концов. И там, и там человек выкладывает контекст руками, пока агент ждёт. А контекст к этому моменту уже лежит в почте, календаре и документах, к которым агент подключён.

Против вопросов как таковых она при этом не возражает. Агент в том же разговоре вернулся со своим вариантом и сам спросил, что она думает, — её это устроило. Её формулировка ещё жёстче: это агент должен вытащить промпт из вас, а не наоборот.

Разница не в том, есть вопросы или нет, а в том, приходит агент с ними пустым или уже посмотревшим.

Держится всё это на одном условии, и она его называет прямо: изучать вас агент может ровно настолько, насколько к нему подключено. Она подключила всё, что смогла, а для остального написала свои коннекторы и плагины — писать в гугл-таблицы и гугл-документы агент, по её словам, толком не умеет.

Что сделать сегодня. Откройте промпт, который вы дольше всего вылизывали. Вычеркните из него всё, что агент мог бы прочитать сам в подключённом источнике. Что осталось — и есть ваша настоящая постановка задачи.

Честности ради, у Грейс в записи не всё гладко: в живом демо агент вместо черновика подставил исходное письмо. Про сборку почтового клиента она говорит прямо — жаль, что не вышло с одного захода.

https://www.youtube.com/watch?v=o_eg2TtXAO0

Сколько строк в вашем самом длинном промпте агент мог бы узнать сам?


А вы пробовали играть в "Лилу" с ЧатГТП (голосовой режим)?


Репост из: Сергей Булаев AI 🤖
Не знаю как вы, а я постоянно слышу как кто-то заменил себе какой нибудь SaaS, на инструмент, написанный Клодом (или кем то другим). Но доказательств обычно не приводится.

Решил провести эксперимент. Заменить что то у себя.

Мы платили 60 долларов в месяц за Calendly. Три человека. Сервис букинга встреч с синком с гугл календарем. Куда уж проще, календарь и ссылка на запись.

Спросил Клода, есть ли живой open source аналог, он сказал что Cal.com отказался от опенсорса и ничего серьёзного не осталось, позже это оказалось не совсем правдой, но было поздно. Очень хотелось.

На самом деле Cal.com в апреле переименовали в cal.diy и отдали под MIT. Хоть лицензию и сделали свободнее, из кода при этом вырезали команды, workflows, insights и SSO, одним коммитом на минус 411 тысяч строк. Вторая строка их же README — strictly recommended for personal, non-production use. То есть ребята сами написали, что в проде это лучше не запускать.

Релиза нет с марта, докер-образы давно заархивированы, и чтобы это поднять, нужен сервер с Node и PostgreSQL. Немножко инфры.

Решил попробовать сделать своё. Сразу на Cloudflare, там на наших объёмах - бесплатно. Ну и я честно говоря всё ещё их фанат.

Начал в субботу. От пустого репозитория до задеплоенного продукта. 127 коммитов, 525 тестов. В будние доделывал по остаточному принципу - 8м проектом. Назвал Punctual. Ну название тоже клод посоветовал.

Внутри в том числе то, что у cal.diy вырезали, команды с round-robin и collective, плюс Google Calendar и Microsoft 365, письма с .ics и напоминаниями, REST API, вебхуки и виджет для встройки.

И MCP сервер. То есть агентами тоже можно пользоваться и букать встречи.

Всё живёт на одном воркере: Workers, D1, Durable Objects, Queues, KV, R2, Cron. Ни сервера, ни базы, ни докера. wrangler deploy в свой аккаунт, минут пятнадцать, ноль долларов в месяц.

MIT, без ограничений. Ставьте себе, пользуйтесь.

Репозиторий, живьём крутится на punctual.sh. На скриншоте моя страница записи, по ней ко мне можно попасть.

Буду благодарен за звёзды. Чтонибудь ещё доделаю. Буду рад PR-ам.

Версию для своей команды поднял. Протестировал. Подписку на Calendly отменил.

Если вы тоже что то реально заменили - расскажите. Интересно.

Сергей Булаев AI 🤖 - об AI и не только


В прямых руках на новых проекта ИИ делает чудеса


Репост из: Усиленные Инвестиции
На этой неделе был на Радио РБК в «Инвестиционном часе» — обсуждали, как инвестору выжимать максимум из искусственного интеллекта прямо сейчас. Вместе с Мосбиржей (их FinGPT) и ВТБ.

Мой главный тезис: ИИ реально помогает почти на всех шагах — от анализа МСФО-отчётности до проверки эмитентов облигаций — но не из коробки.

Ключевая ловушка: ИИ излишне оптимистичен. На бэктесте у него любая стратегия «пушка-бомба, космос». На бумажном счёте результат уже в разы хуже. А на реальном — съедают комиссии, спреды и проскальзывание, и доходность уходит в ноль.

Поэтому нужны несколько степеней перепроверки: один агент извлекает данные, другой перепроверяет, третий проверяет второго. Только так выводу можно доверять.

Пара фрагментов — в видео. Полная запись эфира на Радио РБК: https://www.rbc.ru/radio/20/08/2026/6a8738b49a794757273be69a

Не является индивидуальной инвестиционной рекомендацией.


Мы с Кириллом встретились у него в офисе - поговорить за рынок акций.

А оказалось, что Кирилл - участник всероссийской олимпиады по математике, про пользователь Клода.

Его агенты работают как пчелки и заменяют десятки аналитиков.

Я думаю, что будущее на фонде, за такими ребятами, как Кирилл




Репост из: GPT/ChatGPT/AI Central Александра Горного
Binance разрешила AI-агентам самостоятельно торговать криптой

Биржа запустила Agent OS — платформу, через которую AI-агенты могут получать рыночные данные и сами совершать сделки. Подключить можно Codex, Claude Code, Cursor и другие инструменты. Агенту доступны спотовая и маржинальная торговля, фьючерсы и обмен криптовалют.

Чтобы AI случайно не слил весь депозит, для него создаётся отдельный субаккаунт. Пользователь сам решает, сколько туда положить, что агенту разрешено делать и нужно ли подтверждать каждую сделку. Вывод средств с таких счетов по умолчанию заблокирован. Но отдельного лимита на максимальный убыток Binance не устанавливает — фактически агент может потерять всё, что пользователь ему выделил.

https://www.binance.com/ru/agent-os


Репост из: Мысли Рвачева
Каждый раз как ребенок радуюсь новому юзкейсу, которому может помочь AI.

Люблю поигрывать в Civilization VI в самолете, если не дают интернет. В другое время просто нет времени играть такие длиннющие партии. Невероятно крутая игра, развивающая стратегические навыки, но и, конечно, без того, чтобы разбираться в деталях, никуда.

Так вот, сегодня забросил Claude Code запрос: "иди найди сохраненный файл последней игры, дай анализ игры и представь в обучающем формате". На выходе целая обучающая книжка с разбором партии.

#claude@rvnikita_blog #claude_code@rvnikita_blog #ai@rvnikita_blog #civilization@rvnikita_blog

—————————
Мысли Рвачева
—————————


У дизайнеров OpenAI ускорился перебор идей и не ускорился цикл обратной связи. Их руководитель советует делать меньше.

Ян Силбер три года ведёт продуктовый дизайн в OpenAI, до этого — Artifact и восемь лет в Instagram. Во внутренних опросах его дизайнеры называли одно и то же: у инженеров производительность выросла в десять, иногда в сто раз, у них — нет.

Идей теперь выдаётся много и быстро. А дальше всё по-старому: показать людям, услышать, что мимо, начать заново, и в большой компании ещё всех согласовать.

Его формулировка — делать меньше. Не проектировать то, что можно не проектировать: взять существующую систему или компонент и достроить сверху, расширить старую фичу, а иногда обнаружить, что фича не нужна вовсе.

Ускорилось дешёвое, дорогое осталось на месте. Считайте прирост не по тому, сколько вариантов вы теперь выдаёте, а по тому, сколько из них дошло до людей.

https://www.lennysnewsletter.com/p/openais-head-of-design-this-is-the


Когда вы спрашиваете агента «ты уверен?», вы его не проверяете. Вы получаете второй ответ той же модели, и звучит он так же уверенно, как первый.

Есть, впрочем, место, где этот приём работает. Мэдди Риз год назад не писала кода вообще: отец показал ей Lovable, с этого началось.

Сейчас у неё на столе термопринтер на Raspberry Pi — любой человек в мире заходит на её страницу, пишет сообщение, и оно печатается на чековой ленте. Ещё есть пейджер с событиями твиттер-аккаунта и личный API с её заказом кофе.

Про код она говорит прямо: до конца не понимает. Сравнивает с испанским, который, вырастая в Сан-Диего, понимаешь на слух, но сам не говоришь.

Проверять ей поэтому нечем, кроме вопросов к самому агенту. Ты уверен, что это правильно. Перепроверь. Убедись, что это согласуется с тем, что мы делаем.

Отдельным шагом она выясняет, кто вообще ошибся — она сама или он.

И на железе это сработало: перед покупкой она перепроверяет рекомендацию по два-три раза, и агент несколько раз ошибался — обычно советовал не те провода. Её слова:

Несколько раз, но я всегда это ловила.


Сработало не потому, что она нашла правильную формулировку. Сработало потому, что ответ было с чем сверить: с описанием товара, с разъёмом на плате, с ценой. Провода видно глазами.

В коде сверять не с чем. Там тот же вопрос возвращает не проверку, а вторую генерацию.

Что сделать сегодня. Возьмите место, где вы спрашиваете агента «точно?», и назовите внешний источник, которым проверяется ответ: тест, типы, лог, счёт, живой человек. Не называется ни один — у вас не проверка, а ритуал.

Честности ради, масштаб у Мэдди игрушечный: принтер, пейджер, личный API, ничего похожего на прод. Пейджер во время записи так и не сработал — она предупреждала, что связь у него рваная.

https://www.youtube.com/watch?v=KCGKb3huDsY

Чем вы проверяете ответ агента, кроме самого агента?


Эффект от кодинг-агентов до сих пор меряют счётчиком пул-реквестов. Причём открытых, а не смёрженных.

Linear разобрал когорту из 6 887 своих платящих команд — 4 280 из них подключили кодинг-агента. У этой когорты недельные пул-реквесты за два года выросли с 21 до 65; у команд без агента счётчик сдвинулся с 8 до 10.

Открытый PR ничего не говорит о ценности изменения — это формулировка самого Linear, в разделе про метрику. Там же они признают, что не знают, привёл ли рост выпуска к результату для бизнеса: видна только чёткая корреляция между внедрением AI и ускорением.

Посмотрите, что считает ваш дашборд: открытые пул-реквесты или смёрженные. Это разные новости.

https://linear.app/data


Репост из: Сиолошная
Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов:

— Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут!
Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило?


— Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала!
Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше: просто отодвигает проблему на пару месяцев вперёд, от тестирования к использованию.


— Ну ничего серьезного же не произошло!
Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать.


— Да просто свои модели контролировать не могут!
Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема.


— Так может просто надо остановить OpenAI и Anthropic?
А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков).


— Я не верю что модели такие умные! У меня они совсем тупые и еле работают!
А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь.


— Да это всё вранье, или маркетинг, или пиар, или и то и то!
Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить.

===

Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет.

Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.




Мои поздравления команде, но продукт у них работает плохо - я отменю подписку.





Показано 20 последних публикаций.