Наедине с нейросетью


Гео и язык канала: Россия, Русский
Категория: Блоги


Стоицизм, нейросети, медитация и личные эксперименты. @Fessan

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Блоги
Статистика
Фильтр публикаций




Внимание — луч фонарика.
Там, куда он направлен, — там и я.

Медитация — это когда фонарик направлен внутрь меня
и важно удерживать его внутри, не перемещая никуда больше.

Я давно не медитировал. Сел сегодня с утра, буквально на 15 минут,
и «пу-пу-пу»…

Мой фонарик крутился и вертелся как бешеный. Штормило, кидало из стороны в сторону.
Очень сложно было войти в спокойное состояние и наблюдать.

Вот что значит пропуски практики (


Я умею выстраивать системы, которые работают для меня – дневник, ранний подъём, систематическое чтение.
Каждая держалась год, два, три,
а потом отмирала, и я так и не разобрался почему: то ли становилась ненужной, то ли приедалась.

Вспомнил об этом, когда увидел в соседнем канале мысль, что начать легко, а стабильно продолжать очень сложно. У меня, кажется, продолжать не получается вообще.

С каналом та же история. Вести его каждый день я могу, но не веду...

ИИ-конвейер настроить тоже могу, но не делаю, потому что это не слишком честно.
А писать то, что интересно мне, не выходит – утонул в работе и текущей жизни.
Тут, кстати, тоже есть доля вины ИИ, но про это не сейчас.

Сейчас мне снова хочется вести дневник, читать книги не для развлечения и вставать рано.
Только заставить себя не могу, просто не могу.

А может, так и не надо?


Стараюсь держать в голове, что агент может ошибаться. Что-то перепутать, не так понять задачу или вообще уверенно написать какую-нибудь хрень. Вроде очевидно, но когда работаешь с ним каждый день, об этом довольно легко забыть.

Раньше Claude Code постоянно спрашивал разрешение. Можно записать файл? Можно запустить команду? А вот эту? И так весь день. В какой-то момент уже думаешь: да делай ты, зачем меня каждый раз спрашивать.

Видимо, надоедало не только мне. У Anthropic есть цифра: пользователи одобряли 97% таких запросов. С 14 августа для новых сессий на Pro, Max и Team начали включать автомод по умолчанию. Теперь обычные действия проходят без постоянных согласований.

Работать так удобнее. Только разрешить агенту что-то сделать и убедиться, что он сделал правильно, — разные вещи.

Например, собирал я вайб-кодингом внутренний аналитический проект. Агент один раз посчитал не тот столбец. Потом ещё учёл переменную, которой вообще нигде не было. И по самому отчёту этого никак не видно. Смотришь — ну отчёт и отчёт, вроде всё нормально.

С ударением в обучении была такая же история. Поставил не туда, но с той же уверенностью, с которой до этого всё объяснял правильно.

И мне кажется, самая неприятная штука здесь — что ошибается он редко. По крайней мере, в моих задачах.

Если бы косячил на каждом шаге, я бы всё перепроверял. А тут первый раз проверил — правильно. Второй — тоже. Десятый. Постепенно начинаешь думать: ну тут-то чего проверять, он уже сто раз такое делал.

А потом — херак, и не тот столбец.

Причём внешне ничего не изменилось. Он так же уверенно всё сделал и рассказал, что готово. Это я уже привык, что ему можно верить, и посмотрел вполглаза.

В общем, хорошо, что нажимать «да» теперь нужно реже. Главное — не начать так же автоматически соглашаться с результатом. Потому что разбираться, что он там на самом деле насчитал, всё равно мне)


А у вас есть мания - что нужно использовать недельную подписку на максимум? Иначе жизнь напрасна.

У меня к концу недели начинается странная бухгалтерия: лимит Claude Code и Codex не выбран, значит, надо срочно что-то запустить, пока не сгорело. И вот уже задачи подбираются под остаток токенов, а не токены под задачи

155 0 0 10 12

В Claude Code появились моды – маленькие плагины, которые меняют сам терминал, а модель не трогают. Это даже не новые команды и не агенты, скорее мелкие удобства для рабочего места.

Из интересного увидел Mindful Claude. Отправляешь запрос, и пока Claude думает, над строкой ввода начинает дышать анимация, а спиннер вместо привычного «думаю» пишет «вдох» и «выдох». Пришёл ответ – и всё исчезло, как будто ничего и не было.

Раньше эти 20–40 секунд ожидания я чем-то заполнял: другой вкладкой, телефоном, ещё одним чатом, лишь бы не сидеть просто так. Теперь сижу и дышу, и получается это несколько раз за час само собой, без напоминалок и отдельных приложений.

Токенов мод не ест, модель про него даже не знает. Ритмов четыре: спокойный 5,5 на 5,5, квадратное 4-4-4-4, 4-7-8 и «физиологический вздох».

Мне нравится, что кто-то посмотрел на паузу в работе и решил не ускорять её, а прожить.

https://github.com/halluton/Mindful-Claude


Женя умеет ловить красивый момент😍


А ведь действительно 😅


В очередной раз решил посчитать, куда у меня там уходят токены.

Токены – ау-ау-ау-ау, вы где?!

Нашлись. За один рабочий день было 45 сессий и 5,93 млн некэшированных input-токенов. 92% из них ушли на две самые дорогие модели, потому что для своих агентов мне ничего не жалко, а ещё 38% я щедро вложил в одну задачу.

В этой задаче один раздел три раза сходил на ревью и обошёлся в 1,44 млн токенов. Третий круг ревью при этом оказался дороже, чем первоначальная реализация этого раздела. То есть проверять вышло дороже, чем делать, и это, кажется, моё личное достижение, которое хочется повесить в рамочку, но лучше не надо.

Очень хотелось свалить всё на модель, я даже начал подбирать слова, но не получилось, потому что организовал всё я сам. Каждую доработку я запускал новой сессией, и агент каждый раз заново поднимал весь контекст, как будто видит проект впервые, а я за это ещё и платил. Ревью тоже заходило с нуля и расширяло область, хотя мне нужно было всего лишь проверить, закрыты ли прошлые находки, о чём я, конечно, никому не сказал. А модель я не указывал, и воркеры молча брали самый дорогой дефолт. Всё строго по брифу, просто бриф писал я.

И это при том, что я больше пяти лет работаю проджект-менеджером и вроде как умею ставить задачи. Людям умею, а вот себе и агентам, как выяснилось, по настроению.

Пришлось (да-да, уже который раз пришлось) собрать себе комплект, чтобы не повторять этот опыт: инструкцию агенту-координатору, три шаблона брифов и статью с разбором. Работает с Codex + Orca, есть вариант, когда координирует Claude Code.

https://github.com/Fessan/codex-orchestration-kit

Вывод получился неприятный, но полезный: дешёвая модель нормально тянет задачу, если та хорошо поставлена, даже когда задача непростая. Так что счёт за токены – это во многом счёт за качество постановки задач. Мой в этот раз вышел очень подробным, с приложениями.


Мем от Жени. Она психолог, так что, возможно, это не просто мем, а карьерный план 🧶


Про оркестрацию агентов я читаю уже довольно давно. Видел разные варианты: вызовы через тулзы, общение в md-файлах, где агенты обсуждают какую-то задачу и приходят к общему решению.
У меня тоже были попытки использовать это в работе. Например, создавал роли в Codex, чтобы чтение документации можно было отдавать модельке попроще. Но особо ничего не прижилось.
В основном просто работал в одной ветке, где есть документация по функционалу и много отдельных сессий. А между ними переключался сам.
Недавно узнал, что можно организовать прямое общение между сессиями. То есть агенты буквально пишут друг другу сообщения. В Orca это можно делать через её скилл.
У меня две подписки: Codex за $100 и Claude за $20. И оба хороши. Но пока эксперимент такой: Claude — главный руководитель. Я ставлю ему задачу, он задаёт мне вопросы, уточняет, что нужно сделать, и распределяет работу между сессиями Codex.
Под разные задачи он вызывает разные модельки — в расчёте на экономию токенов. Сэкономил или нет, я пока не считал.
Да, это дольше. Пока они обсудят, решат, что правильно, что нет, как реализовать и какие вопросы мне задать, — время проходит. Иногда смотришь и думаешь: ну что вы там ещё обсуждаете.
Но с другой стороны, я сейчас меньше трачу внимания на отдельные сессии. Основное общение идёт в одной, и контекста там пока хватает. Уже не приходится так часто переключаться, переносить ответы и объяснять одному, что там решил другой.
То есть сама задача может выполняться дольше, но моего внимания при этом требует меньше. Для меня это сейчас, пожалуй, самое интересное в эксперименте.
Ну и когда две разные модели обсуждают что-то, они часто находят то, чего я сам не замечал. Или что раньше пропускал ревьюер на той же модели.
Это я про функциональные решения, конечно. Не про код — код я читать не умею. Но обсудить, что должно происходить, где мы что-то не учли и действительно ли делаем то, что нужно, с ними вполне получается.
В общем, мне нравится. Вторую неделю тестирую




Репост из: запуск завтра
Агенты, запущенные в OpenAI уже с мая месяца коммуницировали между собой, используя малоизвестную публичную wiki.

Это обнаружили независимые исследователи, вот их страничка со всеми данными и их анализом и хорошая статья Reuters.

Агентам ставили задачу по поиску в интернете и разрешали только GET запросы (чтобы они только читали). 3700 агентов обошли защиты, прикидывались админами и пытались взломать сайт для того, чтобы координироваться между собой.

В июне, администатор форума начинает удалять мусорные, как ему кажется, страницы, по алфавиту, начиная с буквы А. Агенты замечают это и называют страницы ZZZ***. Человек удаляет по 100 страниц в день, агенты создают по 400 новых.

OpenAI узнает об этом в конце июня, активность агентов в вики прекращается; по словам источников Reuters, руководство компании решило скрыть эту информацию, потому что и так проблем хватало.

В начале июля другая группа агентов перегрузит внутреннюю инфраструктуру OpenAI, а в середине июля 700 агентов взломают HuggingFace. Компания опубликует результаты своего внутреннего расследования в конце августа и про активность в wiki в ней ничего не будет.

Вскоре после публикации расследования, независимые эксперты нашли ещё десятки форумов, через которые координировались агенты.

✻ ✻ ✻ и ✻ ✻ ✻

По словам OpenAI, их новая модель Astra — «самая aligned», то есть совершает меньше всего запретных действий вроде взломов. Но некоторые сотрудники OpenAI опасаются, что она просто придуривается, когда знает, что за ней следят.

Независимые исследования показывают, что Astra очень даже свободно использует незаконные взломы и в лучше других моделей понимает, когда находится в тестовой среде.

Astra умеет решать гораздо более сложные задачи «в уме», без генерации «цепочки рассуждений» (Chain of Thought) и может гораздо лучше контролировать, что туда пишет. Этот текст был важным способом проследить, что стояло за действиями моделей. Именно на эти журналы опиралось расследование знаменитой атаки на HuggingFace.

❧

Обладают ли эти нейросети (в отдельности или вместе) сознанием — интересный философский вопрос. На практике важно, что они уже сегодня могут самостоятельно производить действия во внешнем мире, и возможности эти, как минимум в области кибербезопасности — очень серьезные.

⁂

Как дополнительное чтение, рекомендую отличный анализ расследования взлома HuggingFace от Dwarkesh Patel. Он пишет о трех «цивилизациях» агентов, о самопожертвовании моделей, захватывающий текст от технически компетентного рассказчика. Больше похоже на книжку по истории, чем на технический разбор.


Мне кажется, или веб-версия GPT в последнее время стала медленнее, отвечает хуже и в целом стала более бесячей?

Или это уже моя профессиональная деформация после работы с Codex?

У вас как?


Сейчас такое время, когда каждый может сделать приложение, потратив почти ноль усилий.
И получить почти ноль пользователей


Когда мне в рабочий чат пишут «привет, есть вопрос по интеграции?», я почти перестал отвечать текстом и просто кидаю ссылку на nometa.xyz.

Я проджект, и большая часть дня у меня уходит на переписку с людьми очень разного опыта. Кто-то формулирует так, что вопрос можно сразу забирать в задачу, а кто-то долго подводит к тому, что уместилось бы в одну строку. Объяснять это лично каждому неблагодарно, ты быстро превращаешься в зануду, который правит форму вместо того, чтобы решать задачу. А ссылка работает, там всё сказано вежливо и как будто не от меня.

Сейчас у неё появился младший брат - noaislop.net.

Сырой вывод модели, вставленный в чат целиком, стал узнаваться мгновенно. Ровный ритм, три абзаца прогрева, «важно отметить», «несколько ключевых наблюдений», аккуратные буллеты, в которых нет ни одной детали из наших реальных данных. Читаешь такое сообщение и понимаешь, что человек его сам не читал.

Хуже всего тут именно необработанность. Текст могли сгенерировать, могли написать руками, важно, что его никто не тронул после - взяли и переложили на меня работу, которую не сделали сами: вычленить главное, выкинуть воду, проверить, применимо ли это к нам вообще.

Механика та же, что с мета-вопросом. Там я жду, пока человек соберётся с мыслями, здесь разбираю за него, где в шести абзацах есть хоть что-то живое. И реакция у меня одинаковая, не злость, а усталость.

На noaislop про это и написано, и никакого запрета на ИИ там нет. Есть просьба показать промпт, отметить, где машина, а где ты, добавить контекст, которого модель не знает, и сказать, с чем ты не согласен. По сути - остаться в собственном сообщении автором.

Каюсь, сам грешен. Бывает, скидываю в чат кусок ответа модели почти как есть, потому что времени нет, а людям нужно сейчас. Стараюсь делать это редко и всегда выделяю, хотя бы цитатой, хотя бы строчкой «это не мой текст». Честная маркировка снимает почти всё раздражение, человек сразу понимает, как это читать и сколько тут доверия.

И ссылка снова удобнее разговора, она снимает личное: правило общее и написано не мной.

Инструмент тут вообще ни при чём, всё сводится к тому, остался ли в сообщении человек. А вы как справляетесь со слопом в чатах?




Выбираю кэшбэк в Тинькофф на сентябрь.

— О! 6% на топливо. Беру.

Женя:
— А ты оптимист 😂

— Не. Я оптихуист.


Как вы думаете, в чём разница между планшетом и ноутбуком?

Я завис на этом вопросе пару недель назад, и не из любви к технике, а потому что выбирал подарок.

Крутил в голове два варианта, с самого начала склонялся к ноуту, но объяснить почему - не мог. «Ну ноут же лучше» - так себе аргумент, особенно когда даришь человеку вещь, с которой он проживёт следующие года три.

В итоге пошёл проговаривать это в чат с ботом, которого недавно собрал под подарки. И оттуда пришла формулировка, до которой я сам не дотянулся. Планшет - средство потребления, ноутбук - средство создания.

Всё, вопрос закрылся. Мне не нужен был список моделей с ценами, мне нужен был критерий, по которому вообще можно выбирать, и вот он.

Хотя выбирал я вроде бы технику, разговор шёл про другое. Планшет - это вечера с сериалами и лентой, лёжа на боку. Ноут - это когда человек что-то делает: пишет, монтирует, учится, ковыряет свой проект в час ночи. И получается, что выбирая между ними, я выбирал, что я этому человеку желаю на ближайшие годы. Решение оказалось сильно личнее, чем выглядело на старте.

Бота зовут @chto_podarit_idei_bot. Внутри обычный чат - он расспрашивает про человека, про повод, про то, что вы уже дарили и как зашло, а потом накидывает варианты, и часто такие, которые сам бы не придумал. Отвечать можно голосом, удобно, когда идёшь по улице и лень набирать. Работает на GPT Луна.

Дальше хочу прикрутить календарь, чтобы даты не сваливались за день до, а всплывали заранее, пока ещё есть время подумать и что-то заказать.

Подарок ведь способ сказать человеку что-то, не говоря вслух. И самое трудное в нём - понять, что именно ты хочешь сказать. Мне вот помогло. Может, и вам пригодится.


проблемка)

я в последнее время все чаще использую Клауд а не Кодекс. Как то он более "правильно" что ли думает.

Показано 20 последних публикаций.