LLM Кунг-фу 🥋


Гео и язык канала: Россия, Русский
Категория: Технологии


Канал об агентском программировании (вайб-кодинге) с китайскими LLM: DeepSeek, Qwen, GLM, Kimi и другими.

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Каждый год кто-нибудь пилит очередной «million dollar homepage» и зарабатывает свои тонны денег за несколько дней, каждый год люди удивляются «как так, опять, подумаешь десятки тысяч подписоты было», каждый раз люди бросаются делать клонов, которые успешно фейлят)

На этот раз - https://outbid.lol/ , и он интересен не с точки зрения «как с гоев в очередной раз срезали шекели», а как список AI стартапов в сфере маркетинга, которые вовремя следят за трендами. Кто бы мог подумать, что люди продолжают продавать беклинки (теперь статьи пишеи ИИшка, опция «проверит человек» - х10 к цене), продавать лопаты, продавать видимость в ответах чатжпт, менеджерить соцсети.

Хотя для меня удивительно, что кто-то до сих пор успешно продает React компоненты) Слава агентам, ванилла js снова в моде


Operation CheepSeek

Я недельку уже валяюсь c чем-то вирусным, поэтому не особо активно работаю/слежу, но тем не менее - проблема с токенами остается после поднятия цен на дипсик. В текущем виде на агентском кодинге мне нужно около 500млн токенов в рабочий день, при 97% кеша (и 2% input + 1% output). По старым ценам я вполне влезал в лимит $60 по api ценам диписика (они оказывается таковыми стали только в апреле 2026, когда вдруг подешевели в 10 раз), которые были в опенкод за $5-10 в месяц - и меняя более чем устраивала и цена, и качество.

Увы, но время старых цен кончилось, и сейчас этой подписки хватит лишь на 4 дня - один рабочий день по api вне пикового времени будет стоить $7, в пиковое - все $15 (при условии подписки за $5-10 это все равно выгодно, но жонглировать подписками - такое себе)

Текущий рабочий вариант внутри опенкода - MiMo-v2.5, мультимодальная, объемы как раньше у дипсика (то есть на 20 рабочих дней). Но туповата, по конкретной инструкции + исследования нормально шпарит, но чуть сложнее код - прям грустно. Но связка работает, просто больше времени разжевывать (если задачи потоковые с хорошо описанной инструкцией - норм)

Интересный подписочный вариант - CommandCode, конкурент опенкод. На тарифном плане GOAT за те же $10/mo дается $60 дипсик флеша, что даст почти 10 рабочих дней (при использовании вне пикового времени). Минус - если я правильно понял, на этих тарифах нет api доступа, то есть работа через их харнесс, десктопная версия которого - сюрпрайз - не работает на интеловских маках, поэтому не тестил (забавно, что PRO тариф за $20 дает по сути тот же лимит). UPDATE - а, вроде как есть, он просто с сайта нужный не отдает, надо в гитхабе смотреть

Дальше два варианта с оплатой за API, но с нюансами:

1. TeamoRouter, про который писал как-то выше - отдает дипсик со скидкой 60%. Это позволяет снизить рабочий день до $3, с несгораемым балансом. Как альтернатива, там же можно использовать GPT 5.6 Luna с 56% скидкой, но это уже будет $7 за рабочий день, и при полноценном использовании подписка на codex будет скорее всего выгодней (если тариф за $100 даст сжечь 10B токенов луны, там тоже вроде как начали резать лимиты).

2. Crof.ai - темная лошадка, вроде как свой инференс, отдают дипсик флеш дешевле чем старые цены дипсика (!!) говорят про Q8_0 квантизацию. Но этот вариант все еще одинаков по цене с предыдущим - $3 в день (зато без заморочек с пик-оффпик часами). Интересный вариант, но куда более волатильный, чем даже теамо.

Короче, куда не ткни - месячный пропуск в агентский кодинг по цене болтается около $60/mo. Интересный вариант с комманд кодом, но их приложение пока не запускается. Опенкод тоже пытается в оптимизацию (буквально через пару дней увеличили вдвое лимиты по дипсику), добавили muse spark (в большинстве стран не работает, но там где работает - на него многие перекидывают), может что-то дождемся, перекидывая на странных ox-alpha)

По открытым источникам MiMo-v2.5 в два-три раза вырос на опенроутере, и в 10 раз - на опенкоде (до 2Т в день).

Какие еще есть варианты для нищебродов, кроме очевидных покупки подписок на клауде-кодекс?)


Дорген на стероидах

Лет так 15-17 назад возникла у меня банальнейшая идея "кнопки бабло" - полностью автоматизированное создание сайтов дорвеев. В то время дорвеи делали в основном всякими десктопными комбайнами, которые многопточно качали все подряд, генерили страницы, заливали на фришники и прочее (а потом хрумером гонялось). И сделал свое - чтобы само подбирало свободный домен, регистрарировало его, доставало ключи, генерило страницы, загружало на сервер, разве что изначальный выбор ключа был еще ручным. А потом еще счетчик в ли регистрировало, куда-то там аддурилкой добавляло, ссылки где-то ставивло. И криво-косо это даже работало, и даже получало трафик. Который я и монетизировать толком не умел, и масштабы были мизерные, а потом через месяц его весь срезало - дорвеи же.

Тогда это мне стоило месяцев труда (сотен часов), ковыряний в апишках, скриптах, очень художественный костылей на изоленте. Не потому что мне были интересны дорвеи - а сама концепция.

И, как ни странно, это мне до сих пор интересно) Поэтому решил повторить эксперимент, которые делал пару лет назад (или уже три?), с малостраничниками - тогда я решил закрыть все эти вопросы банальным человеческим трудом. А сейчас появились агенты)

Ну так вот. Сравнивать мои поделки или ручной труд с дипсик флешем - это просто небо и земля... Насколько быстрее, дешевле и качественней буквально всё. Я теперь понимаю, почему PBN-щики так быстро разрослись - для них это вообще инструмент номер один. Аналитика - на раз два, найдет десяток источников, перепроверит (само нашло один сервис для чекания вордстата, пока апишку не дал). Для человека ручками перебирать по куче параметров - муторно. Тут - просто и методично. Дальше результаты можно ручками выбирать - а можно просто прописать критерии.

Создание сайтов - аналогично. Да, конечно, нужно иногда корректировать, какой нужен результат, стилистика, инструменты, структура. Иначе будет штамповать одинаково. Но даже по умолчанию оно выглядит супер! Вся сеошка по умолчанию уже прописана. Здесь остается больше индивидуальной проработки, особенно в начале, пока наращивается мясцо скилла. То есть тут действительно остается функция валидатора-направлятора. Причем функционал тут тоже мало ограничен, повторить в браузере функционал какого-то ПО - за здравствуйте.

Ну и деплой. API регистратора за 15 лет кажется так и не изменилась, и хотя регистрировать домен можно - верифицированную анкету он присобачить не может. А вот манипуляции А-записями оказалось очень легко спихнуть. И настройку сервера, благо для статичного сайта там надо всего ничего. А уж добавить сайт, сертификат, загрузить файлы - вообще изи. А я ведь буквально полгода назад как идиот ручками везде все переписывал, копировал, настраивал... Эх)

И да, это все очень простые инструкции, разве что создание сайт чуть творческая задача (опять же, тут тоже нужно допинывать, что там должно быть, где что брать, как обходить блокировки и прочее, не всегда сам быстро находит). И в токенах все это стоит на уровне десятков центов.

Зачем мне это? Так же как и 15 лет назад - просто интересно, можно ли это автоматизировать и как. И что можно сделать после создания сайта. Прошлый эксперимент на живых человеках мне обошелся тысяч в 150, и со временем таки отбился в плюс (один из сайтов зацепился). Сейчас тот же объем работ мне обойдется почти по цене доменов, и $5-10 на апи, тысяч в 7 суммарно. И может работать дальше без меня - раз в неделю заново шерстить аналитику, обновлять данные, и если что всплывает - алертить меня (объемы не настолько большие, чтобы полностью автоматизировать). То есть в этот раз можно не 30 сайтов сделать, а 500 например, за те же деньги, причем ничего особо не меняя в подходе. Правда, в конкретно этой нише просто нет такого объема)


Ну вот кстати финита ля комедия в опенкоде с бесконечными токенами deepseek-v4-flash-0731

По докам ( https://opencode.ai/docs/ru/go/ ) уменьшение лимитов диписик флеша в 8 (!!!!) раз. Не договорились - в два раза взлетела цена подписки, и в 4 раза - убрали субсидию (то что раньше давали х4 токенов, то есть $60). Было 12млрд токенов в месяц - стало полтора на месяц, энджой) Плюс еще и будет учитывать пик/оффпик использование.

Окошечко возможностей токенмаксинга быстро закрылось, все еще приятно получить за 5 баксов 15 баксов лимитов апи, но уже как-то не так кузяво.

Возмоооооожно, договорятся с другими инференс провайдерам, с их то объемами. Или не договорятся.

Альтернативы:
1. Ужиматься по токенам (но полтора ярда - несерьезно)
2. Искать дешевый инференс дипсика по старой цене, либо gpt 5.6-luna (может в подписке codex)
3. Перекатываться в токенмаксинг Mimo-v2.5 на опенкоде. Там все еще 12 млрд токенов, он неплох в кодинг, и был сопоставим с предыдущей версией дипсик флеша. Но новая лучше, и отставание даже по бенчмаркам там существенное.

В общем, будем смотреть, очень все быстро меняется.


Я пытался. Закинул агента писать 15 статей (он их потом 5 часов не мог опубликовать, думал что rate limit стоял, загрузил 136 дублей изображений на вордпресс, и куралесил по полной).

Закинул с нуля по спекам сделать копию своего сервиса, получилось шикарно для первых прогонов с фиксами.

Продолжил мучить статами роутеров разных (перекинул в новую сессию, в старой на 1B+ каждая фича прям сразу залетала на десятки м токенов)

И все равно за день всего 450м токенов ($2.4 по панельке опенкода, там даже число токенов не пишется - и это ровно половина стоимости подписки за один день)

Штош, челлендж аксептед) Хотя у меня в загашнике ну может еще пара проектиков лежит, куда можно по миллиарду токенов вбросить, а дальше надо думать. Ну если не читерить и на более дорогие модели не переходить)


Мои догадки оказались верны - статистика опенкода ( https://opencode.ai/ru/data ) - это только данные по подписке Go (около 70к человек). Причем без openai/claude. И возможно даже без Zen. И, как теперь стало известно - без бесплатных моделей.

На 1 августа было 3Т токенов диписик флеш - отражено в статистике, и еще 5Т сверху - бесплатное использование (кто вообще это субсидирует, учитывае что Go подпсики тоже имеют х4 объема от цены апи).

Таким образом на вчерашние 9Т токенов флеша - могут приходится еще как минимум 5Т токенов бесплатных, а скорее всего больше, вплоть до 15Т при том же соотношении (но это вряд ли, бесплатный лимитированный, то есть сложнее нарастить использование), то есть суммарно там же 15-20Т.

К слову, TeamoRouter (дискаунтер) так же добавил бесплатный флеш (всего 50 запросов, причем вроде как всего, а не в день), и 35% скидку на флеш (но не на про).

Что вообще происходит))

* для понимания масштабов - 5Т в день это как половина опенроутера. Или 5 kilo code.


Нищебродим и абьюзим роутинг: OmniRoute

Продолжаем мою любимую тему экономии денег) Некие абсолютно упоротые мэд мэны создали OmniRoute ( https://github.com/diegosouzapw/OmniRoute ), который поднимает роутер у вас на локалке, и подгружает 290 (!!!) различных провайдеров. Там просто миллион настроек, разных источников и прочего (к слову, можно подключать не только бесплатные - это так же приватный функционал роутинга, то есть распределение нагрузки между разными провайдерыми-моделями, и либо оптимизация расходов, либо последовательное выжимание всех доступных лимитов. Хотя для прям роутинга по сложности запросов там другие инструменты используются). В том числе абьюз веб чатов - копируем куки, сохраняем, и вауля - теперь можно через api обращаться (я через это не пробился).

Опять же, по большей части это тормозной и лимитированный хлам, они сами говорят о примерно 1.5B бесплатных токенов за месяц, из которых 1B - это мистраль - то есть ни о чем. Но мне было интересен один конкретный источник, и я его получил - великий и ужасный Opencode) Я сам пытался вытащить эндпойнт для апи доступа к бесплатной версии (ну как сам... агента и натравил =), но не шмог. Тут это работает из коробки (естественно, надо как-то авторизироваться и передавать нужные заголовки, можно в сорцах покопаться чтобы уточнить).

То есть раньше работало как - есть декстопный OpenCode, его можно юзать, кончается лимит 50млн токенов - переключаем страну в впне, фигачим дальше. Вне опенкода не потыкаешь. Теперь - создаем инстанс OmniRoute, добавляем опенкод, получаем нужный base url + api-key, добавляем куда нам надо (мне надо в Reasonix, а можно куда угодно), и вауля - все работает оттуда!

Когда кончились наши 50 млн токенов (и да, опенкодовский дипсик флеш - имеет контекст 200к, увы) - внутри омнироута (не всей системе) подключаем прокси, и все снова работает. Ну или можно точно так же глобально впн подрубить, эффект тот же. В идеале - оно еще умеет работать со списком прокси, и можно настроить их ротацию, но у меня что-то не завелось, надо разбираться (да и кучи прокси под рукой тоже нет).

Это намнооооого проще, чем то что я предполагал делать для возможного абьюза опенкода) Этот же омнироут можно и на впску поставить, и уже вполне нормально работать универсально (то есть получить глобально доступный api адрес)

Однако большого смысла в это углубляться не вижу - уже сейчас дипсик флеш бьет рекорды по использованию, по открытыми источникам (опенроутер и особенно опенкод) он прыгнул с 2-3Т в день - до 10Т+ токенов в день. Дипсик уже ввел двойной прайс на рабочие часы по Пекину, и анонсировал повышение тарифов в будущем. Так что вангую, что этот вариант ооочень быстро прикроют, и уберут/сильнее ограничат бесплатное использование в опенкоде, а может и порежут лимиты в Go подписке - не говоря уже о ценах на апи самого дипсика.

Но на данный момент я получил вполне себе рабочее решение - бесплатный дипсик флеш внутри Reasonix, для простых задач, не требующих большого контекста. Причем сразу через прокси, чтобы не перекрывать лимиты десктопного опенкода. Практической необходимости в этом нет (в чуть более умном харнессе оно жрет токены как не в себя, и если раньше бесплатного лимита хватало на час работы, то сейчас - минут 20 автономного шуршания агента), но все равно приятно, во всяком случае статьи он успевает написать бесплатно)

PS. Сам я кстати не смог установить пакет, вечно там какие-то несоответствия вылезают либо при установке, либо при запуске. Но благо что уже не надо гуглить ошибки и разобраться, достаточно просто в новой сессии опенкода кинуть ссылку на пакет и попросить установить и запустить. Хуяк - и заработало)

UPDATE: я все переусложнил. В опенкоде можно взять API ключ, и он подходит для Opencode Zen с бесплатными моделями. В reasonix правда придется через конфиг их добавлять, но все работает. Хотя там сейчас только дипсик флеш и работает из бесплатных моделей (и лонгкат, чтобы это ни было)


Я иногда забываю, насколько молода область агентского кодинга, что опенкод появился всего год назад, Claude Code - немногим раньше, знаменитый DeepSeek moment - это январь 2025 (полтора года назад).

Потребление токенов только по открытым источникам удваивается каждые 2-3 месяца, а теперь уже и за месяц, а за 2026-й увеличилось уже в 10 раз.

И это всё данные без очевидных лидеров рынка, claude/codex/cursor, у которых 90%+ доля рынка суммарная.

В веселое время живем =) (данные за вчера - 25Т токенов по открытым источникам. Хотя если взять активную работу, то это всего лишь 50к человек, даже если по тяжелым моделям - ну 200к. Остальные 95% - у больших платформ)


Дешевые токены OpenAI/Claude

Мы все про дипсик да про дипсик, в противовес жирным подпискам на "настоящий" фронтир, с его конскими ценами. Но так то есть и другие варианты, с приемлемыми ценами, прямым API и без рисков блокировки в РФ (если бы еще оплату хотя бы криптой прикрутили - цены бы им не было)

А именно - нашим китайским братьям тоже хочется потыкать новые модельки у антропиков и альтмана, и они точно так же если и не полностью заблокированы - то как минимум имеют сложный доступ (ровно с теми же проблемами с картами, например), и так же как и в РФ - блокируют им аккаунты (это еще один камень в огород любителей впнов, даже через впс прокладку). А кроме того - ну апи же дорогое (так то не проблема его на том же опенроутере взять), откуда у китайских/индийских студентов деньги?

Свято место пусто не бывает, поэтому появились роутеры, которые не только добавили оплату с unionpay и alipay/wechat, но еще и воткнули 80-90% скидку. Там очень расплывчатое объяснение, откуда оно берется, говорят что с энтерпрайз аккаунтов, но вполне возможно что и консьюмерские выкачивают (платишь ты подписку 200 баксов, а используешь от силы половину лимитов, чего добру пропадать), может и прямой абьюз. Раньше вроде попадлись истории о подмене модели (кидаешь запрос клауде, а тебе отвечает GLM какой-то), но это быстро вычисляли, и крупные так не рискуют.

Один из крупнейших подобных роутеров, если верить доступной статистике - TeamoRouter, цены на скрине, и они там в основно gpt-5.6 и используют, в достаточно существенных объемах (500B токенов в сутки). То есть это не роутер однодневнка, и его вполне можно использовать на постоянке - ну с очевидным примечанием про безопасность данных (которые в любом случае не должны утекать, неважно через что работать. В этом плане Reasonix прям хорошо настроен, и не видит ключей)

Я для теста использую мелкий роутер однодневку, нашел где-то на реддите, NitroRouter. Там прям максимально детские объемы, там плюс в том, что они дают $0.5 на тест (лол, да), и там и так дешевая gpt-5.6-luna за 20% от обычных цен, так что я пока что туда отправляю задачу "описать картинку", и этих полбакса хватит на 2000 описаний. И в целом, луна примерно совпадает с дипсиком по бенчмаркам, со своими особенностями конечно, а по дисконтным ценам - внезапно, обходится даже дешевле дипсика. То есть если цены повысят резко-дерзко - есть куда идти (MiMo, luna)

Про совсем идейных нищебродов - как нибудь позже напишу)


В общем, посмотрим, с агентской оберткой точно получается дичь по расходам, с промтами оно еще более-менее бы вытягивало по ценами апи (думаю, что в опенкоде я бы ту же работу впихнул бы в 100-150м токенов, не давая ему слишком сильно гулять, но и ручного контроля и правок от меня было бы намного больше конечно - причем изначально поиск по теме я там вел, и переиспользовал данные), а вот «агентом» уже кажется что подписка таки нужна - ну, если рабочих часов в месяце достаточно. Но даже если нет, одна статья обходится в $0.1 по апи, и то я плюссь по поводу качества и ручных правок. То есть вся подписка Go это 600 статей для сайта, и если вдруг осталось - то в последнюю неделю можно просто остатки выгрести для отложенного наполнения. Надо конечно еще изучить вопрос, может я просто что-то упускаю.

Ну, короче, странные ощущения. Как будто без тебя проект делают.. Даже поводов обматерить агента было всего 2-3 за весь день, и ни разу он не зависал на каком-то баге, когда надо было 5 раз его туда ткнуть носом. Для психики хорошо, для вовлеченности нет)))

* да епт, у меня же есть премиум, почему не дает длинные посты делать


Reasonix, часть вторая
Итак, вчера сидел над еще одним фан проектом, уже более близкий к реалиями веб приложений, и определенно есть изменения:

1. Агент стал работать намного дольше. Плюс за счет того, что все вызовы утилит и размышления сворачиваются (тогда как в опенкоде тебе просто летит весь поток сознания от модели) - кажется что оно тормозит. Но нет, оно просто больше работает

2. Больше спрашивает разрешений (приходится YOLO включать), но при этом более самостоятельная. То есть без агентской обвязки там как - задачу дал, тяп ляп - готово. С агентской - задачу дал, тяп ляп, автоматическая проверка, что за говно, переделываем. Это сильно удлинняет цикл, но при этом на выходе получается чаще всего стилистические баги, а не функциональные (хотя и такие тоже бывают)

3. Жгет токены как не в себя - но и кеша больше. То есть прошлые оценки затрат можно смело умножать в 2-3 раза, если не больше. Если раньше день работы приближался к 100-150м токенам, то вчера я сжег 500м, и при этом по промтам скорее даже меньше писал и корректировал. Но, помним про кеш, стоимость в два раза меньше получилась, $2.5 (правда эти деньги я уже заплатил...)

4. Вьедливость если и улучшилась, то ненамного. То есть банально задача, зайти на сайт, найти среди js файлов endpoint который подгружает данные - нихт, что-то там перебирает, проверяет, без толку, при этом ходит кругами и придумывает какие-то безумные идеи (благо что поток мысле скрыт, и я теперь меньше это замечаю). Пока ручками не ткнешь - не найдет. Зато потом да, распознает все на ура.

5. Guidance/Queue. Удобная штука, особенно когда таски стали по 20-30 минут работать. Все новые замечания или задачи встают в очередь, эту очередь видно, когда текущая задача закончится - начнет их делать, не прерывая потока. А гайданс - отправить модели подсказку по работе (я так эндпойнты подкидывал), не прерывая размышления, это тоже удобно.

6. Plan -> Todo. Удобней режим, сначала просим описать что собираемся делать, вносим правки если нужно (и модель задает вопросы), по отмашке - создает тудулист из сколько там нужно элементов, и последовательно их решает. Вот тут как раз дал задачу и забыл, минут через 30-40 может быть закончит (а может нет, дольше будет работать,у меня то мелкие задачи) Хотя опенкод так тоже умеет, так что тут я сам просто редко пользовался фичей.

В результате сам формат взаимодействия изменился, стал намного более асинхронным и пассивным. Теперь не приходится прям каждые 3 минуты вносить правки или проверять. Хотя это все еще простенький проект был, но тем не менее накидыванием задач в очередь там прям хорошо разгружало внимание. И ощущение "активной работы" пропадает - то есть надо либо чем-то другим тогда заниматься, либо второй-третий проект параллельно делать.

Но с расходами конечно печально.. $2.5 за день работы, причем не прям активной, и один проект. И это дешевый флеш, с дешевым кешем. Еще и счетчик крутится, "вот эта фича обошлась нам в 7 лет жизни 15 центов", демотивирует) И тут подписка OpenCode Go как раз может быть в тему, ибо фиксирует затраты на $10 в месяц (или $5 в первый), давая того же флеша на $60 в месяц (то есть примерно те же $3 каждый рабочий день, лимит там конский, $12 флеша за 5 часов это надо постараться). То есть за 10 баксов получить 10B токенов флеша, в 6 раз дешевле чем при оплате за токены, при активной работе оно отбивается за 3-5 дней. Тем более с перспективой повышения цен на апи (но тогда и подписка скорее всего тоже будет включать меньше токенов).


Reasonix - десктоп IDE под дипсик

Пастухов меня опередил, у него в комментах увидел ссылку, скачал, установил - и офигел) ( https://reasonix.io/ ) После него опенкод - это просто чатик с табами, где почти все надо настраивать ручками или через чат. Ну и со всеми обертками оно стало умнее раза в два, хотя на некоторых вопросах все еще подвисает.

Конечно, больно смотреть на утекающие центы (закинул денег на оффициальный дипсик), но что взамен:
- 1млн контекста. На опенкоде было 200к, и оно прям постоянно упиралось и ужимало. Сейчас уже час-два работаю, а еще до сих пор не дошел до лимита. 5-часового лимита тоже нет, хотя я до него и не добрался, можно тратить все что есть (примерно 2млрд токенов)
- Интерфейс с кучей данных, в том числе по тратам токенов (не надо сторонний анализатор пилить). Куча настроек, установки MCP, все агенты, память, все расфасовано по полочкам. Иногда пахнет китаем, но терпимо
- Агенты нормально настроены из коробки, вызов субагентов, терминал, файл, папки, cache hit rate показывает, все по уму.
- Токенов вроде как поменьше тратит, и за счет обвязки - в целом стал поумнее, но и шестеренками дольше крутит

Сегодня вспомнил про рабочую задачу - один из сайтов давно валяется без наполнения, стало невыгодно оплачивать редактора. Начал по шагам, исследование, темы, семядро кратенько, план статей, статьи. На удивление, вот прям простыми действиями быстро собрал мне недельный план по статьям, проверил актуальность, все пучком (но спросил конечно пару инструментов). Все это в скилл оформил для будущего исопльзования.

Потом сама статья, структура, текст - тоже терпимо (отдельно его попросил изучить что такое нейрослоп и держать себя в руках =) А вот с картинками скриншотами беда, SVG он рисует отлично, а мультимодальности нет, вначала он вообще мне инструкцию написал, что делать, редиска. Полчаса ходили вокруг да около, пока не разобрались (подключил с другого роутера дешевую модель, там полбакса должно на 1000 изображений хватить, потом докину. В опенкоде оно с двух промтов научилось отправлять скриншоты в субагент, reasonix развел панику на полчаса, ходя кругами, пока его матами не остановил). А оценить качество скриншотах - сложно, в итоге опять глазами говоришь где плохо. В общем, фифти-фифти, надо еще полировать, может другую модель подключать для текстов. Но в целом это больше для сеошных нужд, так что прям сильно вылизиывать контент не нужно (но может pro для самих текстов подрубать)

Дальше - проброс всего этого в вордпресс, оказывается там теперь "пароль приложений" можно настроить. Все как обычно чуть-чуть через жопу с первого раза, но вполне допиливаемо. И вауля - во первых, статья опубликована, во вторых - конвейер уже наполовину готов, то есть даже в примитивном виде - запускать его раз в неделю, аналитика, темы для статей, потом циклом каждую статью писать, закидывать в отложку на неделю вперед, вауля. Учитывая, что есть прямой доступ к API, все это можно закинуть и на сервак.

В режиме разработки на публикацию одной статьи ушло аж 30 млн токенов и почти 30 центов, часа полтора работы. Отдельно одна статья от темы на вход до публикации - заняло 4 минуты и 3 цента, но такоооое говно написало, не то что нейрослоп, а тупо переврало и все ключевые особенности провафлило)) Буду дальше дорабатывать.

Насчет того, реально оно надо или нет - это вообще не про это, во первых да, надо, во вторых - это очередной тест возможностей автоматизации. И да, всё это - делали и 10 лет назад (помню эти автоматические контентные сайты со сверхдлинными статьями =), и хотя сейчас качество намного лучше - но востребованность куда меньше.

299 0 13 13 6

Итоги июля, потсоны!

Немного перебор теории и разовых задач (пора уже отдельного агента делать для создания отчетов, а то дефолтный дипсик всегда пилит темную тему, мелкие шрифты и плохо рисует графики с двумя датасетами), но в целом для первого месяца вкатывания отлично)

Вчера докачалась выгрузка данных из гугла, поиграл со статой из ютуба, жаль она с 2023-го (50к видосов, большая часть шортсы, ибо не разделяет он их).

Тестил(и) разный ризонинг во флеше, max тратит больше токенов, и вроде бы додумывается до более умных вещей (к примеру, глянуть скиллы перед тем, как лепить интерфейс). Но прям существенной разницы с новой версией я не заметил.


Видео недоступно для предпросмотра
Смотреть в Telegram
Deep research, deep research!

Сегодня дипсик:
• Не смог найти это видео в загрузках (но тут я тоже виноват, помню обрывками, и в гугле я тоже его не нашел)

• Не стал мне искать абузоустойчивых хостеров (illegal activity)

• Сделал рисерч по малостраничникам и отчет (кожанный аналитик за это брал 5к в часах работы)

• Сделал одностраничный генератор коллажей из фото (дольше искать бесплатное приложение или апп, и разбираться, чем одним промтом и двумя коррекциями добиться что нужно)

• Ответил на вопрос, стоит ли на старом айфоне обновляться до новой версии (ответ в опенкоде мне понравился больше, чем в онлайн чате дипсика)

• Сделал фор фан вебапп вишлиста, опять же, с одного промта и одной коррекции (фото обрезал неправильно). Добавил туда подписку клауда за $200.

• Затестили новый флеш, разницы по бенчмарку нет, по ощущениям тоже

• По старому коду сделал спеку, подчистил её, перепроверил на актуальные API, добавил пару фич. Возможно, рефакторинг через промежуточный шаг будет меньше переносить старых кривых решений, то есть одна сессия по старому код пишет спецификацию, как оно работает (в том числе псевдокод), а вторая - не видя код по спецификации пилит ТЗ/код. Но еще не проверял.

Все. Сам я подбивал итоги за месяц - переносил расходы в табличку, немного текст писал. Нет, эти процессы нет смысла передавать иишке, там в другом суть (так же как и написание текстов для живых людей =)


Внимательно читаем мелкие примечания... Лучший способ контроля расходов - это платить за токены, а не за подписку) Я к этому еще не пришел, но внимательно изучаю. Вот например, что вы видите на скрине выше? там всего один лишний нолик в оплате за кеш, подумаешь. Но по факту у остальных провайдеров даже со скидкой 62% - цена кеша в 15 (!!!) раз выше, чем у самого дипсика на сайте. А в кодинге это 95% трат токенов, то есть при схожей цене инпут-оутпут токенов (тут этого нет, но обычно похожи) - финальная цена будет раза так в два выше. Я уже так несколько раз обжигался, пересчитывая почему у меня траты на тестовые таски в 2-3 раза выше, чем ожидаемые.

А опенроутер по умолчанию не будет использовать самый дешевый и оригинальный провайдер - дипсик. Он его покажет в самом конце таблички, серым шрифтом, с маленькой красной плашечкой "ай-ай-ай, они собирают данные и тренируют на вас свою модель, какие нехорошие дяди" (это они о разработчиках если что). И чтобы их включить, надо отдельно зайти в настройки приватности и разрешить этих нехороших проайдеров использовать.

И только после этого использование опенроутера наконец-то себя оправдывает, я собственно поэтому начал ковыряться в MiMo - у них цены такие же как у дипсика, но оффициальный провайдер включен по умолчанию. Соответсвенно, нет нужды регаться в облаке Xiaomi. Ну а теперь и с алипеем можно не мучаться для дипсика, если цены те же) (и скорость тоже повыше, особенно flash), и чуть плотнее его тестить.

-----

Три дня был в деревне, работать с агентом с телефона пока что не до докатился, поэтому нихт)

Сегодня загрузил в папку 5 репозитариев ElastoMania, игры 2000-го кода, в том числе полные исходники, и попытался получить браузерную версию игры. Увы и ах, если прочитать и понять код дешевые модели смогли, и какие-то демки родить, но абсолютно нерабочие. Сначала самопис делали, потом готовую библиотеку для 2d-игр, потом уже плюнул - просто по такой же концепции сделать, а не порт, используя готовые либы (MiMo-2.5) - это хоть как-то запускалось, но вся физика просто ужс (там два колеса + пилот + растягиваемая трансмисия между ними, в виде трегольника). Видимо это все же не по силам таким моделям, как будет подписка на фронтире - можно как-нибудь проверить)

В яндекс играх кстати есть эта игра, с кучей рекламы естественно, и переделанным меню. Но там перекомпиляция игры в Emscripten в JS, что сохранило всю физику-графику ровно как она была в оригинале, однако производительность-отзывчивость страдает (на глаз, может это просто веб версий касается), плюс старая VGA графика. То есть все таки не полноценный ремастер, а просто порт - ну так можно dos эмулятор взять который в браузере работает и там запускать) Практического смысла тут нет, просто интересно разные возможности тестировать. В идеале это еще и в .dmg под макось перекомпилировать. (для мобильников они портировали, но там оно неудобно, слишком задротская игры)


Репост из: Max Pastukhov | Практика агентского ИИ
Some Simple Economics of AGI - на удивление проницательная статья по тематике ИИ от людей с экономическим образованием. В этом и есть ее ценность: авторы смогли увидеть за технологиями реальность будущего. И в этом светлом будущем вопрос уже будет отнюдь не в технологиях, а именно в тех областях, где технологии не справятся "из коробки".

Основная идея статьи - в том, что проблема уже отнюдь не в генерации (она стала практически бесплатной и безлимитной, особенно в сравнении со стоимостью человеческого труда на тех же задачах). Основная проблема - в верификации того, что было сгенерировано. И тут я вынужден поправить авторов, поскольку они употребили термин не совсем корректно: более подходящим тут будет "валидация" (проверка качества решения проблемы, как и адекватности самой проблемы, в принципе), в то время как "верификация" обычно употребляется когда речь идет про сугубо технические моменты, вроде "структуры кода", "отсутствия ошибок компиляции" и так далее. Дальше я буду употреблять именно первый, более широкий термин.

Так вот: если какую-либо задачу можно валидировать автоматически, ее ценность снижается до стоимости вычислительных ресурсов. То есть, считай, даром. Почему? А потому, что любой агентский движок сможет в цикле гонять исправление ошибок, пока не добьется желаемого результата. Это становится возможным только если в конце каждого цикла есть полностью автоматический или хотя бы очень быстрый и дешевый человек-критик. Вроде: "Сравни две картинки - какая из них лучше?"

Конкретно для нас это означает, что обладание знаниями или даже опытом в тех областях, где возможна автоматическая проверка нашей работы, уже не дает никакого конкурентного преимущества перед любой большой языковой моделью. И даже не обязательно самой дорогой - уровень модели тут будет определять только количество циклов до достижения результатов. Мелкая модель будет ошибаться чаще, но все равно итеративно дойдет до цели. И, возможно, даже окажется дешевле по итогу из-за скорости и низкой цены компьюта для нее.

Определяющим становится именно выбор тех задач, где валидация заведомо сложная, дорогая, долгая или просто невозможная по любым причинам. И уровень валидатора тут будет определять качество итогового результата, поскольку агентские итерации будут приближаться именно к его видению результата. Опытный валидатор обладает тем самым "экспертным знанием" или "чуйкой", которое отсутствует в моделях "из коробки". Чтобы дойти до его уровня, нужно иметь реальный опыт решения реальных проблем, а не просто книжные знания.

В статье предлагается много решений конкретно этой проблемы, и я как-нибудь их отдельно разберу. Но для меня самой ценной была именно эта идея про валидацию как основу любого бизнеса в новом мире. Модели можно купить, железо будет неизбежно дешеветь. А вот выбор заведомо сложных в валидации задач, как и поиск экспертов-валидаторов с реальным опытом становится источником конкурентного преимущества. Отнюдь не технологии.

Поэтому, если вы видите свое будущее в очередной SaaS-вундерфавле, все будет сложно. Ибо ее достаточно легко будет склонировать в цикле: "Посмотри как это сделано у дяди и сделай мне так же, make no mistakes!" Гораздо сложнее склонировать клиентскую базу, репутацию, бренд, доверие и контакты, интеллектуальные права, капитал и страхование результата и рисков клиентов.

Парадоксально, но развитие технологий даст конкурентное преимущество именно тем, у кого бизнес меньше всего завязан на технологии. Чем больше в бизнесе технологий со старта - тем более он уязвим.


Awesome Liveinternet Stats

Если кто помнит, я давно делал скрипт-дашборд личартс для просмотра статистики нескольких сайтов на одной странице, подгружающий данные с LiveInternet аналитики. И вот долгожданная реинкарнация для 3.5 олдфагов)

На этот раз я пошел с другой стороны, вместо скрипта который надо где-то размещать, закрывать паролем, добавлять сайты, дублировать функционал - я сделал расширение для хрома, которое улучшает сам сайт liveinternet со статистикой. А именно - убирает оттуда рекламу (а её реально напихали как не в себя), перерисовывает графики на JS, делает более удобный сайдбар с избранными отчетами, и делает темную тему. Просто и лаконично, и все данные и любые отчеты - доступны.

И уже поверх этого - общий дашборд, куда добавляются сайты автоматически, стоит только в их статы зайти (можно отключить автодобавление). Там уже и показывается общая статистика по выбранным сайтам, график общей посещаемости, график посещаемости отдельных сайтов, сводная табличка. Но, чтобы не перегружать загрузку, там все таки реализовано через показ до вчерашнего дня (и сравнение с неделей назад), а не как в личартсе, где загружались сегодняшние данные риалтаймовые. Это менее удобно, конечно, но зато намного проще реализовывается в формате расширение.

Загружайте, если все еще иногда заходите на Liveinternet посмотреть статистику - Awesome Liveinternet Stats, отзывы-оценки приветсвуются

Для обратной совместимости есть полный legacy-откат, в шапке кнопкой расширение можно выключить, и пользоваться обычной версией сайта с рекламой, и справа вверху будет тумблер чтобы включить обратно.

Разработка заняла 3 дня, практически в самом начале пробы работ с LLM, написано на deepseek-v4-flash, 200м токенов ($1.5 в api, на опенкоде бесплатно), около 5-10 часов промтинга.

Для новых людей - это мой канал про агентский кодинг и новые проекты, рисерч вокруг LLM, аналитика, подписывайтесь - @llmkungfu =)


LLM Budget Report weekly.png
690.7Кб
weekly_budget.html
91.3Кб
Анализ данных стал как никогда прост)

Глядя на табличку опенроутовских моделей - захотелось узнать, а сколько там реально тратится в деньгах, а не в токенах. Табличку парсить моветон, залез в консоль - разумеется там в источниках json на 3мб (а вы думали почему страница столько грузится… без впна не покажет)

Скормил её дипсику - там не только данные по ценам и траты токенов, но еще и распределение токенов (можно вычислить cache hit и точную, а не оценочную сумму бленда)

И как финалочка - суммарно с опенроутера снимают токенов на $21м в неделю, или около $80м в месяц. Данные только за последнюю неделю, да и некоторые модели мало еще были.

Антропик собирает 9% токенов и 43% выручки (или $40м в месяц с опенроутера), опенаи - 6% токенов и 20% выручки ($20м)

Дипсик и сяоми наоборот, по 16% токенов, и по 2-3% выручки ($2-3м в месяц)

* некоторые неточности могут присутсвовать, я не бегал там изучая все данные)


Из забавного - попросил выписать базовые штуки в контекст, где описание проекта, доступы, особенности и прочее, думал вот я какой умный. После сжатия сессии - видно, что не прочитал контекст. Спрашиваю какого хрена - я не я, корова не моя, не читал, не было в агенте. Окей, пропиши в агенте, что первым делом читать контекст. Будет ли модель его читать при сжатии сессии - насяльника я не знаю, при открытии новой сессии - буду. То есть теперь надо после каждого сжатия сессии (а иногда это незаметно происходит) надо ручками тыкать в контекст) (понятное дело, что в норм инструментах такой проблемы нет, да, я в курсе). Либо новые сессии клепать, а то эта уже к 500м приближается, но вроде как это обычная практика.

В общем, зря я отложил "Как пасти котов", возможно оно вполне себе актуально)


Человеческий фактор в вайбкодинге

Не совсем очевидный для меня вывод, но таки менеджерские скиллы архиважны при агентском программировании, что подтверждают техлиды/CTO, которые этим занимаются. Для них воркфлоу с внедрением LLM почти не меняются (в личной разработке), только сами инструменты, а так все как и везде в менеджерских тасках - если без ТЗ, то результат ХЗ. То есть вот какими способами приличный тимлид или там ПМ (я ж хер его знаю корпоративные иерархии) доносит задачи до кодеров и потом проверяет результат - вот тоже самое и с LLM. Ты не будешь глазами ревьювить весь код - ты его покроешь тестами и поставишь ревьювить другого человека, более опытного. Ты не опишешь задачу "ну сделай заебись", ты вывалишь 40-страничное ТЗ и все экраны для верстки. И если в таком режиме работать с агентом - то результат будет прогнозируемый, достижимый, быстрый и недорогой (по сравнению с кожанными программистами). А если работать как попало - то и результат тоже, внезапно, как попало) И там даже не столь про специфичные для агентов настройки (это у больших игроков, у меня этого нет), а про сам подход, которого мне как раз и не хватает.

Я ведь как, почти никогда по ТЗ не работал. Мне привлекает какая-то идея - я делаю базовый её функционал. Потом оборачиваю в приятных UI. Потом ставлю себя на место пользователя - и сразу вижу, что тут надо еще вот эту кнопку, тут недостаточно понятно, здесь нужно расширить, а вот при таком условии все ломается к херам. И потихоньку наращиваю всё это мясцо итеративно.

С LLM сейчас я работаю почти точно так же (почти - потому что пока что базируюсь на прошлый проектах и доработках, а не с нуля). Фича за фичей, баг за багом, экран за экраном, все кнопочки, весь UX последовательно, где что неоптимально, где можно сделать в один клик а не в три. И при таком режиме возникает следующая проблема - если первоначальные фичи делаются просто влет, то вот эти вод доделки - уже нет. Модель не всегда понимает, что конкретно мне надо, и вот я уже одну правку типа сменить btn-warning на btn-alert описываю двумя абзацми, да еще и двумя промтами, потому что с первого раза он два блока перекрасил, а потом еще и каждый раз тестирует и делает скриншоты, хотя не умеет их распознавать (это тоже боль при работе с интерфейсами). С багами вообще тьма, он может 5-10 минут сам с собой размышлять, откуда я нашел этот баг, при этом всё это время работая с локальной базой данных, не синхронизируя с продом (или те же 10 минут ища незакрытый div, благо если это заметно и конкретно указать - правит быстро, иначе заманаешься объяснять)

В итоге я вот с утра три часа так вроде как работал, 100м токенов привычных сжег, а просишь беклог - там буквально в баджах баги поправил, верстку на разных страницах сделал одинаковой карточкам, и чуть более наглядный UI/UX. То есть после первичного вау, когда за полчаса делается недельная работа, наступает этап полировки и отлова багов, где приемущество по скорости не такое явное. Хотя, разумеется, тоже есть - если кнопочку я бы сам быстро перекрасил, и блоки даже в правильном порядке расставил, но какая-нибудь логика, миграции в ДБ, новые сущности, ajax запросы, хоть функционал чата - все это модель пишет сходу и без паузы. Просто выигрыш в скорости тут на порядок, а лишь в разы (о, теперь я понял, для чего нужен голосовой ввод! Все эти мелкие баги и косяки интерфейся - их же буквальной живой речью и трекшеном мышки проще объяснить)

Показано 20 последних публикаций.