Поляков считает: AI, код и кейсы


Гео и язык канала: Россия, Русский
Категория: Технологии


Пишу про AI, вайбкодинг и кейсы применения. Связаться: @polyakovbest

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: ROSTOV.AI : Лаборатория ИИ
Вышло первое большое видеоинтервью с Тибо Соттио — тем самым человеком из OpenAI, который нажимает кнопку сброса лимитов Codex. Я сделал полный перевод и саммари:

Кратко о главном из разговора с Мэттью Берманом:

— Тибо пришёл в OpenAI из DeepMind, где за год до ChatGPT уже был внутренний чат-продукт, который Google побоялась выпускать. Его вывод: культура решает

— у OpenAI исследования и продукт проектируются вместе, а идеи доводятся до релиза очень быстро.

— Слияние ChatGPT и Codex не маркетинговый ход: будущие модели сами требуют объединения. Цель — персональный AGI с интерфейсом, который подстраивается под человека. «Вы и ваша мама будете пользоваться одним и тем же продуктом».

— Сбросы лимитов начались как компенсация за сбои, а не как акция. Решение не согласуется ни с маркетингом, ни с финансами: «я могу нажать кнопку, когда почувствую, что это правильно». И да, физическая кнопка существует.

— Luna подешевела на 80%, потому что фронтирные модели оптимизируют инфраструктуру, на которой сами работают. Тибо называет это формой рекурсивного самоулучшения. Скорость ответов за три месяца выросла примерно на 60%.

— Режим ultra fast (до 14× быстрее) внутри OpenAI выдают не всем: мощности резервируют для клиентов, а внутри он нужен при инцидентах. Через год-два такие скорости станут почти стандартом.

— «Через два-три месяца Codex покажется примитивным»: следующему поколению моделей тесен ноутбук — облачные агенты, параллельная работа, голос.

В статье — саммари подробнее и полный перевод всего интервью: от культуры OpenAI и конкуренции с Anthropic до паузы в обучении фронтирных моделей и СДВГ Тибо.

👉 Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод

719 0 17 2 11

В канун возвращения пятичасовых лимитов Codex вышло интервью Тибо.

Конкретно в моем кейсе именно пятичасовые лимиты являются причиной вылета в экстра юз в Claude. В результате расходы на Антропик у меня больше 200 баксов. Так что ждём, что расходы на Codex тоже вылезут за пределы лимиты подписки.

UPD. Мне подсказывают, что введение пятичасовых лимитов касается только пользователей с подпиской плюс. Для Pro пока не включают.


Был нормальный SEO-спец, познакомился с ИИ, стал ужасным

У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика. За 2 года органический трафик стал x3 вообще без переделки структуры (с 2 800 до 10 000 визитов). Поэтому считаю их молодцами и периодически хвалю.

🔗 Сложный сайт: metallik.ru

Ребята реально поняли, что сайт нестандартный, придумали, как ему добавить «магазинности», создали категории тегов товарам, информационные статьи: у сайта растёт Share of Voice. Короче, всё вроде красиво.

Но вот к ним в руки попал ИИ (я узнал его по первой строчке в техзадании по антитезе) — и понеслась.

🤦🏻‍♂️ На что я прифигел

Прилетает рекомендация на доработку раздела профнастила, а там просто лендинг на 26 экранов с отзывами и энциклопедией профлиста.

Выглядит всё нормально и профессионально. Прям убедительно. Таблица, в которой написано, что людям нужны отзывы, они их ищут (лол, что в Гугле) и надо такой экран обязательно. Рядом ответы на главные вопросы, в том числе про снеговые нагрузки. Это очень важно для качественного сайта. И таких 26 экранов.

Но прикол в том, что нормальный человек под каждым пунктом будет спорить:

— 26 экранов на листинге товаров? Это же дофигища, вы куда?
— Отзывы у себя на сайте продавец модерирует сам, доверия к ним меньше, чем к карточке в Яндексе. Отдельный экран под них на листинге — точно не первое, что стоит делать.
— Ребята, у нас вообще-то интернет-магазин на шаблонах, а не лендинг: для нас исправление одной категории профлиста эквивалентно исправлению всех категорий на сайте.


И можно продолжать долго. Короче, проблема ИИ в продвижении в том, что он представляет собой кальку всего успешного успеха, который только можно встретить.

⚠️ На моём опыте есть ряд сфер, где ИИ ужасен

Раньше я любил говорить, что у ИИ есть три области, в которых он из коробки очень плох:

1. ИИ-агенты
2. Реклама в интернете
3. Сайты на PHP

Теперь к списку хочется добавить SEO. В целом эти проблемы предсказуемы и легко объяснимы:

ИИ-агенты, способы их конфигурации, настройки и построение обвязок — это тема 2025–2026 годов. В интернете пока мало материалов на этот счёт, поэтому ИИ часто использует устаревшие идеи.

Реклама в интернете — достаточно старая отрасль, но вся состоит из материалов про успешный успех: как компания-подрядчик включила ретаргетинг/автостратегию/размещения у микроблогеров и какая-то метрика полетела.

Сайты на PHP и материалы, связанные с ними, полны примеров плохих экспериментов и неудачных решений.

SEO туда же. Ключевая мысль тут, что в таких областях надо дополнительно отгружать в ИИ свои знания и свою доменную экспертизу. Какие действия работают, что в рекламе хорошо, как мы пишем и делаем сайты на PHP. Не надеяться на то, что кто-то натренировал ИИ на идеальную рекламу. Не натренировал.

🚀 Сначала отгружаем свою экспертизу и уже на неё зовём ИИ

Прежде чем просить рекомендации, я кладу в контекст четыре вещи: как устроен проект, что физически нельзя поменять, что мы уже пробовали и с каким результатом, по каким правилам принимаем решения. Для «Металлик и Ко» второй пункт звучит буквально так: правка одной категории равна правке всех категорий сразу.

С таким брифом лендинг на 26 экранов просто не рождается. ИИ видит ограничение платформы и предлагает то, что можно раскатить на весь каталог, — а это как раз то, за что я хвалил ребят два года.

🎯 ИИ не знает вашу отрасль. Он знает, как о ней принято писать в интернете. Поэтому и сыпется ровно там, где публичные материалы состоят из кейсов «включили автостратегию — и всё полетело».


А у вас какая область, где ИИ из коробки выдаёт красивую чушь? И что вы кладёте в контекст, чтобы он перестал?

----

Поляков считает — AI, код и кейсы

1k 0 26 17 15

Yandex Ecom Open Air: Алиса, агентная коммерция и ставка Яндекса

Сходил на Yandex Ecom Open Air. Агентная коммерция — главный лейтмотив дня, про неё говорили и с большой сцены, делали прогнозы. Был ещё обзор Яндекс.КИТ, но мы с вами интересуемся агентами, поэтому поговорим про неё.

🤦🏻‍♂️ Отдельная ирония: заявку, в которой я указал, что связан с рынком ИИ, на этот фестиваль отклонили.

1️⃣ Что показали по Алисе AI

Ассистенту обещают прокачать память о пользователе, ризонинг и вызов инструментов. Идеальный сценарий, чтобы агент искал за пределами пользовательского запроса. Предлагал лучшие альтернативы. Надеюсь это не будет очередным засильем нестрогого рекламного таргетинга.

2️⃣ Модели у экосистем

Со сцены прозвучало наблюдение: на западе модели принадлежат независимым компаниям, в России — экосистемам. Отдельным пунктом шёл большой объём данных о пользователях как преимущество.

Для качества подбора данные и правда преимущество. Вопрос в том, кому принадлежит ассистент и нет ли конфликта интересов между пользователем и владельцем агента. Для качества подбора данные и правда преимущество.

Яндекс владеет моделью, Маркетом, платежом, доставкой и рассрочкой. Маркировка рекламы уже есть, а вот маркировку агентных рекомендаций пока не придумали, получаем вопрос доверия.

🤔 Моё скромное мнение

Наблюдая за стараниями Яндекса в популяризации агентного екома, ваш покорный слуга уверен в популяризации потребления через ИИ-агентов. Разработчикам MCP стоит готовиться к поддержке всех возможных протоколов, так как у нас уже есть большое разнообразие идей от разных игороков. Скромные прогнозы Data Insights — 11% российского екома у агентов к 2032 году.

Что думаете вы? Уже делали покупки через ИИ-агентов? Доверили бы выбор каких-нибудь товаров ИИ?

----

Поляков считает — AI, код и кейсы


Вайбкодер и вайб-дизайнер — это разные люди, и жаль

Весной я писал, что профессия верстальщика сайтов попала под давление: сайт теперь собирается за вечер. Три месяца спустя я насмотрелся на результаты и хочу вам пожаловаться.

🍪 Кейс 1. Баннер согласий, который съел статистику

Клиенту переделали сайт. Фирменная черта исполнителя — выкатывать сразу в продакшен: сайт ему проверил GPT-5.6 Sol и сказал, что всё хорошо.

Сразу после выкладки — деградация трафика в Метрике. Оказалось, модель заодно провела терраформирование сайта под европейскую юрисдикцию (GDPR): повесила плашку согласий, которая блокирует Метрику и Calltouch до акцепта.

Проблемы две.

1️⃣ Юридическая. Требование «не грузить счётчики до согласия» — это ePrivacy и GDPR. В 152-ФЗ такой нормы нет, но есть пункт про «явное согласие», который всё портит, разбираемся.

У бизнеса есть законный интерес: считать окупаемость рекламы, отбивать спам, понимать, где ломается сайт. При этом мы не звоним человеку без спроса и не отдаём аудиторию третьим лицам.

Я предлагаю рассуждать про куки с позиции борьбы со спамом: капча — тоже кука. Заблокировали сторонние — тонем в спаме.

Формулировка, которая закрывает вопрос:

🔑 Мы используем файлы cookie, Яндекс Метрику и Yandex SmartCaptcha для анализа посещаемости, противодействия спаму и улучшения работы сайта. Обработка осуществляется в целях реализации законных интересов оператора на основании п. 7 ч. 1 ст. 6 Федерального закона № 152-ФЗ «О персональных данных». Подробнее — в Политике обработки персональных данных.


2️⃣ Денежная. Счётчик молчит — автостратегии Директа недосчитываются конверсий и учатся на обрубленной выборке. Результат — падает доходность бизнеса. Аналогичным образом происходит изменение статистических факторов ранжирования в органическом поиске.

🧩 Кейс 2. site-config.js вместо констант

Здесь я был принимающей стороной. Попросил фрилансера вынести телефон, цену и прочее в строковые константы лендинга, чтобы правки не растекались по файлам.

Получил site-config.js, который подменяет захардкоженные значения в готовом HTML. Вместо одного места для правок стало два. Хотели уменьшить сложность, получилось, что Codex её увеличил. Забыл поправить исходник — в поиске висит старая цена, потому что роботы поисковых систем не любят java script.

Отдельно про «робот всё отрендерит». Рендерят так неохотно, что капец.

Google ставит JS-страницы во вторую волну: у неприоритетных доменов очередь тянется неделями. Яндекс держит рендеринг в бете с 2022 года.

LLM-краулеры не рендерят в принципе. Vercel и MERJ разобрали 500+ млн запросов GPTBot — ни одного исполнения JS.
Цена, подставленная джаваскриптом, для ChatGPT и Perplexity просто не существует.

🎯 К чему я веду

В обоих кейсах код рабочий и симпатичный. Всё выглядит в высшей мере профессионоально и красиво.
Сломалось понимание контекста: чья юрисдикция, откуда приходят деньги, кто читает страницу кроме человека.

⚡ Вайбкодер разбирается в логике продукта и умеет остановить агента. Вайб-дизайнер оценивает результат по картинке и похвале от модели.



📚 Где брать базу

Сейчас будет похоже на нативку, но я правда вспоминал этот курс за несколько дней до анонса. В прошлом году моя жена Даша прошла «Вайбкодинг на максималках» Глеба Кудрявцева.

Первые занятия там — про то, что такое программа, язык программирования, зачем нужны Git и Docker. И только потом «давайте сделаем прикольно». Ровно позавчера рассказывая про шишки набитые об красивые лендинги я вспоминал курс Глеба и говорил, как круто, что он учит базе и объясняет подводные камни.

Очень кстати, что очередной поток стартует 20 августа. Есть бесплатная первая лекция, а промокод GLEB3 даёт ещё 10% сверх цены на лендинге.

А теперь предлагаю повспоминать косяки, которые вам принесли GPT Sol, вкатившийся вайбкодер или разработчик. Пишите в комментариях.

----

Поляков считает — AI, код и кейсы

2k 0 68 10 28

Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра

Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.

🏆 Агентный бенчмарк: вровень с фронтиром

Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%).

И это всего лишь 27 миллиардов параметров. Локально. Без интернета.

🐌 А теперь цена

Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.

Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:

📐 макс. ток/с = пропускная способность памяти / размер активных весов


Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки.

Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести.

👁 Видео: описывает отлично, понимает плохо

Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно.

🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео.

🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно.

🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены.


Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным.

🗺️ Копии интерфейсов по скриншоту — прекрасно

Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу.

В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях.

🧾 Что в итоге, где затестить и сколько стоит

Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально.

Для интерактива терпения не хватит. Поэтому тут выручают провайдеры:

• У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 67 ток/сек
• На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает
• Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с.

Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает?

----

Поляков считает — AI, код и кейсы


Сюрприз от Manus: аккаунты удаляют, но обещают все вернуть

Сегодня получил рефунд подписки на Манус и уведомление о том, что надо сделать бекап.

Оказывается, что для соответствия законодательству компания вынуждена удалить данные.

Но при этом они позволяют все данные скачать в виде бекапа, чтобы потом восстановить.

🔗 Вот ссылка: https://manus.im/backup

🤦🏻‍♂️ Всему виной сделка с Мета (террористом и экстремистом)

Data generated by some users on/after Meta's acquisition of Manus needs to be deleted to comply with regulatory requirements in specific jurisdictions.


В своем блоге Манус объясняет ситуацию, что некоторые юрисдикции обязывают их удалить данные накопленные в период владения вышеназванной корпорацией.

💳 Дарят скромный извинительный бонус

Всем кто вернется после 23 августа дадут скидку 90% на первый месяц подписки.

Возвращаться или нет, пока не решил. Возможности сервиса, это только виртуальная машина + агент в почтовом ящике.

Что думаете? Нужен Манус современному айтишнику? Какие фичи в нем ценные?

UPD: Анонсированы вообще свободные лимиты.

----

Поляков считает — AI, код и кейсы


Репост из: Тимур Хахалев про AI Coding
инсайт который пришёл мне этой ночью, пока я жёг токены

вы сталкивались когда-нибудь с такой проблемой: прорабатываешь с codex scope задачи или архитектурное решение и порой бывает, что это занимает довольно много контекста и может выполниться парочку compaction.
да, у codex действительно лучший compaction на рынке и у нас есть почти бесконечное контекстное окно, но всё же важные детали после compaction в любом случае теряются.
особенно, если эти детали не были зафиксированы где-нибудь в файлах, которые можно почитать после compaction.
что делать?

попросите codex использовать tool read_thread.
если вы раннее видели как codex читает чужие треды, то вы наверняка знаете, что это за tool – он позволяет кодексу читать соседние треды.

но вчера до меня дошло, что его можно просить читать и свой тред тоже.

таким образом, можно прочитать детали, которые он писал в треде, до наступления compaction и восстановить их, чтобы потом сохранить в вашем плане.

прочти весь наш тред через read_thread и убедись что ты собрал все детали которые мы с тобой обсуждали и на которых остановились

вы уже знали про такой лайфхак?

Лайк, репост,
Тимур Хахалев про AI Coding, подписывайтесь!


Разбираем ошибки Сбербанк Онлайна и обсуждаем ИИ для управления интерфейсами

На самом деле пост про Bb харнес, но хочется обсудить с позиции продуктов, поэтому начнём со Сбербанка.

Около 240 часов коллективного времени в сутки — столько, по моей прикидке, съедает ИИ-поиск в «СберБанк Онлайн».

Сбер встроил ИИ в строку поиска. Раньше я находил нужный пункт меню мгновенно, теперь жду генерацию 2-3 секунды, чтобы быстро перейти к разделу со штрафами.

🗺️ Считаем на салфетке. В приложении, по данным самого Сбера, больше 85 миллионов активных пользователей. Если хотя бы 1% раз в сутки лезет в поиск и теряет на ожидании секунду — это 850 000 секунд, или 236 часов. Оценка нарочно скромная. Плюс электричество и токены за то, что и так работало быстро.


А на прошлой неделе я увидел, как ИИ в интерфейсе делают по уму.

🧩 bb: агент дописывает интерфейс на ходу

Рефат разобрал bb — открытую обвязку для кодинг-агентов — https://getbb.app. Я бы назвал это харнес для харнесов. Внутри Claude Code, Codex, Cursor, Pi, OpenCode, Grok и Hermes, что угодно с поддержкой ACP.

Мне в Bb зашла идея с плагинами: агент прямо в треде пишет плагин под твою задачу, собирает и подгружает его сам. Плагин умеет добавить панель в сайдбар, свою команду, инструменты и навыки для агентов, фоновые задания, собственную базу SQLite. Многое в самом bb так и сделано: автоматизации, сайд-чат, память, задачи, интеграция с GitHub.

🤔 Я искал у Bb связь с Россией, так как Bb — это слово ИИ набранное в английской раскладке. Но не нашел.


🧪 Что попробовал я

Селектор скиллов. Один раз указываешь директорию с навыком, дальше bb сам прокидывает симлинки и добавляет избирательную подгрузку. Вышло криво, но за пару минут и без единой строчки кода руками.

Можно настроить отображение остатков лимитов подписки, и у меня наконец-то отображается остаток лимитов из Cursor.

⚡ ИИ в интерфейсе может быть полезен тем, что может собрать экран под конкретного пользователя.


🎯 Кому стоит украсть идею

- Сбер: чтобы пользователь мог вынести штрафы в меню, если ему они интереснее чем кредиты.
- Битрикс24: дашборды, которые пользователь собирает себе сам по своим задачам.
- Яндекс Директ: быстрый доступ к настройкам, до которых сейчас четыре клика.

Список можно продолжать, в него вписывается почти любой SaaS с ценностью на уровне приложения и интерфейса.

🧯 Что стоит знать до установки

Проекту пара месяцев. До версии 0.36.0 от 8 августа сервер bb слушал все сетевые интерфейсы и отдавал неаутентифицированный API любому, кто дотянется до машины. Починили, теперь только 127.0.0.1.

Десктоп только под macOS на Apple Silicon, остальным npx bb-app@latest, Windows через WSL2.

Сам я не перееду: слишком привык к нативным Claude Code и Codex. Но как демо для тех, кто делает интерфейсы, это самое интересное, что я видел за последнее время.

Думали уже о том, что ИИ — это скорее не болталка, а способ нового взаимодействия на уровне интерфейса? Какому из продуктов советовали бы добавить агентов, как средство изменения интерфейса?

----

Поляков считает — AI, код и кейсы

1.8k 0 46 21 13

Репост из: Pavel Zloi
Cursor - это выпрямитель рук

По ощущениям это словно дарк соулс от мира кодовых агентов. Ошибок не прощает. Надо очень внимательно следить и за тем, что ты попросил агента сделать, и за тем, как он это в итоге сделал. Один раз пролистал диф по диагонали, и в репозитории уже живёт что-то, что вроде работает, но совсем не так, как ты задумывал.

Зато дисциплина от этого подтягивается (хотя многих это и отпугивает). Начинаешь формулировать задачу точнее и читать сгенерированный код внимательнее, апрувить не сразу пачкой, как в Codex и Claude Code, мол я сделял, а небольшими кусочками, с учётом контекста.

Поэтому выскажу мнение основанное на личном опыте:
Если научиться работать с Cursor, то и с любым другим агентом дальше пойдёт легче и проще.


Как раз про это я собрал бесплатный курс про Cursor AI на Stepik, там всё по шагам, от первой настройки до работы с большими проектами.

PS. Кому удобнее читать офлайн, весь курс собрал в PDF-книгу

2.3k 0 75 48 24
Показано 10 последних публикаций.