··• Серёжа печатает


Гео и язык канала: Россия, Русский


Хроникёр рынка. Product Owner в Skillaz, B2B/B2C, HRTech, Edtech, IT. Здесь коротко про продукт, найм, AI.
Полная информация тут — https://popovs.tech/uplink
Сотрудничество через Влада — https://t.me/vlad_0045
Попов Сергей Андреевич
ИНН 780445359193

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Статистика
Фильтр публикаций


Ребята из Авито балуют, прислали коробку с бейджиком на Avito.tech.conf, а внутри часы)) Мне никто никогда часы не дарил, да я их и не носил почти, но мне было очень прикольно, потому что часы сами по себе выглядят интересно, я давно подумывал начать их носить и вот появился отличный повод.

В общем, буду модный и буду лично вам хвастаться — записывайтесь на конфу, увидимся в AG Loft в Москве 26 сентября.


Продолжаю шарманку про субсессионный режим, потому что могу.

Использовал в кейсе, который показывает классность. Итак, допустим, вы делаете какого-то помощника, цель которого — отвечать на вопросы. Но при этом вы хотите его в некоторых случаях ограничивать, а в некоторых помогать ему давать верные ответы.

Задача для 26 года довольно простая, но есть момент. Он в том, что нельзя сделать чат, который взлетит с первого раза. Просто потому что такие чаты дообучаются. Типа раскатываешь его на 100 человек, смотришь ответы, вносишь правки и кидаешь ещё на 100 человек. И так постепенно раскатываешь. Это требует времени и пропускает очевидные ошибки.

Ну или пропускал.

Что можно сделать с субсессионным режимом, который не ограничен субагентами. Генерируем выборку в 1000 вопросов. Дальше просим основной чат — чтобы он прогонял живые вопросы и получал ответы, после чего анализировал их по правилу, и если ответ не ок, то он отправляет в отдельную сессию контекст для исправления. Сейчас я сделал такой кейс, и за 18 часов автономной работы я улучшил количество качественных ответов со стартовых 78% до 94%.

Дальше все равно надо будет его гонять на реальных данных, но слой очевидных ошибок мы сняли.


Ходят слухи, что тут у нас появился GLM 5.5, под кодовым названием ОХ БЛЯТЬ.
Работает между прочим довольно круто, я лично фанат GLM.
Надо попробовать на разных задачах, ночь будет сложной.

Щупать можно бесплатно через OpenRouter https://openrouter.ai/stealth/ox-alpha


короче, я за ночь написал плагин, который мониторит мою VM, с историей и в риалтайме, а так же чем забит диск.

довольно неплохо и быстро


Рассказываю, значит, чем этот чел занимается ночью))))

Вот она, цена автономности.

Он посчитал, что моя установка — в случае блокера стоп — не такая важная, потому что проблема несложная.

Он упёрся в лимит диска на виртуальной машине и не смог развернуть контейнеры. Это ладно.

Дальше он решил, что ему в целом ок увеличивать место на VM по гигабайту и пробовать развернуть.

Когда я проснулся, он уже поднял с 80 до 120 примерно, при этом он словил ошибку, но она была уже НЕ ПРО РАЗМЕР ДИСКА, но он решил пробовать его дальше прочинить так.

Так что теперь у меня большой диск.


Короче, будущее за интерфейсами, которые строят сами себя. Час ночи, я полез изучать вот эту шутку — https://getbb.app/.

Заявлено очень интересно, что ты можешь просить её дособирать под тебя сам. Звучит, конечно, интересно. Сейчас буду трогать.




Представляете меня играющим в падел? Я вот не представляю. Но для тех, кто играет и для тех, кто не играет, есть отличные новости — на носу новая Avito.Tech.Conf и падел это только начало)

В этом году команда AvitoTech вместе с Buenos Padel ВДНХ сделали не только брендированные корты, но и бесплатные игры для участников конференции с 20 августа по 20 сентября! Меня вы там не увидите, я же тут еще и палец сломал. Но многие мои знакомые уже записались.

Сама конфа в прошлом году была супер с очень классной тусовкой. Классные люди, с которыми можно поболтаться и классные мысли, которые можно обсудить.

Я буду!

Конференция пройдёт 26 сентября в Москве (AG Loft), а зарегистрироваться на нее можно по ссылке.


Возможно вы ждете что-то полезное от меня, но пока ждёте, вопрос.

Бывало ли у вас такое, что вы просыпаетесь утром, а у вас 35 пропущенных от агента? Что делать в таких случаях?


Короче я палец на ноге сломал.
Сейчас дома уже.


Рекорд автономности! В таком режиме Борис сделал с нуля сервис за 36 часов непрерывной работы.

И сделал полную херню! Паххахаха

Шучу, но оно просто на деплое развалилось, локально отлично всё, надо до шлифовать немного. Но от результата я в шоке.


Итак, за последние 2 месяца мы получили

MiniMax M3 — открытая мультимодальная модель с контекстом 1 млн токенов. Ставка на код, computer use и автономных агентов.

Microsoft MAI — сразу 7 моделей для reasoning, кода, изображений и голоса. Собственный модельный стек Microsoft вместо зависимости от OpenAI.

Gemma 4 12B — текст, изображения и нативное аудио. Запускается локально на ноутбуке с 16 ГБ памяти.

Nemotron 3 Ultra — открытая MoE-модель NVIDIA. Заявлена быстрее и дешевле классических больших моделей в длинных агентных задачах.

GLM‑5.2 — кодовая модель с контекстом 1 млн токенов. Заявляет в 2,9 раза меньше вычислений на максимальном контексте.

GPT‑5.6 — семейство Sol, Terra и Luna под разные цены и задачи. Sol заявлена сильнейшей моделью OpenAI для кода и агентов.

Claude Sonnet 5 — массовая модель для кода и tool use. Заявлена близкой к Opus 4.8, но дешевле.

Claude Opus 5 — модель для сложных и длинных агентных задач. Почти уровень Fable 5 примерно за половину её цены.

Kimi K3 — 2,8 трлн параметров, зрение и контекст 1 млн токенов. Открытая альтернатива топовым закрытым моделям.

Gemini 3.6 Flash — быстрая модель для кода и мультимодальных задач. Главный аргумент — баланс качества, скорости и цены.

Qwen3.8‑Max — новый флагман Alibaba с текстом, изображениями, видео и контекстом 1 млн токенов. Заявлен сильнейшим Qwen для кода и агентов.

Meta Muse — семейство моделей для reasoning, кода и computer use. Muse Glimmer можно запускать локально примерно на 20 ГБ памяти.

Grok 4.6 — модель для длинных агентов и визуальных задач. xAI заявляет уровень GPT‑5.6 Sol по сводному тесту Artificial Analysis.

DeepSeek V4‑Pro — агентная модель с expert mode и настройкой глубины reasoning. Заявлена стабильнее предыдущей версии в длинных задачах.

GLM‑5.3 — свежая кодовая и cyber-модель Z.ai. Компания заявляет рост на 50% относительно GLM‑5.2, но открытые веса пока придержала ради проверки безопасности.


Да остановитесь блин


Очень много новых релизов. Настолько много, что они все смешались. Поэтому вместа разбора релизов — картинка, которая коротко описывает рынок ИИ.


Делаю агента, который будет помогать клиентам работать с системой. Пришло время финальной полировки. Говорю — сделай мне маскота, который максимальный и дружелюбный. И который выглядит так, что он готов помочь клиенту, но при этом он предупреждает иногда об опасных действиях.

ChatGPT — ни слова больше.


Кстати да, Клод за процесс выше не шарит, пока что, он умеет только между сессиями передавать инфо, но создавать надо руками.


Субсессионный режим.

Короче. Лёша (который не заводит канал) подсказал мне интересную штуку, на которую я не обратил внимание, хотя пользовался.

Недавно Codex выпустил обновление, которое позволяет создавать из одной сессии (чата) новый чат внутри проекта. Во-первых, это удобно. Не надо руками переносить сессии с контекстом, а можно просто написать — продолжи в новой сесии, когда хочешь скинуть контекст.
Но гораздо лучше — возможность организовать самый настоящий мультисессионный режим с оркестратором.

Это не субагентный режим, потому что в субагенте он вызывает всё внутри себя и пишет, и ревьюит с учётом контекста, и это хорошо. Но там также есть лимиты на количество этих субагентов.
В субсессионном режиме у тебя есть центральная сессия. Это по сути главный чат, в котором ты делаешь план. Например, у тебя уже была написана спека, и ты её раскладываешь на план прямо в планмоде и получаешь большой план. А дальше ты ему отдаёшь задачу из нескольких частей:

1. На каждый этап создавать новую сессию с подходящей или конкретной моделью. А он умеет именно брать разные модели и усилия. То есть это экономия токенов.
2. Он не только умеет их создавать. Он умеет с ними работать, то есть мониторить, проверять и писать.
3. Просим его следить за сессией, чтобы она не отклонялась от плана, не занималась оверинжинирингом, и просим подгонять это всё.
4. А после окончания сессии, чтобы основная сессия отревьюила это, передала правки или отправила план дальше в новую сессию.

И мы для этой основной сессии задаём все правила, ограничения, ставим её в целевой режим, и он по сути работает за вас.

Например, вы пишете ему:
Ты — сова, эффективный менеджер. Твоя задача — реализовать план.
На каждый этап или задачи создавай новую сессию в подходящей модели и усилии.
Следи за каждой сессией, чтобы агент не отходил от плана, не создавал лишнего, не зацикливался на мелочах.
Если видишь такое — корректируй его.
По окончанию — делай ревью на качество и план, и либо создавай новую задачу, либо отдавай правки.
Будь мудрым и подгоняй агентов, чтобы они работали максимально быстро.


Борис в таком режиме в данный момент решает задачу 19 часов. И нет, это не бесконечный луп, это именно длинная последовательная внимательная работа.
Конечно, такое можно и нужно не для всего использовать. Но я лично перестал вызывать субагентов почти. Я теперь прошу отдать в новую сессию на ревью и так далее.

А дальше ещё сильнее.Смотрите.
Мы оборачиваем это в скилл, который всё это делает, и говорим ему, что самые важные части мы отдаём в клод. Он вызывает локальный клод, передаёт ему задачу и анализирует ответ. Это скилл, который клод для кодекса.

И всё. Как Лёша говорит — я что, животное, чтобы руками следить за агентами? Скилл — https://github.com/tsergeytovarov/codex-subsession-mode

743 0 33 3 13

Дал image2 ребёнку.
Дамы и господа — ягода кряква!





Показано 20 последних публикаций.