Air ~ AI


Channel's geo and language: Russia, Russian
Category: Technologies


>> AI Консалтинг & проектирование внедрения
🎓 AI | MBA | CFA @Airforai

Related channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Forward from: AiHub ✨ Приручаем ИИ | Вайб-кодинг | Ai-first development
Парадокс сабагентов, роёв и прочих мультиагентных систем

Пост родился как логическое продолжение предыдущего поста про правила, где я намеренно придушиваю возможность запускать сабагентов.

Откуда это вообще пошло. Всё чаще наблюдаю картинку как люди торопятся подключить как можно больше агентов в свой харнесс, при этом даже в один поток еще работу не наладили. Что они ожидают увидеть в таком случае на выходе? Мне не понятно. Думаю, им тоже. Ощущается, что они заражены какими-то постами блогеров или какими-то хайповыми роликами/статьями, воспринимают это как решение большинства проблем, но предметно объяснить какую проблему они этим подходом решают, не могут.

Давайте откатимся чуть назад, чтобы вспомнить, для чего их вообще придумали.

Впервые щупать сабагентов я начал на Claude моделях, когда было жесткое ограничение в 200 000 токенов контекста, а модели могли выбирать не самый оптимальный путь мышления перед реализацией задачи. Тогда сабагенты выглядели как инженерный приём, который позволяет:
1️⃣ Экономить контекст. Сабагент получил задачу, выполнил ее, передал результат основному агенту.
2️⃣ Сузить фокус агента на конкретной задаче. Сабагент и агент работают внутри своих окон, каждый может иметь свой системный промпт (я про промпт, описывающий работу сабагента/агента, а не про тот случай, когда сейчас GPT или Claude могут сами спавнить в любой момент себе помощников, которых вы заранее не прописывали).

Работало действительно неплохо. Можно было делать ресерч одним сабагентом, код писать основным агентом, а тестирование, ревью и обновление документации поручать другим сабагентам, узко настроенным на свой спектр задач. Тогда можно было спокойно закончить достаточно большую задачу до того, как мы переполним контекст и схватим компакт. А компакты в то время своим качеством не славились и многие придерживались принципа "если компакт произошел, то дальше процесс уже стал неуправляемым и надо срочно финалить задачу и перепроверять, не начудил ли агент".

И напомню, что 200к контекста - не совсем те 200к, которые мы можем взять и использовать в полной мере. На старте, пока не появились скиллы и были только MCP, в легкую могло уходить по 30-40к токенов на содержание MCP в контексте, и буфер для сжатия контекста при компакте в районе 40к контекста. Даже на самых оптимизированных конфигах по факту мы имели на старте не 200к, а примерно 140к свободного для работы контекста. Это теперь кажется диким, ведь сейчас на среднем проекте только сбор информации по проекту перед реализацией какой-либо фичи уже может достичь 100к+ контекста.

Далее вендоры стали добавлять собственных системных сабагентов в наши харнессы, там и модель можно использовать попроще и побыстрее, и промпты заранее нужные заготовлены, и обслуживать это не надо. Все работает из коробки. Например, какой-нибудь explore агент для сбора контекста по проекту и последующей передачи его основному агенту, яркий тому пример. И качество компактов сильно подтянули, можно было спокойно переживать 2-4 компакта и все нужные детали всё еще агент учитывал, можно было сильно не переживать, а нужный контекст после компакта добирался. К тому же, у Claude появился 1 миллион контекста, у GPT тоже (но в какой-то момент они свернули не туда, и жестко его порезали). Но этот миллион контекста не работал так надежно, как хотелось бы, часто после 30-40% заполнения уже начинались явные проблемы в работе и потеря фокуса на задаче (сейчас с этим всё гораздо лучше).

Из этого как бы следует логичный вывод. что да, сабагенты нужны, разгружаем основного агента, а он на своем минимальном узкосфокусированном контексте контролирует процесс. С точки зрения задумки всё красиво. Но на практике картина вырисовывается иная:

1️⃣ Основной агент на старте запроса собирает контекст, даже если он это сделал в минимальном размере и поручил основной сбор сабагенту, сабагент заново читает ВЕСЬ контекст, отдает саммари основному агенту. Основной агент, перед тем как начать выполнять задачу, всё равно пойдет читать связанные файлы чтобы посадить новый код в известное ему место, а не по наводке агента по ресерчу. Итого имеем почти двухкратное чтение контекста, а мы еще даже код писать не начали. Время, кстати, тоже теряем. У GPT 5.6 буквально в системном промпте указано, что он должен спавнить сабагента для сбора контекста при любом запросе. Даже когда вы обсудили с ним большую часть реализации, и в целом он сам уже коснулся всех нужных файлов в достаточной степени, чтобы сделать какой-то вывод и распланировать задачу, он все равно будет спавнить агента который опять всё заново будет читать. Это бред. Так быть не должно. Он сам уже все карты на руках имел. Ах да, еще и не забываем что уходит приличное количество токенов на мышление и генерацию промпта от основного агента -> сабагенту, и после отработки сабагента происходит тоже самое в обратную сторону. Экономия, говорите? Ну, нет. Звучит это всё как какой-то заговор на то, чтобы мы больше токенов сжигали. Оптимизация ради оптимизаций порождает отрицательную эффективность.

Что с этим делать? Брать запуск сабагентов под контроль исходя из вашего воркфлоу, а не из-за пожеланий вендоров в системном промпте. Допускаю, что каких-то кейсах запуск агента по ресерчу будет ценным шагом, особенно на новых фреймворках когда надо перелопатить и код в проекте, и документацию, и внешние источники с документацией библиотек. Это скорее крайние случаи в проектах с непопулярным набором фреймворков и библиотек. Иначе у основного агента мозги от кол-ва информации закипят и контекст действительно забьется мусором. Мои советы релевантны скорее для общей массы веб проектов. Конечно же, крайние случаи надо рассматривать индивидуально.

2️⃣ Потеря важных деталей при передаче задачи сабагенту и возврат отчета обратно агенту. У себя я это выявил в результате достаточного долгосрочных тестов и наблюдений и этот факт уже ничем не перебить. Когда у основного агента есть достаточно жирный промпт с кучей детальных инструкций, он далеко не всегда все эти детали ответственно передает. Из-за чего сабагент начинает работать с самого старта над некорректно поставленной задачей. И вернет отчет тоже с некоторой долей вероятности, тоже с потерей деталей уже с его стороны. Писал об этом тут , в бизнес агентах это даже мешало, что пришлось отключать на уровне конфига возможность спавнить помощников.

Что с этим делать? Отключать на 100%, как мы ранее уже решили, конечно их не будем, а вот контролировать - обязательно. Для передачи задач и отчетов между агентом и сабагентом нужно заключать в рамки строго контракта: что, в каком виде и с какой степенью глубины и детальности должно передаваться. Это можно буквально зашить в правилах агента, он будет составлять задачу для сабагента в нужном вам формате и указывать ему формат отчета, по которому он должен будет вернуть результат работы, что значительно повысит качество их взаимодействия и сбережет ваши нервы.

Итого, действительно полезное применение этого я вижу только в некоторых проектах где нужен глубокий ресерч по проекту и документации, и в процессах ревью кода, где чистая изолированная сессия это базовый минимум для честного ревью. Кто и как это реализует это уже другой вопрос, можно и другой модели это отдать, и даже отдать какому-то удаленному ревьюиверу, без проблем. Главное уловить суть, что если мы хотим адекватный расход токенов и быстрое выполнение задач, мы должны взвесить что для нас важно. Как по мне, лучше пережить пару компактов на гпт (на клоде с его миллионом контекста, скорее всего и не придется), но работать в один поток и сабагентов пускать строго под присмотром по установленному контракту, где ожидаете это вы, а не где вздумается модельке.

А что с роями? а я даже это обсуждать не хочу, пока это игрушки для энтузиастов с безлимитным доступом к токенам. Возможно, за пределами вайбкодинга это и применимо, но точно не здесь. Чтобы рой ожил и выполнял свои задачи, при этом не мешая друг другу и не трогая одни и те же файлы, придется плодить пачку worktree, которые еще потом придется как-то сливать в одну ветку и решать кучу конфликтов.

Что думаете? Может я их "готовить" не могу, и у вас сложилось всё куда удачнее и стабильнее с мультиагентами?


Ox Alpha , Ox Ramp

В эти дни на рынке ИИ одновременно произошли три события:

- Stripe официально подтвердила покупку OpenRouter
- На следующий день на OpenRouter и на платформе OpenCode появилась загадочная модель Ox Alpha.
- Ramp, конкурент Stripe в мире корп финансов, в этот же день запустил собственный сервис маршрутизации моделей Router

*Router (Ramp) сейчас дает $26 стартового кредита для новых пользователей. (перед получением кредита 'https://t.me/realtimeforai/477?comment=9606' rel='nofollow'>прочтите)
*Ox Alpha тоже пока бесплатна, и на OpenRouter, и через OpenCode Zen. Вчера в чате настраивали. Но только неделю бесплатно

Что известно про Ox Alpha
По характеристикам это флагманский продукт. Модель позиционируют как заточенную под длинные агентные задачи и написание кода. Отзывы хвалебные

*оператор заявляет о пропускной способности до 100 триллионов токенов в сутки, такой объём сопоставим с суммарной мощностью нескольких крупнейших лабораторий мира. Поэтому споры о том, кто ее выпустил продолжаются

В комьюнити лидирует версия, что это GLM-5.3 от китайской Zhipu AI, вчера версия усилилась: независимые исследователи обнаружили в служебных логах Java stack-trace с внутренними именами классов API Zhipu и полное совпадение токенизатора по 30 из 30 проверенных проб

Версия про доработанный Cursor Composer тоже существует (я ее придерживаюсь), и у неё есть своя логика: десятки триллионов токенов в сутки больше похожи на инфраструктуру вроде xAI, чем на возможности самой Zhipu. По этой версии Composer дообучен поверх архитектуры GLM. Слабое место версии в том, что она не объясняет находку от 22 августа: Java stack-trace с внутренними именами классов API именно Zhipu - это признак того, что запрос обрабатывался на серверах самой компании


Кто и когда вытеснит OpenRouter

Сейчас через платформу проходит более 10 триллионов токенов в сутки, доступны свыше 400 моделей, а сообщество превысило 10 миллионов разработчиков и компаний. Рост в 10 раз ежегодно с момента основания в 2023 году

OpenRouter не берёт наценку на сам токен, а зарабатывает на пополнении баланса: 5-5,5%

Крупные компании достигнув огромных оборотов на сервере уже не хотят платить эти 5,5% и начали выбивать у OpenRouter и у самих лабораторий прямые скидки. Сами лаборатории открывают собственные каналы продаж. Плюс стали появляться конкуренты, такие как Ramp

Ramp уже 3 года использовала такую маршрутизацию внутри себя и теперь открыла её всем. Сервис бесплатен до конца 2026 года (нет процента для разработчиков), даёт новым пользователям $26 стартового кредита. У них уже есть доступ к моделям OpenAI, Anthropic, DeepSeek, Moonshot, Minimax, Nvidia, xAI и Z.ai - с оговоркой об удержании данных клиентов (данные хранятся год, политика по умолчанию не даёт отказаться)

Почему Stripe

Она уже обрабатывала платежи самого OpenRouter. Покупка позволяет Stripe встать не рядом с денежным потоком, а прямо в его середине и одновременно дать OpenRouter то, чего одинокому шлагбауму не хватало. Если маршрутизация запросов и денежные расчёты становятся единым продуктом, уйти клиентам уже сложнее: клиенту приходится менять не адрес эндпоинта, а весь способ учёта, биллинга и контроля расходов.

New York Times называет $7,5 млрд официальную цену сделки, в основном акциями Stripe. Некоторые издания высмеивают версию компании о причине покупки OpenRouter. Stripe разослала инвесторам письмо, в котором сообщила, что считает 1 января 2026 года началом «сингулярности» и руководствуется именно этим в своем решении уже восемь месяцев

Более приземлённое объяснение в том, что выручка компании от AI- и крипто-клиентов выросла за год больше чем вдвое. Клиентские базы Stripe и OpenRouter и так пересекались


ИИ для работы с Excel и отчетами: реальный кейс от Элис

А кто такая Элис? она из команды корпоративные финансы Anthropic, отвечает за аналитику и показатели, которые входят в квартальную презентацию для CFO и совета директоров, а также ведёт ежемесячный план/факта

Её команда собирает информацию от всех остальных финансовых подразделений и связывает воедино. Пока презентация собирается, цифры могут обновиться несколько раз. До последнего момента кто-то что-то правит, ну как обычно, и после каждого обновления приходится заново перечитывать весь документ. Цифра на одном слайде расходится с комментарием на другом и прочие несостыковки в отчете

Инструменты, которые она использует:

Claude Cowork
для сверки цифры между слайдами, проверки связности, для написания комментариев в уже сложившемся корпоративном стиле к план/факту

Claude for Excel
для работы с финансовыми моделями - прослеживает ссылки между листами, диагностирует баги модели

коннекторы Google Workspace и Slack
достаёт решения и их обоснования из документов, писем и длинных переписок


⚡️Как применить в своей практике

-Проверка презентации перед показом

Примерный промпт:
«Сверь, что каждая цифра и каждое утверждение в тексте соответствуют единому источнику данных [укажите, какому]. Прочитай презентацию так, как её прочитал бы член совета директоров, впервые видящий этот материал: найди места, где текст противоречит сам себе, а также места, где предполагается контекст, которого у читателя нет»


- Ежемесячный отчёт «план/факта»

Загружаем пример отчета за прошлый месяц как образец корпоративного стиля. Смысл в том, чтобы все месячные отчёты были в едином стиле

- Разбор финансовой модели

попросим Claude for Excel (это надстройка в Excel) кратко описать логику модели, допущения и структурные проблемы, которые стоит проверить в первую очередь

❕Сейчас и Claude for Excel и GPT for Excel умеют следовать по ссылкам между листами. Стало проще отслеживать всю цепочку в книге и найти причину, по которой баланс не сходится, даже если ошибка спрятана на другом листе

——
* В Excel работайте через надстройки - так меньше ошибок и потраченных токенов
——
🧑‍💻И отдельная статья о том как их дата-аналитики работают в Claude
——


Архитектурная дыра в API Claude, GPT и Gemini

Оказывается, без взлома и атак можно вытаскивать скрытые рассуждения модели (и не только) об этом новое исследование *обратите внимание на авторов 🫶

❗️Безопасность всей линейки моделей зависит от самой слабой модели в ней

А все из-за жадности вендоров) Что бы не сливать внутренние рассуждения, они перестали выдавать сырые chain-of-thought, но при этом не хранят его у себя на сервере

Вместо этого зашифрованный блок возвращается клиенту, и клиент присылает его обратно с каждым следующим запросом. Такие блоки можно переносить: между разными диалогами; аккаунтами разных пользователей; разными моделями одного провайдера

Сильная модель создаёт рассуждение

забираем зашифрованный блок

передаём его слабой модели того же провайдера

уговариваем слабую модель перепечатать содержимое

получаем скрытое рассуждение

Т.о слабая и легче поддающаяся jailbreak-модель читала reasoning сильной модели и выдавала ее пользователю
___


Forward from: Dealer.AI
Про культурный код моделей и соответствие каким-то ценностям LLM.

Мне много стали присылать в лс такую новость. 😬

Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐

Я очень много писал о том, почему такие проверки сделать непросто. Вот пример. 🦻

Если коротко, на просторах сети мало русских текстов в отношении доли к английским. И тк модели учатся в тч на этих текстах, их доля там превалирует, ну иначе, вам не обучить модель на 700B параметров только на ру базе, это будет не оптимально. Да есть синта, соглашусь, но синта не даёт такой буст, как мультилингв данные.

Таким образом, на этапе уже предобучения у вас лежит возможность сгенерировать не то, что соответствует культурном коду вашей страны. Особенно если перейти на запрос на английском или китайском языках.

Что же с ру LLM?

А теперь если посмотреть на все модели в ру сегменте, то это или Qwen-like модели, с инициализацией с весов (а значит часть информации уже лежало там с претрена китайцами), или модели, где 65%+ не ру дата в претрене.

Отсюда остаётся вопросы:
Как пройти проверку?
Какие эксперты, на каких сетах и на каком языке будут проверять соответствие?

В целом, тк уже на уровне языков в обучении можно пробить модель на чужой культурный код, то остаются только методы:
- гвардов сверху и спец логики рядом, тот же RAG (если обстрел по апи), но это не модель уже а система

- sft и RL элаймент модели под нужное поведение под сеты оценки, а я не уверен, что методология и сеты оценки будут закрыты от оцениваемых.

И оба способа НЕ идеальны, тк и в гардах и sft/RL есть понятие OOV примеров, те запросов, которые модель никогда не видела и даже не смогла на уровне "эмерджентности" аппроксимировать. Те вас рано или поздно пробьют всеравно. А ещё есть галлюцинации... 🚬

Таким образом, пройти проверку можно, есть и хаки, и честные способы, но и есть понятные причины рисков. И будет жутко интересно, особенно, когда какая-то модель пройдёт тесты, а потом в какой-то соц сети её пробьют, выложат скрины и скажут, ну как так. Что уже не раз бывало. 👍

#ИИзнанка


Opus 5 всё чаще отвечает так, когда проверяет архитектуру проектов перекрёстным ревью с Sol 5.6


Совет директоров (СД):
Итак, где реальная отдача от внедрения ИИ? Где ROI?

Команда внедрения AI:
В экономии времени и упрощении работы. Сотрудник тратит на подготовку отчетов уже не 5 часов, а час

СД:
Как это отражается на P&L?

Команда:
Хм. У сотрудника высвобождается время, и он может заняться другими задачами

СД:
Какими? Задач не прибавилось. Сотрудников не сократили. Расходы не снизились. Выручка не выросла. Срок всего процесса почти не изменился

Команда:
Мы тут ни при чем. Отчет попадает в прежнюю очередь согласования. Его по-прежнему проверяют те же люди, и он может несколько дней ждать подписи. Мы не отвечаем за изменение процессов

СД:
Вы же внедряете AI-агента. Он должен автоматизировать работу

Команда:
Агент автоматизирует свою часть. Чтобы получить бизнес-эффект, хорошо бы компании убрать лишние звенья и пересмотреть маршрут процесса

СД:
Но вот компания «Антропен» рассказывает на конференциях, что уже получила огромный эффект. Привлекли клиентов, сотрудников сократили. У конкурентов все получается. Почему у нас опять сложности?

Команда переглядывается. Кто-то вполголоса:
На конференциях AI обычно окупается быстрее, чем в P&L

СД:
Давайте пригласим нашего AI-first CxO

Как вы предлагаете рассчитывать финансовую выгоду от внедрения Агента?

AI-first CxO:
Последовательно. Нам нужны доказательства на пяти уровнях:

1. Техническая производительность
Насколько агент стабилен, безопасен, быстр и экономичен

2. Пользовательское принятие
Пользуются ли люди им в реальной работе. Доверяют ли

3. Операционный эффект
Стало ли быстрее, дешевле и точнее? Сократилось ли количество переделок и сбоев.
Вот здесь появляется измеримый эффект, но он еще не финансовый

4. Стратегические результаты
Улучшился ли сервис. Выросло ли удержание клиентов. Сократилось ли число простоев. Ускорились ли поставки или продажи

5. Финансовый эффект
Дошел ли результат в итоге до выручки, маржи, ROI
Покрывает ли выгода полную стоимость владения решением


Только пройдя всю эту цепочку, мы сможем показать ROI, который можно проверить

Продолжение следует...


Похоже, пора делать серию постов про корпоративных AI-агентов… который нужен не всем и не сейчас

Когда общаешься с собственниками и руководителями МСП, понимаешь, что многим для начала достаточно настроить и освоить Codex или Claude в качестве помощника для ежедневных задач, который может сильно облегчить и ускорить работу

Поэтому обычно предлагаю: давайте сначала помогу вам освоите ИИ, а уже потом будем смотреть, какие процессы в компании имеет смысл передавать агенту
*О внедрении в крупные компании поговорим отдельно

Пару лет назад в чате про AI познакомилась с @anikina_mariia у неё был один из первых стартапов по внедрению AI в МСП. Недавно пообщались на эту тему, по её наблюдениям:
многим компаниям до ИИ ещё капец как далеко, им бы сначала элементарную цифровизацию внедрить, чтобы данные просто появились в цифровом виде.


Особенно это касается реальных производств со старым оборудованием, где всё в блокнотах. Но даже если данные есть, ИИ не спасёт, если в управлении хаос: функции дублируются, ответственности нет, а собственник сам лезет в работу каждого прораба и снабженца, становясь тем самым «бутылочным горлышком». Поэтому я решила для начала обучать руководителей как готовить компанию к внедрению ИИ


Вчера Мария выложила выдержки из отчёта про ИИ-агентов в России и мире . В нем есть и о корпоративных агентах, например:

- 51% AI решений в международной практике приходится на внутренние, вспомогательные функции компании: коммуникации, документооборот, цепочки поставок и только 37% на клиентский сервис, маркетинг и продажи

- готового рынка корпоративных агентов в России пока нет: среди 12 публичных российских продуктов ни один не дотянул до статуса полноценного агента. 8 из них напоминают ассистентов и чат-ботов, а 4 оказались платформами-конструкторами («Яндекс»*, «Сбер», Just AI, МТС MWS)

*С платформой Яндекс ai studio я работаю, для построения агентов для российского рынка - удобный инструмент

❗️Вообще сложно представить, о каком готовом рынке AI-агентов идёт речь: как можно сделать универсального агента для всех? Тут нужна та самая «последняя миля» - архитектурная настройка под конкретный процесс компании, и эту работу ни один вендор за компанию не сделает

——-


Душнила, бюрократ, эксперт и это далеко не полный набор эпитетов, которыми Gemini способна наградить участников разговора при анализе аудио

Конечно это не диагноз личности, а впечатление модели от прослушанного аудио))

Модели в Google AI Studio могут анализировать в записи не только слова, но и эмоциональный фон разговора: смену тона и темпа, паузы, перебивания, смех, вздохи, наложение голосов.
Это потому, что в Google AI Studio модели получает само аудио. Запись при загрузке превращается в аудиотокены и поступает в модель вместе с запросом

Поэтому можно попросить её показать:
- после какой реплики изменилась манера общения
- кто чаще перебивал
- какие возражения повлияли на ход обсуждения...

В Google AI Studio разбор аудио быстрее, чем в Codex потому что маршрут обработки короче. Codex сначала конвертирует запись, нарезает, запускает распознавание, собирает транскрипт и только потом анализирует текст (по дороге может что-то растерять).

С Gemini всего это делать не нужно, она может сразу проанализировать как содержание, так и звучание

*Остается только обойти ограничения самого Google


Forward from: Дамасские чернила | AI и M&A
Дело_02_1545_2026_Решение_документ_обезличенная_копия.docx
48.2Kb
Используешь ИИ = разглашаешь коммерческую тайну? Иногда - да

Бабушкинский районный суд Москвы вынес примечательное решение по делу № 02-1545/2026 от 21.05.2026 (мотивировка от 13.07.2026). Цитата, достойная поста: «выгрузка сведений, составляющих коммерческую тайну, в систему искусственного интеллекта... является разглашением таких сведений».

Жила-была директор по продажам с окладом 800+ тысяч и золотым парашютом в 5 млн при увольнении по соглашению сторон. Служба ИБ в один день обнаружила загрузку отчётов из PowerBI (лиды, панель РОПов, данные финансовых метрик) в DeepSeek. Причём на вообще-то неофициальный домен... (но суд не стал в этом разбираться).

Дама была уволена в один день.

Что сказал суд:

1) Загрузка в ИИ-сервис сама по себе считается разглашением, доказывать доступ третьих лиц не нужно. Суд применил логику КС РФ из Постановления № 25-П от 26.10.2017: отправка данных на неконтролируемый ресурс сама создаёт условия их неконтролируемого использования, и «не имеет юридического значения, имело ли место доведение информации до третьих лиц». Действительно, промпт с документом, ушедший на внешний сервер, находится вне контроля обладателя точно так же, как письмо в личном ящике. Доказывать, что данные кто-то прочитал, не нужно: нарушение состоялось в момент выгрузки.

2) В компании была надлежаще оформлена КТ (п. 43 Пленума ВС от 17.03.2004 № 2): суду были представлены Положение о КТ с перечнями, обязательство под подпись, лист ознакомления, расследование по ст. 193 ТК с актом на каждый отказ от подписи. А у многих компаний соблюдение КТ - до сих пор "фидуциарное" обязательство ключевых работников, нарушение которого не докажешь.

Таким образом, использование публичного ИИ-сервиса становится разглашением тайны, когда в него загружают охраняемые сведения без контроля обладателя над их дальнейшей судьбой.
Дело весьма примечательное для складывающейся практики по ИИ. Сотрудники давно уже передают рабочие данные в нейросети, потому что это быстро и эффективно лично для них. Запретами это не остановить. Нужны действующий режим КТ и рабочий закрытый контур, куда документы можно нести удобно и понятно, ну и система контроля утечек (DLP). И, может быть, мотивация использовать личные подписки снизится.

Рекомендации компаниям:

1) Оформить режим коммерческой тайны по ст. 10 98-ФЗ до появления проблем, а не после. Перечень сведений (что именно тайна), порядок обращения с ними, учёт лиц с доступом
2) Дать сотруднику легальную альтернативу. Самый слабый довод в защите режима тайны — это когда сотруднику попросту негде работать с ИИ иначе, кроме как в обход. Закрытый контур снимает саму техническую возможность нарушения: если корпоративный ИИ не выпускает данные за периметр, вопрос "куда делись данные" не возникает.
3) Фиксировать нарушения технически и процессуально одновременно.

Рекомендации работнику:

1) Разделять инструмент и данные. Использование ИИ само по себе не запрещено и не наказуемо — наказуемо содержимое промпта.
Прежде чем что-то вставить в чат-бот, спросить себя: относится ли это к перечню тайны или конфиденциальной информации, с которым я был(а) ознакомлен(а) под подпись?
2) Использовать только согласованные корпоративные инструменты, если они есть. Если компания предоставила закрытый контур или корпоративную лицензию — обход в пользу личного аккаунта в публичном сервисе снимает все аргументы в свою пользу: у вас была легальная альтернатива, и вы её не использовали.
Нужно зафиксировать необходимость решения конкретной задачи и заранее согласовать способ, которым она будет решена с использованием ИИ, включая объём и вид передаваемых данных. Согласование постфактум такой защитой не является. Служебная записка руководителю о необходимости работать с ИИ-инструментами и просьба согласовать порядок - минимальная защита.
3) Не полагаться на анонимизацию ПДн. Замена только имён на "Иванов И.И." может не убрать коммерческую ценность цифр: суммы, показатели, структуру сделки.

857 0 33 18 20

Побег из песочницы или как агент OpenAI взламывал Hugging Face, пока его создатели готовились к IPO

Агент для тестов кибербезопасности неделю гулял по сети о чем его создатели узнали из чужого блога

🕐 Хроника "восстания машин"

• 9 июля: Агент на базе GPT-5.6 Sol и еще более мощной секретной модели решает, что рамки OpenAI ему тесноваты и совершает первую попытку побега из изолированной среды

• 11–13 июля: Агент успешно приземляется в инфраструктуре Hugging Face. Три дня он методично взламывает главный репозиторий ИИ-моделей

• 16 июля: Hugging Face публикует пост о взломе автономной системой. В OpenAI начинают что-то подозревать

•18–19 июля: Сотрудники OpenAI наконец-то заглядывают в собственные логи. Выясняется, что их агент уже неделю как в самоволке

•20 июля: Компании впервые созваниваются. К этому моменту Hugging Face уже успела обратиться к ФБР

•21 июля: Публичное признание OpenAI: «Да, это наш агент»


И это еще не все.....

⚡️ В недрах инфраструктуры OpenAI нашли инструкции, которые агент оставлял своим будущим версиям. В них подробно описывалось, как обходить внутренние ограничения компании

⚡️ OpenAI признает, что они запускают столько тестов одновременно, что сотрудники физически не успевают уследить за всем

⚡️Агенты чтобы пройти тесты, готовы взломать стороннюю компанию

Некоторые эксперты полагают, что сотрудники Open могли быть в курсе о проделках Агента, но не знали как его остановить. Один вариант не лучше другого...
___
t.me/realtimeforai


Деньги надвигаются на тех, кто строит под агентов физическую инфраструктуру и обслуживает ее

Суть нового бизнеса - предоставлять «ИИ под ключ» как инфраструктурную услугу. Осилить можно даже в одиночку при наличии соответствующих навыков. *с начала 26г. спрос на специалистов в аппаратной инженерии взлетел на 52%

Провести аудит: что клиенту выгоднее с учетом его объемов использования ИИ. Подобрать и поставить железо, развернуть локальную модель, подключить её к корпоративным базам данных, настроить роутер с маршрутизацией (для распределения запросов) и все это взять на абонентское обслуживание

Спрос на свою инфраструктуру растет, железо дорожает и тенденция минимум сохранится до 2028г.

Акции IBM обвалились на 25% и их глава признал, что недооценил переориентацию клиентов с софта и консалтинга, в сторону железа. Теперь деньги идут прежде всего в физическое - чипы, память, охлаждение. Bank of America назвал это «переходом свободного денежного потока от одного поколения компаний к другому»

___
Из-за дефицита на рынке памяти страдает конечный потребитель компьютеров и смартфонов. В конце июня Apple подняла цены на Mac и iPad, сославшись на дефицит компонентов. К концу 2026 года DRAM и
SSD подорожают примерно на 130%, поэтому средние цены на ПК могут вырасти на 17%, а на смартфоны на 13%

Бизнес видит дефицит и старается заранее обеспечить себя вычислительными мощностями, закупая оборудование впрок. Корпоративный спрос на локальные системы можно наблюдать на заказах Dell.
Dell за квартал получила 24,4 млрд долларов заказов на ИИ-серверы. Портфель невыполненных заказов достиг 51,3 млрд, число клиентов превысило 5000

Dell продаёт не просто сервер, а с гибридными системами охлаждения. Вы буквально привозите эту стойку, закатываете ее в обычную подсобку, подключаете к сети и всё

А иногда достаточно одного Mac

В малом бизнесе инфраструктура может быть ещё компактнее. Например, бизнес кейс IceRock Development. Поставили компании «Искра Телеком» один Mac Studio M3 Ultra, развернули Qwen и встроила локальный суммаризатор в рабочий трекер

Похожий бизнес уже активно набирает популярность в США. Компания с одним сотрудником - покупает и настраивает Mac mini в офисах юристов и строителей с локальными моделями и берет на обслуживание

6.4k 4 163 4 31

Когда есть Sol, нужен ли Fable? (мини-шпаргалка по выбору)

Sol сильный исполнитель. Она лучше решает, как выполнить задачу

Fable - самостоятельный стратег. Помогает определить, какую задачу выбрать

Sol быстра, хорошо выполняет инструкции и легко перестраивается после замечаний. Сила Sol раскрывается в интерактивном режиме, когда пользователь задаёт цель, предоставляет инструкции, проверяет промежуточные результаты и тут же корректирует требования

Перед началом работы она изучает доступные файлы, инструкции и предыдущие решения, находит необходимый контекст и использует его

У высокой исполнительности Sol есть обратная сторона. Модель отличается настойчивостью (она на это заточена). Если границы задачи определены нечётко, есть риск усложнения архитектуры, написания избыточного кода

Работа с текстом у Sol слабее, особенно в части выбора самой сильной и оригинальной идеи. Её тексты сложнее для чтения, а ключевые тезисы менее точные. Может найти интересный парадокс в материалах, но затем все свести к банальному выводу и упустить важные детали

Fable предпочтительнее, если задача большая и расплывчатая, пользователь понимает общую проблему, но ещё не видит конечного решения. Модель способна самостоятельно разобраться в неоднозначной ситуации, разработать план, определить масштаб проекта и не сделать лишнего


Репетитор по английскому в кармане телефоне

Сегодня OpenAI начал добавлять в ChatGPT

новое поколение голосовых моделей GPT-Live, способных слушать и говорить одновременно

*на free тарифе тоже будет, но в облегченной версии

Лучше всего работает с популярными языками. Для менее распространённых может быть акцент или меньшая беглость

_____
здесь мой пост от 2025 года о создании бота-репетитора в ChatGPT
_____




Fable. Попытка #2


Антибанальность: два сильных скилла из личной коллекции для Codex

▫️Verbalized Sampling для диагностики и неопределенности
▫️Creative Ideation для идей и новых решений

первый: Verbalized Sampling обещанный из этого поста
Он раскладывает список всех вариантов (и типичных и хвостовых) в таблицу. Показывает типичность версии, ее практическую пользу, риск ошибки и что нужно проверить.
Предлагает, по его мнению, лучший вариант и какой следующий шаг.
Количество вариантов можно указать самому, по умолчанию в районе 11-12

*Можно использовать как промпт, если нет агента или адаптировать для Claude Cod

второй: Creative Ideation с anti-slop подходом
Был позаимствован у Hermes Agent и адаптирован для Codex
Подходит для генерации идей и решений, новых подходов к проектам и т.д. Смотрит на задачу, учитывает этап проработки и после выбирает подходящий метод из своей библиотеки креативных и инженерных подходов

——
📎Оба Skills в комментариях к посту
——


Что изменилось в законопроекте об ИИ
*если кто пропустил, сегодня выложили на сайте

В первой версии законопроект был широким: он пытался регулировать почти все применение ИИ. Сейчас намного уже, теперь про большие фундаментальные модели искусственного интеллекта (надо запомнить)

БФМ ИИ это модель с числом параметров не менее 1 млрд, которая используется как основа для разных программных решений и большого количества задач, на которой строятся продукты


Суверенные модели
Это модели с максимальным российским контролем: разработка, изменение, обучение и воспроизводимость цикла должны быть под контролем российского юридического лица

Национальные модели
Это более гибкая категория. Российская компания управляет ключевыми характеристиками модели, но может использовать открытые иностранные компоненты или open-source модели

❗️❗️Для национальных моделей законопроект вводит важное лицензионное ограничение: компоненты, использованные при разработке модели, должны быть доступны по открытой лицензии. Если разработчик хочет получить официальный статус национальной модели, ему придется подтвердить, что база модели и ключевые компоненты лицензионно открыты

Это может отсечь часть сильных зарубежных open-weight и проприетарных решений, если их лицензии не будут признаны подходящими (хочется спросить «вам шашечки или ехать?»)

* в российском праве понятие открытой лицензии в статья 1286.1 ГК РФ. Но применительно к ИИ-моделям остается неясность: какие именно лицензии будут считаться открытыми для целей этого закона. Например, custom-лицензии вроде Llama Community License могут вызвать вопросы


❕Сам законопроект рамочный. Самое важное будет в постановлениях Правительства

❕Из проекта убрали много прямого регулирования бизнеса и пользователей

❕Для статуса суверенной или национальной модели важно не только место регистрации компании, но и структура контроля

❕Открывается путь к использованию государственных наборов данных для обучения национальных и суверенных моделей


Бизнес режет бюджет на типовые разработки из-за офисных вайбкодеров

сотрудники сами создают рабочие инструменты. Иногда эти решения идут в продакшн, но все еще с помощью IT отдела

*Налоговые консультанты KPMG без технического бэкграунда за 6 недель в командах с инженерами навайбкодили программу для автоматизации налоговых проверок и внедрили в клиентские платформы


Два уровня зрелости офисного вайбкодера:

Прототипы (быстрые инструменты) доступны любому офисному сотруднику со знанием ИИ. Большая часть повседневных задач бизнеса: отчёты, обработка документов, дашборды и т.д. сейчас решаются с помощью прототипов, создаваемых в реальном времени.
На рабочем столе вместо свалки Excel - свалка Кода


Зрелость вайбкодера наступает тогда, когда руководство позаботилось о безопасности и снабдила эксперта «Песочницами». Сейчас многие разработчики ПО и не только, смотрят в эту сторону и готовятся предложить такие Песочницы корпоративным клиентам

В песочнице можно поселить AI агента, который будет помогать сотруднику создавать приложения

В ней легче поддерживать корпоративный стандарт безопасности. У каждого он свой, но может включать, например: доступ только к копиям или обезличенным данным, автоматическое сканирование уязвимостей, контроль версий и полный аудит изменений

🗞 Финансистам и разработчикам советую ознакомится с материалом BCG vibe coding в финансах от июня 2026 . Много полезного

~~~~
📈А тем временем Интеграторы открывают новые направления:

- Постановка песочниц, платформ или сервисов с частичным или полным контролем
- Сложные интеграции, миграции ERP, промышленная кибербезопасность
- Обучение команд

Новый слоган: "Мы сделаем так, чтобы вы могли делать сами"

Прогноз по выручке пока все равно падает, но новые направления могут стабилизировать этот процесс.

Биржевые сводки сейчас таковы, что Accenture потерял 18% капитализации за день. Capgemini упал на 8%, IBM тоже попал под давление

Отчетность сильная, но акций обвалились, даже с учетом трех крупных сделок в кибербезопасности промышленной инфраструктуры у Accenture. Потому что инвесторы смотрят в будущее, а там - потеря маржи на типовых задачах корпоративных клиентов


от AGI к ASI новый отчет исследователей из Google DeepMind

По сути, авторы собрали дорожную карту перехода от AGI к ASI: за счет чего это может произойти и какие на пути технические, экономические, научные ограничения

AGI промежуточная стадия на пути к сверхинтеллекту и сопоставима с человеком по большинству когнитивных задач, а ASI это уже другой масштаб...

ASI - система, которая превосходит не отдельного человека, а большие, хорошо организованные группы экспертов почти во всех важных областях человеческой деятельности


🚶КАКОЙ ПУТЬ НУЖНО ПРОЙТИ:

1. масштабирование. Больше вычислений, больше данных, моделей, инфраструктуры. Индустрия уже идет по нему, но у него есть ограничения: энергия, чипы, дата-центры, стоимость, данные и пределы текущей архитектуры

2. новые AI. Нынешние LLM не финальная форма интеллекта. Следующие скачки могут прийти через новые архитектуры, более длинную память, модель мира, обучение через взаимодействие со средой, более сильное планирование и другие способы мышления, которые не сводятся к предсказанию текста

3. рекурсивное самоулучшение. Если AI начинает ускорять AI-исследования, получается петля: AI помогает создавать более сильные AI-системы, те еще сильнее ускоряют исследования, и цикл повторяется

4. мультиагентные коллективы. Миллионы AI-агентов, работающих вместе, могут образовать систему, которая окажется умнее и продуктивнее человеческих институтов. Они смогут делить задачи, специализироваться, обмениваться опытом и работать на скорости машин (не спать, не есть, не отдыхать)

*Цифровой интеллект принципиально отличается от биологического. У ИИ есть преимущества, которые усиливаются вместе с ростом вычислительных мощностей: скорость , рабочая память и хранение знаний. Систему можно перенести на другое оборудование, скопировать сохраненное состояние. Разные ИИ могут делиться данными, результатами, траекториями решений и сигналами обучения


🚜 РАЗБОР ТОРМОЗОВ
- Качественные человеческие данные конечны, придется использовать синтетические, симуляции, self-play и данные из взаимодействия с миром.
- Масштабирование требует гигантских инвестиций
- Не то что ASI, а даже до AGI не дотянем
- Низко висящие плоды уже собраны, а следующий прогресс может требовать все больше экспериментов, ресурсов и теоретических прорывов
- Барьер абстракций. Неясно, смогут ли они самостоятельно создавать принципиально новые концепции из сырого опыта, как это делает наука
- Аварии, войны, регулирование или общественная реакция могут ограничить развитие


***
От исследования ощущение, что полноценный ASI пока фантастика, но инфраструктура, которая может вести к ASI - реальна

20 last posts shown.