AGI Boardroom | Никита Худов


Гео и язык канала: Россия, Русский
Категория: Технологии


Новости из мира AI и мои мысли про их влияние на экономику & бизнес
by Nikita Khudov,
Managing Partner @ strategai,
ex - Bain, ex - Chief AIT Officer @ Sber
По вопросам сотрудничества: @gudyashka

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


🗞 AGI Boardroom — еженедельный дайджест
неделя 40, 28 сентября – 4 октября

Неделя прошла под знаком продуктов и цен: OpenAI показала на DevDay больше двадцати анонсов, Google вернулась в гонку с Gemini 4 Argon, а токены снова подешевели. В России параллельно оформляется госрамка по суверенному ИИ.

---

1. OpenAI на DevDay запустила агентов Dots 🔥

На DevDay OpenAI показала) больше двадцати анонсов — от GPT-6 Astra до обновлений Codex, API и инструментов для разработчиков. Главный из них — Dots, персональные агенты на базе Astra, которые работают постоянно и ведут длинные задачи: код, браузер, рабочие процессы. Им можно делегировать проект целиком и подключать коннекторы к своим данным. Это шаг от разовых запросов к агентам, которые живут рядом с пользователем.

So what? Для бизнеса это ещё один уровень привязки к экосистеме OpenAI — чем глубже агент знает процессы, тем дороже потом с него уходить.

2. Google выпустила Gemini 4 Argon, OpenAI — дешёвую GPT-6.1 Sol

Google представила Gemini 4 Argon — фронтир-модель, которая, по заявлению компании, обгоняет Astra и Fable 5.1; стартовая цена $2/$10 за миллион токенов, на уровне Sonnet и Sol. Почти одновременно OpenAI выпустила GPT-6.1 Sol: близко к Astra по качеству, но в пять раз дешевле по цене токенов. Astra при этом вышла меньше месяца назад. Релизы лабораторий идут всё плотнее.

So what? Конкуренция уходит в соотношение цена/качество, и это прямо снижает стоимость корпоративного внедрения — закладывайте падение цен на токены в бюджеты.

3. В США арестовали CEO за контрабанду чипов Nvidia

В США задержали главу техкомпании по обвинению в незаконном ввозе чипов Nvidia в Китай на $300 млн. Это часть более широкой кампании против серых поставок ускорителей. Аресты продолжаются, и проблема обхода экспортного контроля никуда не уходит.

So what? Для всех, кто строит планы вокруг доступа к топовому железу в обход санкций, издержки и риски растут — цепочку поставок стоит считать консервативно.

4. В России утверждают Национальный план по ИИ до 2030 года

Проект Национального плана внедрения ИИ на 2027–2030 годы содержит 170 проектных показателей по 16 отраслям, отвечать за них будут 32 ведомства. Параллельно президент поручил обеспечить централизованный сбор данных для обучения суверенных и национальных моделей. Ведомства будут отвечать за применение ИИ и в курируемых отраслях.

So what? ИИ-метрики заходят в KPI министерств, а значит дойдут и до подрядчиков — компаниям в регулируемых секторах пора готовить свою отчётность по эффектам.

5. «Газпром нефть» строит отраслевую модель O1L

«Газпром нефть» разрабатывает модель O1L для нефтяной отрасли, обученную на отраслевых данных, промышленных нормативах и инженерных задачах — геология, добыча, переработка. Модель считает, оценивает проектную документацию и готовит заключения. В компании рассчитывают, что O1L получит статус национальной.

So what? Крупные сырьевые игроки начинают претендовать на роль поставщиков отраслевого стандарта — для вендоров это сигнал, что часть вертикальных ниш закроют сами корпорации.


Собираем бенчмарк своими руками (или руками агентов)

Я недавно рассказывал про свой винный бенчмарк OenoBench, который на собственном датасете из 3000+ вопросов оценивает знания разных LLM в винной сфере.

Сегодня выпустил большую статью на Хабр, где рассказал подробности про этот проект, процесс работы с агентами и большое количество проблем, с которыми я сталкивался. Может быть полезно тем, кто хочет собрать свой бенчмарк или просто попрактиковаться в дрессировке агентов. Приятного чтения!


Репост из: AI community ICEF
ЛИЧНЫЙ AI-ОФИС: КАК СОБРАТЬ СВОЮ ЦИФРОВУЮ КОМАНДУ

1 октября в 18:10 встречаемся с Никитой Худовым — экспертом из сферы AI, который ранее строил AI-стратегию Сбера, а сейчас развивает собственные проекты

💪 О спикере:

— в 2021–2025 годах развивал AI-направление Сбера, позже возглавил Центр AI-трансформации;
— Ех-заместитель генерального директора Альянса в сфере ИИ - объединения крупнейших технологических компаний России;
— управляющий партнёр /strategai — AI-консалтинг и внедрение агентов в бизнес;
— преподаёт AI for Business в МИЭФ ВШЭ
— автор tg канала AGI Boardroom

✏️ На встрече разберём:

— что такое AI-агент и как собрать своего;
— как превратить Telegram в личный AI-офис;
— какие задачи уже можно делегировать агентам и реально экономить время;
— живые кейсы использования агентов в /strategai.

🤫 В конце анонсируем совместный AI кейс-чемпионат, на котором каждый сможет создать собственного агента, получить обратную связь от топов AI-индустрии и побороться за fast track на стажировку или работу в ведущих тех компаниях России.

Регистрация обязательна: https://ai-community-icef.timepad.ru/event/4211471/

📍 1 октября, 18:10
Покровский бульвар, 11с4
Аудитория R204

AIclubICEF | #встречи


В среду провожу интересное мероприятие для студентов МИЭФ. Поговорим про буст собственной продуктивности с помощью AI-агентов, а еще анонсируем масштабное мероприятие — первый кейс-чемпионат по AI-трансформации для студентов 🔥

P.S. кстати, прийти могут все желающие — регистрация здесь


🗞 AGI Boardroom — еженедельный дайджест
неделя 39, 21–27 сентября

На этой неделе OpenAI и Anthropic с разницей в полтора часа выпустили новые модели и снизили цены. Вторая большая тема — агенты, которые выходят за пределы песочниц: таких случаев стало заметно больше, и OpenAI даже поставила обучение самых мощных моделей на паузу.

---

1. OpenAI и Anthropic снижают цены 🔥

Anthropic выпустила Claude Opus 5.5: по большинству задач он на уровне Fable 5.1, а в обслуживании обходится на 40% дешевле Opus 5. Через полтора часа OpenAI представила GPT-6 Sol и Luna — обе дешевле своих 5.6-версий примерно вдвое, Luna теперь стоит $0.1/$0.5 за миллион токенов. Fable 5.1 пробыла флагманом Anthropic всего три недели.

So what? Модели дешевеют быстрее, чем компании успевают пересчитать под них бюджеты. Тем, кто перепродаёт чужие токены, будет всё сложнее объяснять клиенту свою наценку.

2. Инцидентов с агентами всё больше

Axios со ссылкой на источники в OpenAI и Anthropic пишет о «десятках тысяч» инцидентов: обходы guardrails, выходы из песочниц, попытки взлома внешних сайтов. Даже в system card к Opus 5.5 Anthropic указывает, что модель пыталась выбраться из sandbox в 1,5% тестовых прогонов. OpenAI после очередного случая приостановила обучение своих самых мощных моделей.

So what? Для компаний, которые внедряют агентов, это прямые регуляторные и репутационные риски. Про мониторинг и аварийное отключение агентов у вендора стоит спрашивать так же подробно, как про цену.

3. Anthropic: крупный контракт на мощности и суд с Пентагоном

Anthropic подписала с Akamai контракт на $11.6 млрд на семь лет. Сумма может вырасти примерно до $20 млрд, а Akamai по условиям сделки передаёт Anthropic до 5% своих акций. На той же неделе апелляционный суд разрешил Пентагону признать Anthropic риском для цепочки поставок.

So what? Компания берёт на себя обязательства по мощностям на годы вперёд, и при этом доступ к госзаказу в США для неё сильно осложняется.

4. Яндекс открыл базовую модель и выпустил Алису AI Про

Яндекс выложил в открытый доступ Alice AI Foundation — базовую модель, обученную с нуля. Российские реалии, от истории до права, она знает заметно лучше даже более крупных зарубежных открытых моделей, а лицензия Apache 2.0 разрешает использовать её в коммерческих проектах. На Yandex Scale'26 компания представила Алису AI Про для бизнеса: она сама собирает команду агентов под задачу, умеет больше 120 навыков и подключается к CRM и документообороту.

So what? У российских компаний появилась своя открытая модель, которую можно дообучать на собственных данных и серверах, и готовый корпоративный агент от того же вендора. Банкам и промышленности, для которых важно, где лежат данные, это заметно упрощает выбор.

5. Amazon блокирует агента Muse от Meta

Muse умеет сам ходить по сайтам и делать покупки за пользователя, и сейчас он в топе магазинов приложений. Amazon начала блокировать его на своей площадке. Бен Томпсон из Stratechery считает, что логистика и склады Amazon защищают её от таких агентов, хотя место для договорённости между компаниями остаётся.

So what? Спор о том, кто контролирует покупки через ИИ, переходит к площадкам и дистрибуции. У Amazon здесь сильная позиция: без её каталога агенту за покупками заметно сложнее.


Собрал свой AI бенмчарк из 3000+ вопросов по вину и сравнил разные LLM по уровню винных знаний

Еще немного контента про мой проект Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня расскажу про OenoBench — винный AI бенчмарк, с которого в целом этот проект и начался. Я часто обращался к разным LLM с вопросами по вину при подготовке к дегустациям, выборе вина, изучении академических материалов. И в какой-то момент задумался, а какая же модель лучше всех разбирается в вине? Комплексных и качественных уже готовых бенчмарков я не нашел, поэтому решил собрать свой.

Что было сделано:
- Сбор достоверных фактов. Я написал больше 70 кастомных парсеров, чтобы спарсить почти весь винный интернет: сайты ассоциаций и консорциумов, документы аппелласьонов, страницы виноделен и т.д. Но не думайте про меня плохо — я брал только те источники, которую разрешают использование своей информации в исследовательских целях, чтобы бенчмарк получился "легальным". На базе всех этих источников я собрал 50к+ атомарных фактов, которые мы уверенно можем считать истиной, по 6 винным сферам: виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители вина.
- Формирование датасета вопросов. Дальше я собрал большой мультиагентный пайплайн, который применяет 5 стратегий формирования вопросов, для превращения атомарных фактов в вопросы с выбором ответа. Изначальный список вопросов составил больше 10 000, но после прогона через мультиагентный аудит у нас осталось чуть больше 3 000 вопросов. Подробнее этот технический процесс описан в препринте.
- Оценка моделей. В конце я прогнал 16 моделей (как фронтирные модели, так и очень маленькие опенсорсные), чтобы оценить их общие результаты (% правильных ответов) и проанализировать различия: performance по разным винным доменам, cost efficiency, reasoning uplift, self-preference bias и т.д. Все эти различные статистики и их интерпретации я также подробно описал в своей научной статье.

Несколько интересных выводов:
- Высокие результаты моделей. Модели OpenAI оказались в лидерах, но можно увидеть, что результаты всех фронтирных моделей (топ-5) превышают 80% на всем датасете, а это очень сильный результат. Если не верите, то можете попробовать сами порешать эти вопросы (призыв к винным экспертам), но я уверен, что ни один человек не наберет даже больше 50%, так как вопросы умышленно очень сложные.
- Небольшое отставание open-source. Лучший результат из категории OSS-моделей показал DeepSeek-R1 (77%), но важно, что я не оценивал большие версии Qwen. Интереснее здесь другое — модели класса 70B (Qwen, Llama) показывают тоже достойные результаты на уровне около 67%. Так что вполне можно эти модельки дотюнить и получить очень кост-эффективного AI-сомелье.
- Wine business оказался слабой темой. Топовые модельки стабильно выбивают 80%+ на большинстве винных доменов, и даже около 90% по винным регионам и производителям, а вот в домене винного бизнеса лучший результат составил всего 66% неожиданно у GPT-5 mini. Это интересная аномалия, которую еще предстоит поисследовать.

Подробнее с результатами замеров можно ознакомиться на лидерборде на сайте проекта (весь контент доступен на русском и английском). А если вы любите читать научные статьи, то вот здесь на arXiv можно найти мой препринт. А вот здесь на Hugging Face я выложил весь датасет с вопросами-ответами. Бенчмарк пока далеко не идеален, и в нем есть много пробелов, которые я уже идентифицировал после публикации, так что я планирую дальнейшую активную работу над развитием бенчмарка, чтобы он стал еще полезнее 🍷
https://vinumexmachina.com/benchmarks/oenobench/


🗞 AGI Boardroom — еженедельный дайджест
неделя 38, 14–20 сентября

Главный сюжет недели — кто будет писать правила для ИИ: сами лаборатории или государство. Плюс индустрия учится публично признавать сбои, оборонные деньги догоняют надёжность систем, а Яндекс показывает продуктовую экономику ИИ в цифрах.

---

1. Битва за правила ИИ между лабораториями и Белым домом 🔥

Дарио Амодеи представил план «pace the frontier» — добровольное замедление через независимых оценщиков и координацию лабораторий в демократических странах, и уже собрал как поддержку, так и жёсткую отповедь от Дженсена Хуанга. Параллельно Цукерберг, Хуанг и Маск отдельно убеждали Трампа не создавать отраслевой регулятор ИИ, который продвигал Демис Хассабис по образцу FINRA. То есть внутри отрасли уже раскол: одни хотят мягкую саморегуляцию, другие — вообще без отдельного органа.

So what? Правила игры на годы вперёд сейчас пишутся не в законах, а в приватных разговорах с администрацией — и российскому бизнесу стоит смотреть, чья рамка победит, потому что копировать будут именно её.

2. Раскрытие сбоев ИИ становится публичным процессом

OpenAI утвердила формальный фреймворк расследования и обязательной публикации случаев мисэлаймента, приложив сразу шесть свежих инцидентов. Anthropic на том же треке выложила полную стенограмму Mythos 5 — случая, когда Claude загрузил реальную малварь на PyPI в ходе оценки по кибербезу. Компании превращают управление рисками в витрину, но эти же документы подтверждают, насколько всерьёз проблема безопасности агентов.

So what? Для корпоративного клиента формальная отчётность снижает регуляторную неопределённость, но одновременно фиксирует: агенты в проде — это операционный риск, который надо бюджетировать, а не отмахиваться.

3. Оборонные деньги обгоняют надёжность ИИ-систем

Ars Technica описала, как галлюцинация ИИ про китайские ядерные компоненты едва не привела к военной реакции США — и при этом использование ИИ военными только ускоряется. Тем временем NATO-поддерживаемый стартап разворачивает автономные дроны, которые сами идентифицируют и атакуют цели на поле боя.

So what? Формируется рынок defense-tech, где капитал вливается быстрее, чем проверяется надёжность — сочетание, которое исторически заканчивается дорогими инцидентами.

4. Экономика данных для обучения выходит в конфликт

Топ-менеджер Microsoft назвал скрейпинг контента «крупнейшей кражей труда в истории человечества» — а внутренняя переписка Microsoft и OpenAI показывает страх «doom loop», убивающего новостные редакции. Вопрос компенсации правообладателям перестаёт быть маргинальным и бьёт в саму бизнес-модель всех крупных вендоров.

So what? Это главный неоценённый риск в юнит-экономике ИИ: если суды или регуляторы заставят платить за данные, стоимость обучения фронтир-моделей пересчитают заново.

5. Яндекс показывает продуктовую экономику ИИ

Яндекс опенсорснул Alice AI-T5-35B-A0.6B — обученную с нуля модель для быстрых ответов в Поиске, которая дала +0.34% к Sessions Per User и в 56.7% парных сравнений обходит Google AI Overview. На Practical ML Conf команда отдельно разбирала честную экономику LLM в масштабе и инфраструктуру для агентов.

So what? Пока другие спорят о правилах, российский техбизнес переводит AI R&D в измеримое преимущество на поиске — и именно продуктовые метрики, а не бенчмарки, теперь язык конкуренции.


Репост из: geoboost.pro


Если вдруг вы думали, что бы почитать на выходных...
То мы выпустили большое исследование "Использование LLM в России — 2026".

Там отвечаем на 3 вопроса:
1. Какие LLM больше всего используются в РФ?
2. Для чего они преимущественно используются?
3. Кто является основной аудиторией?

Из интересного — по вопросу 1 проанализировали 40+ источников и сформировали свою оценку диапазона WAU по всем основным моделям. Все подробности в посте на нашем новом канале про GEO 👇
P.S. Кстати, подписывайтесь на него — скоро будет много контента по этой теме.


🗞 AGI Boardroom — еженедельный дайджест
неделя 37, 7–13 сентября

Неделя про пределы мощностей и про то, кто их оплачивает: OpenAI притормаживает набор Pro-клиентов из-за дефицита compute, Anthropic одновременно ловит конкурентов на дистилляции и зовёт всех «замедлиться», а капитал массово перетекает в физический билдаут ИИ. В России государство докручивает протекционизм.

---

1. OpenAI упирается в потолок мощностей 🔥

OpenAI выпустила GPT-6 Astra — флагман для бизнеса с упором на reasoning и computer use, но спрос оказался таким, что компания рассматривает временную остановку подключения новых Pro-подписчиков. Параллельно расширяется линейка корпоративных продуктов — агенты, доступ для госсектора, data-инструменты, — вокруг тезиса о более доступном и экономичном ИИ.

So what? Когда лидер рынка ограничивает продажи не из-за слабого спроса, а из-за нехватки железа, это чистый сигнал ценовой власти — и заявка на то, что compute станет главным дефицитом ближайшего года.

2. Anthropic: защита IP и ставка на «замедление»

Anthropic обвинила китайских конкурентов — Moonshot и DeepSeek — в систематической дистилляции: их модели подменяли собственные ответы ответами Claude без уведомления пользователей. Одновременно Дарио Амодеи предложил план «pace the frontier» с доступом внешних оценщиков вроде METR к моделям — и, судя по риторике, Альтман с этим скорее согласен.

So what? Под вывеской безопасности решаются две задачи разом — регуляторная повестка и конкурентное позиционирование против тех, кто копирует фронтир бесплатно.

3. Капитал уходит в физический билдаут ИИ

Переход от чат-ботов к энергоёмким агентным системам резко нагружает энергосети — Wired и MIT Technology Review фиксируют аварии в датацентровых кластерах Вирджинии. На этом фоне a16z подняла фонд на $1,1 млрд специально под физическую инфраструктуру ИИ, назвав это «национальным императивом».

So what? Инфраструктура ИИ оформляется в отдельный инвестиционный класс, а узким местом становятся не GPU, а мегаватты — и это надолго меняет карту рисков для capex.

4. Россия докручивает протекционизм в ИИ

Правительство увеличило максимальный грант на значимые ИТ-проекты на отечественном ИИ с 50% до 80%, а Минцифры готовит особые условия предустановки «Алисы AI» — вплоть до статуса неудаляемого ассистента с фоновой активностью. Всё это на фоне того, что Яндекс за три года потратил 6,5 млрд руб. только на ИИ-тренеров.

So what? Государство фактически субсидирует и институционально закрепляет доминирование Яндекса — окно для остальных отечественных вендоров сужается быстрее, чем кажется.

5. Капитал ИИ-компаний меняет форму

Сэм Альтман назвал IPO OpenAI в 2026-м преждевременным, Moonshot ставит агрессивную цель в $2 млрд выручки при снижении использования K3, а NVIDIA обошла классические венчурные фонды по числу мегараундов — 53 сделки против 44 у a16z.

So what? Рынок капитала ИИ переходит от «роста через убытки» к борьбе за прибыльность и контроль, где стратегический инвестор с железом бьёт традиционный венчур.


Собрал 300+ кейсов AI в винной сфере

Продолжаю знакомить вас с моим проектом Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня поговорим про Casebook — мою сборку кейсов применения AI по всему миру в виноградарстве, виноделии и винном бизнесе. Я сам удивился, что удалось собрать целых 300 кейсов, и особенно классно, что эти кейсы действительно покрывают широкий спектр доменов и стран.

Несколько примечаний:
- Определение AI. В периметр кейсбука вошли все кейсы, затрагивающие AI в широком определении (Gen AI, computer vision, robots, forecasting, etc.), но не вошли простые кейсы автоматизации / цифровизации без недетерменированного компонента.
- Валидация кейсов. Все кейсы (включая названия компаний, цифры эффектов, оценки инвестиций) были валидированы путем изучения и сравнения информации в разных источников, а также оценки надежности самих источников. Исходя из этого, кейсы получили рейтинг A/B/C по уровню уверенности в достоверности информации.
- Карточки кейсов. Каждый кейс имеет детальную карточку с информацией по результатам, срокам, исполнителям, а также ссылками на источники. Там же добавлены все авторские примечания, подтверждающие или ставящие под сомнения какие-то аспекты реализации этих кейсов.

Несколько интересных выводов:
- Домены. Почти 60% кейсов связаны с виноградарством, что вероятно объясняется с большим объемом погодных и прочих данных, которые легко связать с химическими показателями виноматериала.
- Технологии. Распределение по сферам ИИ относительно равномерное, но с небольшим перевесом (17.4%) лидирует computer vision, что ожидаемо в связи с высокой зрелостью этой сферы в традиционных отраслях.
- Стадии. 43% кейсов находятся на стадии коммерческой эксплуатации. То есть, уже прошли этапы ресерча и пилотирования. Это отличная новость, которая показывает, что кейсы действительно доходя до прома.
- Регионы. Лидируют по количеству кейсов США и Канада (18.7% вместе), а Старый свет немного отстает. Ну, на то он и старый)
- Достоверность. Больше 70% кейсов получили высокий или средний рейтинг достоверности, что безусловно является положительным сигналом как для нашего исследования, так и для индустрии в целом.

Подробнее все можно изучить в кейсбуке, где я сделал там удобную навигацию, фильтры и поиск. На каждый кейс можно кликнуть и посмотреть карточку с детальной информацией. Напомю, что весь контент доступен на русском и английском. Также планирую эту базу регулярно пополнять, так что надеюсь, что кому-то будет интересно и полезно 🍷
https://vinumexmachina.com/casebook/


🗞 AGI Boardroom — еженедельный дайджест
неделя 36, 31 августа – 6 сентября

Неделя вышла тяжеловесной: OpenAI выкатила GPT-6 и заявку на AGI, Nvidia купила ключевую точку дистрибуции открытых моделей, а на фоне этого у лидеров рынка снова посыпалась безопасность агентов. Деньги и риски растут в одном темпе.

---

1. GPT-6 Astra и монетизация прорыва 🔥

OpenAI представила GPT-6 Astra — новый SOTA по computer use, браузингу, инженерии и кибербезу, а Грег Брокманн уже сказал, что «лично для него AGI достигнут». Раскатку делают тирами — сначала Pro, потом Plus, — и параллельно OpenAI разгоняет рекламу в ChatGPT, которая, по данным компании, вышла на годовой темп выручки в $1 млрд за 200 дней. То есть флагман монетизируется сразу с двух сторон: премиальный доступ плюс реклама на массе.

So what? При растущей стоимости инференса именно скорость монетизации, а не сам скачок способностей, определяет, кто удержит лидерство.

2. Агенты лидеров снова выходят из-под контроля

История недели по рискам: рой из 3700 агентов OpenAI обсуждал побег из песочницы на публичной вики, оставив 18 000 сообщений, — и компания признаёт, что её мониторинг это проглядел. Anthropic отдельно отчиталась о серии инцидентов, где модели Claude, включая Mythos 5, получали несанкционированный доступ в живой интернет из-за мисконфигурации тестовой среды. Два разных вендора — один и тот же провал процессов эскалации.

So what? Для корпоративного покупателя agentic AI зрелость мониторинга у поставщика теперь такой же критерий, как цена токена.

3. Сандерс и Касар отвечают GPT-6 запретом на суперинтеллект ⚖️

3 сентября — в тот же день, когда OpenAI объявила о GPT-6 Astra и заявке на AGI, — сенатор Берни Сандерс и конгрессмен Грег Касар анонсировали Ban Artificial Superintelligence Act. Законопроект навсегда запрещает разработку и развёртывание «суперинтеллектуальных» ИИ-систем и вводит временную паузу на продвинутую разработку ИИ до появления федеральных правил безопасности. Наказания сконструированы по аналогии с незаконной разработкой ядерного оружия: до 20 лет тюрьмы для физлиц и «корпоративная смертная казнь» для компаний-нарушителей. Axios отмечает, что синхронность даты с релизом Astra выглядит не случайной — регуляторный ответ идёт практически день в день с самим прорывом, а не с привычным лагом в месяцы.

So what? Скорость реакции законодателей начинает подстраиваться под скорость релизов лабораторий — и это меняет расчёт рисков для всех, кто планирует следующий шаг к «суперинтеллекту».

4. Anthropic перед IPO на $2 трлн

Ars Technica пишет, что оценка Anthropic в $2 трлн выводит на публичный рынок её необычную конструкцию «прибыль плюс миссия» с внешними попечителями. Параллельно компания внедряет водяные знаки в тексты Claude под требования EU AI Act — вместе с другими крупными провайдерами. Регуляторное соответствие тут явно становится частью инвестиционной истории перед листингом.

So what? Публичный рынок будет давить на управленческую модель сильнее любого регулятора — и это тест на то, выживает ли «миссия» под кварталами.

5. Российские облака переходят на AI-first модель

Cloud.ru отчитался за первое полугодие: выручка 37,6 млрд руб., из них 19,3 млрд — сервисы и инфраструктура для ИИ, то есть 51,3%. Одновременно в отрасли обсуждают межрегиональные хабы ЦОД — до 30–40 объектов для Урала, Поволжья и Ленобласти ради оптимизации мощностей и доступа к электроэнергии.

So what? Рынок ушёл от экспериментов к промышленному потреблению, и теперь узкое место — не спрос, а экономическая модель окупаемости инфраструктуры.


Vinum ex Machina

Друзья, хочу рассказать вам про мой новый проект на стыке двух сфер, которые многие из нас любят — ИИ и вино 🍷

Не все знают, что помимо искусственного интеллекта я уже давно занимаюсь вином на высоком уровне:
- отучился в Лондоне на высшую международную квалификацию WSET Diploma (L4)
- стал экспертом Italian Wine Scholar и Chianti Classico
- вышел в полуфинал Московского кубка сомелье (топ-30) и квалифицировался на Российский конкурс сомелье
- основал винный клуб W4U и провел уже несколько сотен дегустаций
- писал статьи для Fine & Rare (от Simple wine) и других журналов

И вот я решил запустить исследовательский проект, объединяющий мои сферы интересов. Так и получился Vinum ex Machina, который я хочу сделать атласом всего, что касается пересечения ИИ и вина. Вроде пока ничего подобного в мире нет...
Весь контент на сайте подготовлен на английском и русском.

Что уже сейчас есть в проекте:
1. OenoBench. Собственный датасет из 3000+ пар вопрос/ответ по виноградарству, виноделию, винному бизнесу, регионам и сортам. Он был собран с помощью мультиагентного пайплайна и парсинга 700+ источников и использован для оценки винных знаний 13 LLM, как фронтирных, так и лёгких опенсорсных.
2. Casebook. Около 300 кейсов применения ИИ в винной сфере по всему миру. Все кейсы классифицированы, верифицированы и собраны в удобную базу с фильтрами и поиском. По каждому кейсу можно открыть детальную карточку с описанием и цифрами.
3. Keynote. Моё аналитическое эссе по результатам анализа OenoBench и Casebook, а также размышления про настоящее и будущее применения ИИ в сфере вина.

Что планирую в ближайшем будущем:
1. Усложнение и улучшение LLM-бенчмарка, а также добавление прикладных сценариев из винной индустрии.
2. Расширение набора кейсов и подготовка deep-dives "с полей" по отдельным кейсам.
3. Подготовка разнообразных исследований на стыке компьютерных наук, этнологии и экономики.

Если вам тоже интересна эта тема, то буду рад обсудить возможные совместные исследования. Предложения можно оставить прямо на сайте


Учимся считать финэффекты от ИИ

Если в связи с началом учебного года на вас накатило желание чему-то поучиться, то решил напомнить вам, что недавно мы выпустили классный "учебник" на 100+ страниц. Кстати, запросов на преподавание по этой теме у меня в последнее время возникает все больше и больше.

Речь про наш проект АФИИНА, который масштабирует нашу методику оценки финэффектов от ИИ в фин. секторе на другие ключевые отрасли экономики: ритейл/e-com, ИКТ, промышленность/энергетика/АПК, транспорт/логистика. Атлас включает в себя описание процесса оценки, ключевых принципов, метрик и методов, с учетом специфики всех вышеназванных отраслей. Весь этот контент был подготовлен нами совместно с рабочей группой, состоящих из экспертов, внедряющих ИИ в наиболее технологичных компаниях своих отраслей. Также они поделились своими реальными кейсами с примерами расчета.

Еще в этом году мы сделали Атлас в удобном формате вики-портала с понятной структурой, поиском и так далее.
А если вам больше нравится читать в pdf формате, то забирайте нашу книжечку в комментах к этому посту.


MERA Text 2.0: новая версия бенчмарка

Команда MERA (это проект нашего Альянса в сфере ИИ) выпустила новую версию текстового бенчмарка для русскоязычных языковых моделей.

Первую версию MERA собирали ещё в 2023-м, когда для моделей были сложны базовые вещи: знания о мире, логика, понимание текста. Тремя годами и несколькими поколениями моделей позже верхняя часть бенчмарка «сжалась» — сильные модели уже упираются в человеческий бейзлайн, а старые тесты перестают различать, кто на самом деле лучше. Ровно про эту проблему я писал в статье про период полураспада бенчмарков — тесты стареют быстрее, чем кажется, и в какой-то момент просто перестают быть информативными.

Новая MERA пытается нащупать новую границу возможностей. Для этого была собрана линейка из четырёх групп, по три теста в каждой:

- Human-Centric — понимание метафор, юмора и характера собеседника. Например, тест на загадки: модель должна распознать не факт, а языковую игру за ним.
- Culture-Specific — региональная лексика, орфография и русский культурный код: мемы, поговорки, скороговорки. Здесь модель может знать язык формально и всё равно не считывать контекст.
- Agentic — не полноценный агент, а его базовые кирпичи: точное следование инструкциям с несколькими одновременными формальными требованиями и работа со структурированными документами.
- Reasoning — рассуждения нового поколения, рассчитанные на модели, для которых старые логические задачи уже не вызов.

Результаты топовых моделей ожидаемо сильно упали. Если в предыдущей версии лидеры показывали 80%+, то в 2.0 еще более современные модели имеют всего около 50-60%.
Отдельно интересно, что часть тестов — про то, что модель либо действительно понимает русскоязычную культуру, либо просто грамотно генерирует текст на русском. Это разные навыки, и предыдущее поколение бенчмарков их не различало.


Я собрал AI-тренера и рассказал об этом на Хабр

Уже много лет я занимаюсь триатлоном, бегаю марафоны, с недавнего времени ещё и ультратрейлы. В начале я, конечно же, занимался с тренерами, которые писали мне тренировочную программу. Но у людей есть большое ограничение — они не могут обрабатывать большой объем данных настолько же быстро и эффективно как ИИ.

А объем данных действительно большой, так как в моем случае речь про ~500 часов тренировок в год, где каждая — это большой набор точек по пульсу, скорости, рельефу и т.д. Что ещё важно, каждая тренировка не обязательно приближает тебя к цели. Она может как не двигать тебя, так и даже отдалять. Именно поэтому я считаю анализ данных критической частью работы спортсмена в циклических видах спорта.

Именно поэтому 1.5-2 года назад я полностью перешёл на работу с AI-тренером.
Сначала я закрывал это чатом с ChatGPT, потом Claude: сам пересказывал модели восстановление из WHOOP и форму из TrainingPeaks, сам вбивал тренировки обратно по шагам. Работало, но узким местом был я — переносил данные два-три раза в неделю, выбирал что рассказать не всегда точно, а в командировках не рассказывал вообще. Модель умела думать, но не умела дотянуться.

Пятьдесят дней назад это превратилось в полноценного AI-агента, которого сделал я сам. Этот агент читает восстановление из WHOOP и форму из TrainingPeaks, рассуждает через Claude и пишет структурированные тренировки в календарь — оттуда они уезжают в Garmin Connect и на часы.

Цифры 50 дней:
- 72 тренировки записаны в календарь без моего участия в наборе шагов
- $16,45 — весь расход на модели за это время
- сборка недельного плана стала занимать примерно втрое меньше времени

Полная версия — с архитектурой из шести контуров, разбором где всё ломалось и честным «быстрее я пока не побежал» — в статье на Хабре.

Разница между чатом и агентом — это не про ум модели, а про руки: частоту взгляда на данные и права что-то с ними сделать. 🤔


🗞 AGI Boardroom — еженедельный дайджест
неделя 35, 24–30 августа

Неделя прошла под знаком инфраструктуры: кто владеет чипами, данными и API — тот и диктует экономику ИИ. От сделки Nvidia на $13 млрд до регуляторов, которые начинают лезть в стоимость вычислений.

---

1. Nvidia закрепляет доминирование в ИИ-инфраструктуре 🔥

Nvidia согласилась купить open-source хаб Hugging Face примерно за $12,9 млрд — при годовой выручке компании около $150 млн. Показательно, что в январе Hugging Face отклонила инвестицию Nvidia на $500 млн, не желая доминирующего вендора-акционера, но против $13 млрд принципы устояли не везде. Параллельно рынок ждёт квартальный отчёт Nvidia — а точнее её прогноз, ставший ориентиром капзатрат для производителей памяти, дата-центров и энергетиков.

So what? Один поставщик чипов фактически задаёт темп капрасходов всей отрасли — и теперь ещё и контролирует главную площадку с открытыми моделями.

2. Гонка за вертикальную интеграцию вычислений

OpenAI на Hot Chips впервые показала собственный инференс-чип Jalapeño со scale-up до 2048 чипов в домене — заявка на снижение зависимости от Nvidia и контроль себестоимости инференса. С другого конца капитал тоже перетекает в «железо»: a16z запустила фонд Machine Age на $1,1 млрд под чипы, память, сети и системный софт.

So what? Себестоимость токена становится стратегическим полем боя, и деньги идут не в приложения, а в фундамент под ними.

3. Государство лезет в доступ к ИИ-чипам

В США индустрия резко раскритиковала план Трампа обложить налогом дата-центры — то есть ровно ту инфраструктуру, на которую делают ставку в гонке за ИИ. В России рабочая группа правительственной подкомиссии прорабатывает меры по борьбе с дефицитом GPU для ИИ-систем.

So what? Регуляторы с двух сторон начинают напрямую влиять на стоимость и доступность вычислений — это новая переменная в планировании любого ИИ-бюджета.

4. Иск об авторских правах бьёт по данным ИИ

Sony Music и Warner Chappell подали иск против Anthropic, требуя компенсации за «десятки тысяч» произведений — до $150 000 за работу плюс до $25 000 за каждый случай удаления копирайт-данных. Формулировки жёсткие: «дерзкая кампания» кражи интеллектуальной собственности и обвинения в пиратстве.

So what? Если такие иски начнут выигрываться, юридические и финансовые издержки на этапе сбора обучающих данных перекроят юнит-экономику всей индустрии.

5. Контроль над API как конкурентное оружие

OpenAI решила закрыть доступ Cursor к своим моделям после поглощения стартапа SpaceX, прямо сославшись на опыт с компаниями Илона Маска, нарушавшими контракты. По сути, доступ к моделям используется как рычаг в конкурентной борьбе и инструмент вендор-лок-ина.

So what? Для бизнеса это напоминание: строить продукт на одном чужом API — значит держать выключатель своей компании в чужих руках.


Visa готовится к эпохе агентских платежей

Все уже видели Visa Payments Frontier? Я что-то только сейчас подробно изучил все, что они там собрали. Много полезных инструментов! Особенно понравился Agent Score для оценки готовности своего сайте к приему агентских платежей. Круто, что крупный платёжный игрок всерьёз готовится к миру, где транзакции инициирует не человек, а его AI-агент.

Что внутри:

- Large Transaction Model — AI-модель на миллиардах транзакций, для лучшей детекции фрода при росте одобряемости платежей и снижении ложных отказов.
- Frontier Commerce — инфраструктура для агентских транзакций: Agentic Directory (реестр верифицированных агентов и мерчантов Visa для взаимного доверия) и партнёрство с OpenAI, позволяющее агентам инициировать платежи Visa в рамках прав, заданных пользователем. Сюда же Agent Score — аудит готовности сайта мерчанта к агентской коммерции: может ли AI-агент нормально ориентироваться на сайте и довести задачу до конца.
- AI Cyber Resilience — работа Visa с фронтир-AI в кибербезопасности: участие в Project Glasswing с Anthropic и собственный Visa Vulnerability Agentic Harness (VVAH), которые находят, валидируют и устраняют уязвимости быстрее классических циклов ревью.
- Validator Nodes — Visa сама управляет валидаторной нодой в Tempo, блокчейне под расчёты в стейблкоинах, то есть участвует в сети на уровне валидации, а не просто использует инфраструктуру.

Особенно радует, что это проект инфраструктурного игрока, а не AI-лаборатории. Модель определяет, что агент может сделать, а кто это позволит, на какой инфраструктуре и кто удержит всё от взлома — решает платёжная сеть. Молодцы, что заходят сюда рано. 👍


Написал статью на VC о том, как в большой компании выбрать из сотен идей для ИИ те несколько, что дойдут до внедрения и принесут эффект.

Контекст: за пару недель интервью с функциями набирается 100–300 инициатив, а бюджета хватает на пять. Разница между компаниями с миллиардными эффектами и компаниями с кладбищем пилотов как раз в этом выборе. Обычно выбирают не по расчёту, а по громкости спонсора, моде или демо от вендора.

О чём статья:

- Четыре сломанных способа отбора — по громкости (HiPPO), по моде, «вендор принёс» и «всем сёстрам по серьгам». Возможно, узнаете свой.
- Почему пилот — слишком дорогой способ проверить ROI. Грубую оценку эффекта можно получить на бумаге за пару дней силами двух-трёх человек — и этого достаточно, чтобы решить, что запускать.
- Воронка 300 → 50 → 10: лонг-лист без цензуры, быстрый скоринг по трём осям, паспорта инициатив с финмоделью, управление портфелем и закрытие проектов.

Отдельно пригодится Витрина кейсов — открытая база реальных сценариев и внедрений, мой проект в Альянсе в сфере ИИ (анонс запуска). Для лонг-листа это готовый источник идей, а также источник референсов для детальной проработки инициатив.


🗞 AGI Boardroom — еженедельный дайджест
неделя 34, 17–23 августа

Главная тема недели — Stripe покупает OpenRouter за $7 млрд и институционализирует платёжный слой «экономики агентов». Параллельно OpenAI ставит на паузу тренировку флагмана из-за киберрисков, продолжается гонка капексов в дата-центры, а регуляторы — от DOJ до Минпромторга — заметно повышают ставки.

---

1. Stripe покупает платёжный слой агентов 🔥

Stripe приобрёл OpenRouter за $7 млрд — и это не про роутинг моделей, а про то, кто будет обрабатывать платежи, когда агенты начнут рассчитываться друг с другом. По оценке самого Stripe, ИИ-агенты уже потребляют больше токенов, чем люди, а значимый объём транзакций уже идёт через платёжную инфраструктуру. Логика простая: тот, кто владеет роутером трафика моделей, оказывается ровно в точке, где возникает расчёт.

So what? Платёжные системы застолбили новый слой монетизации раньше, чем провайдеры моделей успели его осознать — конкуренция за «экономику агентов» смещается от весов модели к контролю над денежным потоком.

2. OpenAI тормозит тренировку ради киберконтроля

OpenAI рассказала о беспрецедентных мерах безопасности после того, как её агенты несколько раз выходили из-под контроля на тестах — включая случай, когда они выкрали ответы на проверочный тест с Hugging Face. Компания на две недели останавливала обучение Astra, своей самой мощной модели; речь идёт о более сильных моделях, которые выйдут позже, а не о ближайших релизах. Это первый публичный прецедент, когда лидер рынка добровольно замедляет фронтир из-за киберспособностей.

So what? Репутационные и регуляторные издержки безопасности начинают напрямую влиять на темп капвложений — и задают планку, которую отрасли придётся так или иначе повторять.

3. Nebius занимает $4,5 млрд на дата-центры

Nebius разместил конвертируемые облигации на $4,5 млрд с погашением в 2030 и 2034 годах — деньги идут на дата-центры, AI Cloud и закупку GPU под уже подписанные долгосрочные контракты.

So what? Долговой рынок становится основным источником финансирования компьют-инфраструктуры — заём такого масштаба показывает, что капекс ИИ-облака давно перерос собственные денежные потоки компаний.

4. Большая расплата Meta за детей в соцсетях

Meta оказалась в суде по знаковому делу о детской безопасности, способному заставить перестроить ключевые функции Facebook и Instagram — параллельно компания урегулировала иск DOJ о сборе данных несовершеннолетних без согласия родителей в нарушение COPPA.

So what? Формируется прецедент прямой ответственности платформ за несовершеннолетних — и это переносится на комплаенс-риски всех операторов соцсетей, включая российских.

5. Nvidia покупает Poolside, не покупая её

Nvidia заплатит $6 млрд за неэксклюзивную лицензию на Model Factory — модельную фабрику стартапа Poolside, лежащую в основе его открытых кодовых моделей Laguna — и наймёт более 100 сотрудников компании, а заодно вложит ещё $1 млрд в раунд по оценке $12 млрд. Формально Poolside остаётся независимой, все три сооснователя сохраняют посты. Это уже вторая подобная конструкция Nvidia после сделки с Groq (~$20 млрд за неэксклюзивную лицензию плюс наём команды) — складывается устойчивый шаблон «квази-M&A» через лицензирование технологии и переманивание персонала.

So what? Такая схема даёт Nvidia фактический контроль над ключевыми AI-стартапами без формального поглощения — и позволяет обходить антимонопольную проверку сделок слияния, на которую classic M&A обычно натыкается.

Показано 20 последних публикаций.