Фильтр публикаций




На ЦИПР Сбер представил whitepaper «AI-Disrupt PDLC (Product Development Life Cycle): стратегия AI-трансформации бизнеса — от кода к намерению».

О чём документ:
Подход «AI как ассистент» исчерпан. Copilot поверх старых процессов даёт +10–15% производительности — и упирается в потолок. Чтобы выйти за него, нужно переосмыслить весь жизненный цикл разработки, а не докрутить ассистентов. Как собственно, и не в разработке.
Двухпетлевая модель. Intent Loop (люди формулируют намерение, ставят задачи, валидируют результат) и Implementation Loop (агенты автономно реализуют код по спецификации). Между ними — Integrated Development Platform, которая связывает оба контура.
Окружение важнее модели. В агентных системах ~98% инженерной ценности — в детерминированной обвязке вокруг модели (harness), и лишь ~2% — в самой логике принятия решений. Модели меняются каждые несколько месяцев, а harness и корпоративный контекст становятся долгосрочным активом.
Context Engineering как критическая дисциплина: без качественного контекста агент рассуждает не так, как нужно организации. Shit in = shit out.
Tiny Teams. Переход от классических команд в 10–15 человек к компактным составам 4–5 специалистов, усиленных AI. К 2030 году так перестроятся до 80% организаций.
Человек — центр системы. Речь о трансформации и усилении роли, а не о замене. Главным дефицитным ресурсом становится намерение — способность понять клиента и суть задачи. Human-in-the-loop, еще никогда компетенции не были так важны.

Ссылки:
📁Годный разбор на Хабре
📁AI-native разработка: ключевые выводы
📁Полное руководство по внедрению искусственного интеллекта в производственный цикл цифровых компаний


Репост из: Синицын, бл🤬
https://www.mckinsey.com/capabilities/tech-and-ai/our-insights/the-ai-transformation-manifesto

Тут не абы кто, а сами МакКинси разродились манифестом на тему ИИ-трансформации. 12 пунктов, пересказывать не буду, почитайте сами

Главная идея в том, что сам ИИ не даёт преимущества, потому что доступен всем. Отличает способность быстро применять его к важным бизнес-задачам, перестраивать процессы, усиливать команды, работать с данными и доводить решения до масштаба.

Мне больше всего мил и люб третий пункт их манифеста: If the value you’re creating doesn’t move the business, you’re getting it wrong.

И это частая проблема бизнесов в кризис. В сытые времена можно экспериментировать широкими мазками. Это и хорошо, на самом деле, с одной стороны. Но с другой — часто расхолащивает ответственных лиц, которые в сложный период не могут пересобрать майндсет под ситуацию

Ну и пятый тож хорош: Every tech and AI transformation is a people transformation. Нужно менять состав команд, повышать плотность сильных специалистов и перераспределять роли, а не просто навешивать ИИ на старую оргструктуру.

Документ перекликается местами, кстати, с вайтпейпером Сбера, который они обнародовали на ЦИПРе. Это говорит о том, что все, в целом, смотрят в одну сторону и это хорошо

〰️〰️〰️〰️〰️〰️〰️
🔃 @boombah_in_da_house


Репост из: GoTech Innovation
Эффект Palantir: как FDE-модель стала новым стандартом в AI-стартапах

🧠 Forward Deployed Engineer (FDE) или инженер передового развертывания — это гибридная техническая роль, сочетающая разработку ПО, аналитику и работу с клиентами. Такие инженеры внедряются в команду заказчика, чтобы адаптировать и развернуть сложный продукт в реальных условиях. На данный момент эта роль прочно связана именно с AI-софтом и становится все популярнее в связи с быстрым ростом рынка ИИ. Мы в GoTech Innovation решили изучить данный феномен.

🔗 Интерес к модели вырос на фоне нескольких факторов:

— enterprise-компании испытывают сложности с внедрением AI: большинство организаций уже закупают AI-инструменты, но значительная часть проектов не доходит до финальной версии из-за проблем с данными, legacy-системами и отсутствия внутренних технических команд.

— AI-продукты всё чаще продаются через активное развертывание: вместо классической SaaS-модели компании предлагают инженеров, которые помогают внедрить решение внутри инфраструктуры клиента и адаптировать его под конкретные процессы.

— крупные enterprise-контракты позволяют быстро наращивать выручку: для многих стартапов несколько семизначных контрактов выглядят привлекательнее, чем масштабирование через тысячи небольших клиентов.

— рынок начинает копировать подход Palantir, пионера данного подхода: количество вакансий forward deployed engineers за последний год выросло в несколько раз, а сама модель стала частью go-to-market AI-стратегии во многих компаниях.

📍Но тут появляется основная проблема, т.к. Palantir работает в сегментах с высокой критичностью задач, высокой стоимостью ошибки, сложной регуляторной составляющей, большим количеством legacy-инфраструктуры, ограниченным числом очень крупных клиентов. При попытке воспроизвести эту модель в других категориях возникают ограничения:

— высокая доля кастомной разработки постепенно превращает продуктовую компанию в сервисный бизнес.
— если каждый кейс развертывания уникален, становится сложно создавать переиспользуемые софтверные активы и масштабировать продукт.
— рост начинает зависеть от количества инженеров и команд внедрения, а не от масштабируемости самого софта.
— enterprise-клиенты вне индустрий Palantir, чаще ожидают быстрый переход к генерации стоимости от продукта и стандартизированные внедрения, а не длительные совместные разработки.

⚠️Поэтому для многих AI-компаний ключевым вопросом становится не «как стать Palantir», а как использовать forward deployment для внедрений и одновременно превращать кастомную работу в повторяемый консистентный продукт.

Таким образом, Forward Deployed Engineering – это в действительности передовой метод интеграции ПО, ИИ и работы с заказчиком, позволяющий лучше слышать клиентов и решать их проблемы более точечно, но его интеграция требует внимательности к подходу и верной реализации, потому что простое копирование Palantir может стать губительным путем для стартапа или компании в долгосрочной перспективе.

Ссылка для подробного изучения темы: https://www.a16z.news/p/the-palantirization-of-everything


Репост из: Синицын, бл🤬
Давние мои читатели знают, что я в меру своих скромных сил сражаюсь с СДВГ и изучаю эту проблему с самых разных сторон (пост раз, пост два, пост три, пост четыре, пост пять). Тема вообще довольно стигматизированная, психиатры крайне неохотно в это лезут, а психологи щедро раздают диагнозы направо и налево, ну просто потому что могут и ответственности за это не несут. В результате чрезмерного потребления мусорного контента проявляются нарушения внимания и СДВГ каждый выставляет себе сам :) У меня же официальный диагноз с детства и я всю жизнь ощущаю на себе эти эффекты

В базе всей этой шляпы лежит повреждение дофаминергических путей (а не привычка в виде клипового мышления) и из-за этого постоянно активна DMN, которая в норме при сосредоточении выключается у нейротипичных людей. Очень трудно сосредоточиться, а мне, вообще-то, по работе нужно как раз обратное :)

Исследования подтверждают, что ритмичная ненавязчивая музыка помогает сосредоточиться, то есть напрямую влияет на количество дофамина в этих самых путях, активируется система вознаграждения и мотивация возрастает. Я это давно заметил по себе, но никак не мог подобрать музыку. Больше всего раздражало, что она меняется. Изменение темпа даже на несколько ударов прям бесит. Очень зашел эмбиент, но там дико не хватает ритмичного бита. А еще музыка должна быть абсолютно нераздражающей и, самое главное и очень важное, предсказуемой! Минимал техно — норм, но все-таки не то, оно резковато для прослушивания в течении прям многих часов в наушниках

Ну штош, спасение утопающих — дело рук самих утопающих. Сейчас у нас есть нейросети и они, под чутким присмотром психиатров, нагенерили многочасовые треки именно с тем самым нужным битом и фоном. Ну а я это все упаковал в удобное и принес вам

Итак, представляю вам DevopsRadio. Абсолютный минимализм :) Спокойный ритмичный фон для работы плюс возможность подмешать к нему шум. Я пока взял свои любимые: стук по механической клавиатуре и шум кафе

Бесплатно, без регистрации и смс. Пользуйтесь, пишите отзывы, баг-репорты и фича-реквесты :) Я пользуюсь сам с удовольствием. Если зайдет, то приложения для мобилок тоже сделаю

🔜 https://devopsradio.ru/

〰️〰️〰️〰️〰️〰️〰️
🗞 @boombah_in_da_house


Ускоряем ввод в 5 раз.

Я перестал печатать. Почти.
Около месяца назад поставил Whisper Flow (это AI-диктовщик на базе модели Whisper от OpenAI) и начал говорить вместо того, чтобы набирать текст. Очень хорошо понимает русскую речь, работает с пунктуацией, содержит различные пресеты стилей и трансформеров по хоткею.

Что по цифрам ?

Для сравнения, скорость печати:
25–40 слов/мин - средний пользователь
143 слова/мин - мировой рекорд печати

Мой результат - 162 слова/мин.🥇 🥇🥇
14 193 слова надиктовано.
Печатью - 7 часов.
Голосом - 1,5 часа.
Экономия - 6 часов.

И да, 56% из этого - промпты в AI. Это буквально разговор с инструментом.

Попробуйте, там много классных фич:
https://wisprflow.ai/r?SIR123




"Что бы что ?" версия 2.0

Когда в голове рождается очередная мега-идея крипто-ai-SaaS-B2B-решения, которое, ну точно взорвет рынок.
Прежде чем что то пилить, пройдите сначала вот этого рейд босса:
gstack
/office-hours

Он задаёт именно те вопросы, которые вы старательно избегаете, либо о них даже не думали. Спойлер: после такого разговора половина идей тихо испаряется, а оставшаяся половина наконец-то начинает выглядеть как что то реальное, а не слайд из питча в никуда.

Перевод описания навыка для ai-агента (почитайте, это интересно):
https://telegra.ph/office-hours-05-22


Сходил, послушал - рассказываю ключевое и немного от себя.

- Промты, RAG, fine-tuning
По отдельности мало эффективны. Берём все вместе + десятки-сотни тестовых юз кейсов, порог качества 90%+ as must.

- Борьба с галлюцинациями.
В демо разбирали агента службы доставки, который должен был выдавать промокод PROMO10 вместо возврата. Агент уверенно изобретал POKUPAY10, POKUPAY15, POKUPAY-2024 - что угодно, кроме нужного промокода. Опять же, решается "обвесом" и тестированием.

- Стоимость.
Нужно прям ХОРОШО спроектировать весь процесс и посчитать юнит экономику. Каждый запрос к внешней LLM (GigaChat, YandexGPT, Claude, ChatGPT) - это деньги. Без аккуратного расчёта стоимости одного диалога весь бюджет проекта рискует уехать в минус, а вся потенциальная польза от автоматизации помножится на ноль. Условные 100к диалогов в месяц по цене условных 5₽ за разговор - это уже 500к ₽ только за инференс.

- Метрики.
То ради чего бизнес вообще готов платить эти 500к ₽
Базовых клиентских метрик (AHT, FCR, CSI) недостаточно, для AI-агентов нужны свои:
Доля галлюцинаций
Точность следования сценарию
% успешных вызовов инструментов
Доля эскалаций на оператора
Стоимость диалога
Главное считать совокупный экономический эффект. Если среднее время обработки обращений падает с 30 минут до 5, а очередь рассасывается мгновенно (привет Аэрофлот, вы молодцы) - бизнес с радостью заплатит за тот самый инференс, ибо на другой чаше весов лояльность клиентов, удержание и снижение нагрузки.

- Облачный провайдер vs локальная LLM.
"Закупка токенов" - низкий порог входа, платишь по факту, но при масштабе экономика быстро становится тяжёлой, плюс зависимость от вендора и вопросы с приватностью данных (152 фз никто не отменял). Локальная модель (Qwen, Kimi, Llama и прочие опенсорс-варианты) - серьёзные капвложения в железо (одна A100 - несколько миллионов рублей, нужен инженер для поддержки), но при больших объёмах горизонт окупаемости становится вполне достижимым. Так же, данные остаются во внутреннем контуре, модельку можно бесконечно обучать на своих же данных, что для некоторых компаний must.

И т о г о
Любой AI-агент - это не "подключил и поехали", а полноценный продукт с метриками, тестами, юнит-экономикой и даже со своей инфраструктурой. Иначе вместо ускорения процессов и роста метрик, получишь красиво упакованную статью расходов.


Репост из: Фанат Сервиса
Как проверить ИИ-агента на галлюцинации перед запуском в клиентском сервисе

ИИ-агентами нынче никого не удивишь, я уже писал ранее, что внедряют их все от мало до велика. И это правильно. Но есть одно значимое НО, которое стоит учитывать, если вы стали на этот путь - ИИ-агент может звучать уверенно, но при этом нарушить регламент, выдумать правило, не учесть вводные клиента или пообещать то, что бизнес не готов выполнить.

21 мая в 11:00 targetai проведёт вебинар, где покажет, как в решать эту проблему до контакта агента с реальным клиентом: через сценарии, симуляции, критерии корректности, разбор ошибок, повторное тестирование и приемку по ПМИ.

Что будет:
• как заранее найти сценарии, где AI-агент может ошибиться
• почему проверки одного «правильного ответа» недостаточно
• как оценивать не только текст ответа, но и право агента так отвечать
• где агент должен задать уточняющий вопрос, обратиться к базе знаний или использовать интеграцию
• когда спорный случай нужно передавать оператору
• как в targetos запускаются симуляции и выявляются проблемные сценарии
• что означает «озеленение» симуляций и почему это не просто статус
• как ПМИ помогает перевести запуск AI-агента из субъективного обсуждения в управляемую приемку

Ещё на простом примере разберут как клиент просит отменить заказ и получить компенсацию, и как агент справляется со сценарием, когда нет ошибки со стороны продавца/магазина.

О компании targetai:
targetai - enterprise-платформа LLM-агентов для автоматизации клиентского сервиса. Мы помогаем не просто создать AI-агента, а подготовить его к реальной эксплуатации: настроить сценарии, проверить поведение, выявить отклонения, исправить логику и подтвердить готовность к запуску.


Если вы хотите быть в теме ИИ-трансформации вне зависимости от должности, посетить однозначно стоит.

Фанатам сервиса бесплатно, но надо зарегистрироваться по ссылке 👈🏻

#мероприятия


Идеальный скилл. Нет, не так. ПОТРЯСАЮЩИЙ, мы так долго ЖДАЛИ такого РЕШЕНИЯ!

ПОТРЯСАЮЩАЯ работа! Всем спасибо!

ВЕЛИКОЕ лежит здесь:
https://github.com/h1km4t1ll0/make-commits-great-again


Я люблю открывать для себя новые инструменты для Claude Code. Особенно когда за ними стоит реальное сообщество, а не очередной ProductHunt-хайп на три дня.

Вот пятёрка из моей подборки — отсортированная по звёздам на GitHub. Каждый заслуживает внимания.

— — —

🛠 1. everything-claude-code — 186 000 ⭐
github.com/affaan-m/everything-claude-code

Победитель хакатона Anthropic. 48 агентов, 183 скилла, 79 команд для Claude Code. Planner, architect, code-reviewer, security-reviewer — и ещё десятки.

Но главное — три настройки, которые стоит поставить сразу:

{
"model": "sonnet",
"env": {
"MAX_THINKING_TOKENS": "10000",
"CLAUDE_AUTOCOMPACT_PCT_OVERRIDE": "50"
}
}

Sonnet вместо Opus — минус 60% стоимости. Остальное — качество в длинных сессиях.

— — —

🛠 2. karpathy-skills — 135 000 ⭐
github.com/multica-ai/andrej-karpathy-skills

Один файл CLAUDE.md по наблюдениям Андрея Карпати о том, как LLM облажываются при кодинге.

Главная мысль, которую я оттуда забрал:

> "Don't tell it what to do, give it success criteria and watch it go."

Вместо «добавь валидацию» → «напиши тесты для невалидных входов, затем заставь их пройти». Простая перестройка — меняет всё.

— — —

🛠 3. gstack — 99 000 ⭐
github.com/garrytan/gstack

Личный тулкит президента Y Combinator Гарри Тана, выложенный в опенсорс. 23 slash-команды, каждая — роль в виртуальной команде.

/qa сам открывает браузер и кликает. /security делает OWASP + STRIDE аудит. /office-hours переосмысляет продукт до первой строки кода.

Тан говорит — за 60 дней выпустил 3 прод-сервиса параллельно с управлением YC.

— — —

🛠 4. GSD (Get Shit Done) — 63 000 ⭐
github.com/gsd-build/get-shit-done

Решает «context rot» — деградацию, когда долгий диалог с агентом превращается в кашу. Каждый план запускается в свежем окне на 200k токенов, оркестратор остаётся лёгким.


npx get-shit-done-cc@latest


Есть quick mode: /gsd-quick "Add dark mode toggle" — для задач без церемоний.

— — —

🛠 5. caveman — 62 000 ⭐
github.com/JuliusBrussee/caveman

Заставляет Claude отвечать как пещерный человек. Без артиклей, союзов и словесной вежливости. Режет ~65% токенов в исходящих.

«Why use many token when few token do trick»

Смешно — но на длинных сессиях с лимитом Pro работает.

— — —

"Пробуйте... экспериментируйте !"
(с) Огюст Гюсто, Рататуй


Совсем скоро, или, если верить нашим пророческим способностям, это уже кипит полным ходом: деньги перестанут быть той волшебной палочкой, которая всё решает.
Настоящая валюта будущего? доступ к моделям и вычислительным мощностям.

Там openrouter прикрыл лавочку для пользователей с российскими аккаунтами. Вопрос конечно решаем, переедем в Казахстан или Нидерланды (кто еще не переехал?), но факт остается фактом.

https://t.me/exploitex/33665


Репост из: Denis Sexy IT 🤖
Не отпускает меня как-то ожидание хтони, от того куда идет мир разработки софта

Сегодня в ИТ индустрии часто обсуждают АИ-навыки разработчиков, в контексте типа:

❔– а насколько инструмент Х ускоряет АИ-разработчика vs не-AI разработчика?
❔– а вот кто эту кучу слопа ревьювить будет, а?
❔– а вот пузырь лопнет и посмотрим как окупаться будут LLM эти ваши, сразу вспомните что кожаный выгоднее

Это же все временные разговоры как по мне – потому что многие участники упускают главную мысль – корпорации ЗАСТАВЯТ заадоптить АИ-кодинг агентов и как только корпорациям не оставят выбора, вот тогда реальная адаптация АИ-кодинг агентов и случится

И заставит не CEO, не АИ-упоротые, не уговоры, не корпоративная пропаганда – заставит старый добрый зеленый Бенджамин Франклин и его коллеги:

Вы же слышали, про Mythos от Anthropic? Если коротко, это не только хорошая кодинг модель, но и модель которая умеет взламывать софт (и чинить дыры соответственно) – подключаешь ее в Claude Code, и вот у тебя уже лучше кибер-оружие на сегодня (у OpenAI есть свой аналог – серия моделей Cyber)

Так вот, Anthropic и OpenAI уже сегодня не дают доступ к этим моделям людям с улицы – нужно пройти аудит компании, чтобы получить доступ – то есть, большинство читателей никогда не получат доступ к актуальным аналогам Mythos и gpt-cyber, так как помимо цены за токен, тупо не дадут куда деньги дать чтобы это все заработало

Это сильно усложнит жизнь китайским лабам – так как они тренируют модели генерируя датасеты из моделей американских лаб (Anthropic прямым текстом про воровство данных говорит) – не так важно как вы к этому относитесь, важно что из-за «доступа по спискам» к Mythos / gpt-5.5-cyber в опенсорсе аналог появится позже, скорее всего займет больше года, но Mythos в опенсорсе точно появится

И будет примерно так, в первый же месяц Mythos-модели в опенсорсе какие-то злоумышленники запустят рой своих агентов с этой моделью, и те начнут хакать автоматом всех кто не партер OpenAI или Anthropic – я на днях читал отчет Google по безопасности в интернете, они уже ловят сигналы таких агентских систем, которые тупо ходят по интернету и с LLM и занимаются хакингом

Как только, первая крупная компания достаточно сильно пострадает от какого-то вируса шифровальщика на всю корп-сеть, сразу окажется что АИ кодинг агенты массово адаптируемы и очень нужны, и вообще не предмет споров в IT-департаменте компании, а предмет выживания корпорации – такие вещи очень быстро адаптируют, так как бизнес не терпит убытков

В итоге, те кому доступ к Mythos/Cyber сериям моделей дали – получат доступ к агенту-защитнику который не только по умолчанию лучший кодинг агент, с лучшими тулами для разработки софта, но и лучший эксперт по IT-безопасности возможный на этой планете в момент времени

А все кто не в клубе, АИ-лицом не вышли, получат 24/7 атаки на свой софт – и побегут обращаться к OpenAI и Anthropic за помощью, помощью в которой могут и отказать – если ты, например, не союзник США, или не поддержал стратегические интересы США или в целом недостаточно богат, или недостаточно большой чтобы считаться корпорацией, конечно, системы похуже для таких клиентов тоже появятся

Короче, я уверен что основные деньги OpenAI-Anthropic еще даже не начали зарабатывать

Пузырь АИ или не пузырь, это не так важно, мне кажется важный этап это – кто и когда первая корпорация поляжет от АИ-агентской атаки – сразу с этого момента – руками написанный бекенд-софт теряет смысл

Не знаю как вы, а я жду АИ-хтони 😋


Эрозия доверия или LLM = шредер данных.

TL;DR

Нейросети ломаются на больших задачах, контекстное окно выходит из чата и начинаются галлюцинации и ад из потери данных. LLM aka шредер.

/Ave human-in-the-loop.


Любопытное исследование.
Microsoft ввели новый бенчмарк - DELEGATE-52, предназначенный для оценки надежности LLM при делегирование им сложных задач.

Исследование охватывает 52 профессиональные области, от программирования до кристаллографии, и моделирует длительные рабочие процессы, состоящие из последовательного редактирования документов. Ученые проверяют, способна ли нейросеть вернуть документ в исходное состояние после выполнения цепочки обратимых правок.

Было проверено 19 топовых моделей в 52 сценариях. И что мы имеем по итогу:
- топовые модели такие как GPT 5.4 , Opus 4.6 портят порядка 25% данных уже на 20 итерации.
- Попытка дать ИИ инструменты (агенты, доступ к коду и файлам) только ухудшила результат на 6%. Из за инструментов количество вводных данных увеличивается в 2-5 раз, что создает еще большую нагрузку на контекстное окно.
- единственная область где модели почти не ошибаются - Python. Если вы не пишите код, а, скажем, делаете отчеты, собираете аналитику, то у меня для вас плохие новости.

Чем длиннее история правок и чем больше объем документа, тем выше риск потери данных (потеря\галлюцинации). 50% - средняя деградация по всем протестированным моделям.

Без тщательной проверки изменений документы неизбежно придут в негодность. Нужен надзор белкового интеллекта, оно же - Human-in-the-loop.


Видео недоступно для предпросмотра
Смотреть в Telegram
Брикинг ньюз!

Anthropic запартнерились с SpaceX, что дало значительное увеличение вычислительной мощности.
А для нас:
-> х2 на пятичасовых лимитах
-> отмена ограничений лимита на пиковые часы
-> +50% к недельному лимиту (до 13 июля)

*Анимация краба Антропик как отдельный вид искусства.


На днях наткнулся на мысль Андрея Карпати - создателя Tesla Autopilot, один из фаундеров OpenAI, вообще один из главных людей в AI прямо сейчас:
Смотреть на LLM как на чатбот - это всё равно что смотреть на первые компьютеры как на калькуляторы. По его словам, LLM — это kernel процесс новой операционной системы. Оркестрирует задачи, управляет памятью, вызывает инструменты. Полноценная ОС, просто над железом не hardware, а интеллект.

Красиво звучит. Но красивые мысли про AI сейчас каждый день.

А вот вам отклик из реальности.
Мне нужен был дашборд - отслеживать расход токенов по проектам, видеть стоимость и в целом визуализация. Мне это важно, я мыслю образами.)
Сел. Объяснил что хочу. Получил готовый инструмент.
5 минут - 3$ - profit.
Чем LLM не OS?

p.s. ачивки 4 fun, чуть позднее допилю геймификацию )

Показано 17 последних публикаций.