Павленко внедряет ИИ


Гео и язык канала: Россия, Русский
Категория: не указана


Внедряю ИИ-агентов в разработку крупных компаний. Пилоты, метрики, грабли. Руководитель GenAI-направления в крупной авиакомпании. Персональный сайт: makeitbeta.ru

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
не указана
Статистика
Фильтр публикаций


Репост из: CodeCamp
Видео недоступно для предпросмотра
Смотреть в Telegram
Бен Аффлек оказался настоящим программистом — актёр, сыгравший Бэтмена, рассказал, что пишет код на Python, разбирается в свёрточных нейросетях и много работает с GPU.

В компьютеры он втянулся ещё в молодости, а позже из-за работы с визуальными эффектами начал разбираться и в машинном обучении. Сам Аффлек, правда, скромно говорит, что пишет «довольно дерьмовые скрипты на Python», в целом как и мы все.

А еще он, как оказалось, использовал свой статус знаменитости, чтобы получить приватный доступ к моделям Google и OpenAI.

Гений, плейбой, защитник Готэма, вайбкодер 🤔


Inco выпустила Splash – новый движок для локальных языковых моделей на Mac. В тесте разработчиков Qwen3.8-27B на коротких запросах генерирует примерно вдвое быстрее oMLX и втрое быстрее Ollama.

Решил проверить на своём Mac mini M4 Pro с 64 ГБ памяти. Прогнал одинаковые задания с контекстом 8K, 16K, 32K и дополнительно 128K. Как у Inco: medium и лимит 1024 токена.

У меня получились такие результаты:

• Splash генерировал быстрее Ollama: на 67% на 8K, на 69% на 16K, на 74% на 32K.
• На 128K Splash генерировал примерно в 2,8 раза быстрее Ollama. При первом чтении контекста 128K первый токен появился примерно через 38 минут у Ollama и 33 минуты у Splash.
• Проверил Pi на исправлениях кода со штатным бюджетом ответа. Оба варианта выполнили все три задания и прошли все 27 проверок. Вся цепочка со Splash заняла на 69% меньше времени.

У пакетов разное квантование; это сравнение готовых вариантов запуска.

Разбор и графики в блоге 🖥

Выводы делайте сами.


Репост из: Точки над ИИ
Видео недоступно для предпросмотра
Смотреть в Telegram
Лучшей рекламы WinRAR и представить невозможно


Видео недоступно для предпросмотра
Смотреть в Telegram
У моего Personal OS появилось приложение для спортзала 🏋‍♂️

Сегодня хочу поделиться интересным кейсом.

Помните, я недавно рассказывал про Personal OS? Это персональная база обо мне (спорт, здоровье, работа, хобби, и т. д.), с которой работает ИИ-агент. Я её настроил и начал пользоваться.

Один из разделов там про спорт. Я занимаюсь бодибилдингом в зале, поэтому попросил агента помочь мне с программой тренировок. А потом попробовал прямо во время занятий надиктовывать ему выполненные упражнения и подходы.

И это оказалось жутко неудобно. Сделал подход, сообщил вес и повторы, ждёшь ответ. Потом читаешь простыню текста, которая тебе в этот момент вообще не нужна. Ещё и таймер отдыха через чат нормально не включишь.

Хотелось просто нажать кнопку и приступить к следующему подходу.

Так появилась идея Body Bro, маленького нативного приложения для спортзала. Мы собрали его с Codex. Программу составляет мой агент в Personal OS и сохраняет в iCloud. Body Bro подтягивает этот файл на телефон, показывает упражнения, фиксирует подходы и ведёт отдых. Таймер виден в островке, записи сохраняются даже без интернета, а потом синхронизируются обратно.

После тренировки я могу открыть чат в Codex и обсудить результаты: что нравится, что неудобно, куда двигаться дальше, какую программу выбрать на следующий мезоцикл. Агент получает историю через тот же обмен.

Мне нравится идея развивать Personal OS такими маленькими приложениями. Общий контекст остаётся в одном месте. А для конкретной ситуации есть удобный интерфейс, который получает только относящиеся к нему данные и возвращает результат агенту. Для спортзала таким приложением стал Body Bro.


Видео недоступно для предпросмотра
Смотреть в Telegram
Арни снова отправляет робота в расплавленную сталь. Теперь настоящего.

Figure сняла прощальный ролик для своих роботов второго поколения, F.02. С Арнольдом Шварценеггером и отсылкой к финалу «Терминатора 2». По словам компании и съёмочной команды, роботов действительно расплавили на заводе в Финляндии.

Я посмотрел эту новость и, честно, обалдел. Понимаю, что это техника, но смотреть, как уничтожают человекоподобных роботов, всё равно как-то не по себе.

У Figure объяснение вполне деловое. Компания переходит на F.03, поддерживать старое поколение больше не имеет смысла. При списании нужно защитить собственные разработки, а ручная разборка заняла бы столько времени инженеров, что задержала бы выпуск F.04. Расплавили большинство F.02, несколько оставили в штаб-квартире. Из полученного металла делают сувениры. Подробности у Figure.

Я как раз недавно посмотрел первого «Терминатора». Возможно, видел его на VHS ещё в начале 90-х, но вообще ничего не помнил. Смотрел как новый фильм. Вторую часть помню хорошо, и тут, конечно, сразу вспоминается тот самый финал.

Причём идея расплавить роботов пришла от самого Арни. Потом он ещё и согласился участвовать в съёмках. Красиво замкнули историю.

Если смотреть глазами человека, который внедряет ИИ, мне здесь интересна и прозаичная сторона: что делать со старой системой, когда пришла новая? Кто будет её поддерживать, сколько времени это съест, как сохранить свои наработки? В ролике показали очень зрелищный ответ.

Всё это круто выглядит. Надеюсь, человечеству потом не аукнется, когда роботы достигнут суперинтеллекта и найдут это видео 😅 Возможно, отнесутся с пониманием и сами будут так списывать предыдущие поколения.




Привет, я Павел Павленко. Встраиваю ИИ-агентов в разработку в больших компаниях и считаю, что из этого вышло.

Сейчас руковожу направлением GenAI в IT-дочке крупной авиакомпании. Строю у нас AI SDLC, то есть агентов прямо в пайплайне разработки, от кода до автотестов. Запускаю пилоты ИИ-инструментов в командах и меряю, что они дали. Ещё спроектировал корпоративного ИИ-ассистента на внутренних данных компании и собрал ИИ-аватара. Он отработал на ЦИПР, потом про него писали СМИ.

До этого был в Lamoda Tech: вёл несколько команд разработки и первым запустил там пилот GitHub Copilot. В разработке с 2002 года.

Здесь рассказываю, как внедрение выглядит изнутри: как выбираем инструменты, как считаем эффект, где спотыкаемся и почему безопасники всегда против. Новости про ИИ тоже будут, но с моим мнением, приживётся это в корпорации или нет.

Если хотите так же у себя, могу помочь. Провожу воркшопы для команд разработки на вашем стеке и веду спринты внедрения с метриками. Подробности: makeitbeta.ru/consulting. Писать в личку: @region23.

LinkedIn: linkedin.com/in/region23


Самое недооценённое с DevDay: harness Codex открыт, и его можно встраивать к себе 🧩

Все обсуждают dots и новые модели. А мне как человеку, который внедряет AI SDLC в компаниях, интереснее другое. На DevDay OpenAI отдельно подчеркнула, что Codex, Work и dots работают на одном harness. Он лежит в open source, и теперь его можно запускать ещё и в их облаке.

Что такое harness. Это всё, что вокруг модели: агентный цикл, работа с контекстом, вызов тулов, песочница, апрувы человека, перенос работы между шагами. Код здесь: github.com/openai/codex

Почему это важно. Обвязка влияет на результат не меньше, чем модель. У OpenAI есть наглядный пример: на ARC-AGI-3 GPT-5.6 Sol вырос с 13.3% до 38.3% только за счёт сохранения reasoning и компакции контекста. Выходных токенов при этом стало в 6 раз меньше. Модель та же, обвязка другая, и результат втрое лучше и дешевле.

Как встроить, три уровня:
▫️ codex exec. Неинтерактивный запуск для скриптов и CI-джоб со структурированным выводом. Ревью MR, генерация тестов, разбор упавшего пайплайна прямо в CI.
▫️ Codex SDK. Запуск, продолжение и стриминг агентных задач из своего кода.
▫️ app-server. Для случаев, когда агент становится частью продукта: держит диалоги, стримит события, обрабатывает апрувы. UI, MCP-тулы и правила твои, агентный цикл их.

Главная мысль, под которой подпишусь: не надо загонять людей в очередной чат с ИИ. Агента нужно встраивать туда, где работа уже идёт: в дашборды, очереди, таск-борды. Перевёл задачу в Ready, и агент начал реализацию. Так и выглядит зрелый AI SDLC.

Кто уже так делает. GitHub и JetBrains встроили Codex в IDE, Cisco использует SDK в своём App Builder. В налоговом пилоте Thrive обработали 7000 деклараций и сократили время подготовки примерно на треть.

🔒 А что с закрытым контуром?
Открыт harness, а не модель. Но Codex умеет работать с кастомными провайдерами: в config.toml указываешь свой base_url и подключаешь внутренние Qwen или DeepSeek.

Нюанс, на котором спотыкаются многие: с февраля Codex говорит только на Responses API. «OpenAI-совместимость» в привычном смысле /chat/completions не подойдёт, и Codex будет стучаться в несуществующий маршрут. Нужен шлюз, который умеет новый формат.

У многих в контуре перед моделями как раз стоит LiteLLM, а он поддерживает Responses API. Выглядит как готовое решение: Codex смотрит в LiteLLM, LiteLLM в во внутренние open-source модели - всё внутри периметра. Скоро прогоню на реальных задачах и расскажу, что получилось.

Что это даёт: не нужно писать свой агентный рантайм. Песочница, апрувы, компакция контекста, MCP и стриминг событий уже есть, а codex exec встраивается прямо в CI.

Чего не стоит ждать: harness отлажен под модели OpenAI. На Qwen и DeepSeek качество tool calling и длинных сессий может просесть, поэтому мерить надо на своих задачах, а не верить на слово. И отключите встроенный веб-поиск, в закрытом контуре он ни к чему.

Даже если строите на другом стеке, как референсную архитектуру агентного рантайма это стоит изучить.

Кто уже подключал Codex к своим моделям через шлюз? Делитесь в комментах 👇


OpenAI DevDay 2026: что показали 🚀

Только что закончилась презентация, в ней больше 20 анонсов. Пробегусь по главному.

🔵 Dots. Это always-on агенты на GPT-6 Astra. У каждого свой облачный компьютер и браузер. Работает 24/7, учится на твоём фидбэке и подключается к 4000+ приложениям через плагины. Писать ему можно в ChatGPT, Slack и Teams, а можно просто позвонить голосом. Пока доступно на Pro и Business Premium. По-моему, самое прикольное из всего.

🧠 GPT-6.1 Sol. Почти уровень Astra в агентном кодинге и computer use, но в 5 раз дешевле. Кэшированный вход стоит $0.10 за 1M токенов.

⚡ Ultrafast. Премиум-режим скорости: до 300 токенов/с, до 8× быстрее в Codex и до 6× в API. Пока работает на Astra, в новом тарифе Pro 500 (лимиты ×25 от Plus) и в Enterprise.

🛠 Agents API. Тот же harness, на котором работают Codex и Dots, теперь можно встроить в свои продукты: мультиагентность, tool search, компакция контекста, а теперь ещё и computer use. Инфраструктуру держит OpenAI. Сам harness Codex лежит в open source (CLI, SDK, app-server), и теперь его можно запускать в облаке.

☁️ Codex в облаке. Закинул задачу и закрыл ноут: сессия не рвётся, следить за ней можно с любого устройства, включая телефон. К этому добавили переиспользуемые окружения для команды, обновлённый CLI с голосовым управлением и Codex Security Cloud, который сканирует репозитории на уязвимости и готовит фиксы.

🎯 Decisions API. Быстрые решения на модели Luna по заранее заданному набору ответов: классификация, роутинг, выбор следующего шага агента. Пока limited preview.

👥 ChatGPT Space. Рабочее пространство для команды, людей и агентов: общая база знаний, Pages (живые документы), скоро появятся совместные слайды. Плюс теперь можно звать @ChatGPT в Slack и Teams.

🔑 Sign in with ChatGPT. Лимиты своей подписки теперь можно официально тратить в сторонних инструментах: Devin, Notion, Vercel и ещё десятке партнёров. Для Plus и Pro.

🔌 Для разработчиков плагинов. Свои панели прямо в сайдбаре ChatGPT и поддержка MCP Events, чтобы плагины запускали автоматизации по событиям.

Ну и всем выдали ресет лимитов 🎉

Днём ещё будут сессии для офлайн-участников, самое интересное оттуда узнаем завтра. Полный рекап: openai.com/index/devday-2026-recap


Помните, как ждали презентации Apple? Готовились, собирались, смотрели в прямом эфире, потом неделю обсуждали.

Честно: сейчас это уже не торт. Одно обновление камеры за другим 🥱

Новый тренд — смотреть так, как когда-то смотрели Apple, но уже OpenAI и Anthropic. Именно там сейчас показывают то, что меняет нашу работу, а не только цвет корпуса.

📅 Сегодня, 20:00 МСК: OpenAI DevDay 2026


Видео недоступно для предпросмотра
Смотреть в Telegram
На выходных собирал себе Personal OS: одну базу контекста о моей жизни, с которой работает агент. Спорт, здоровье, машина, работа, календарь — всё в одном месте.

И родилась идея: записать на прогулке видео в свободной форме и поручить монтаж Claude Code. Весь контекст Personal OS у него уже есть, пусть сам решает, что показать.

Промпт был примерно такой:
Проанализируй два видео, сделай нарезку ключевых мыслей и смонтируй вертикальный ролик на 1–2 минуты: мой рассказ вперемешку с инфографикой, которая его дополняет.


Он сам расшифровал 6 минут речи, выбрал фрагменты, нарисовал перебивки и наложил субтитры. А после моих правок вырезал слова-паразиты, так что «короче» из ролика пропало 😄

Результат удивил. Давно хотел записывать такие видео, и теперь это настолько просто, что буду делать чаще.

Если зашло — ставьте 👍. И пишите в комментах, о чём рассказать подробнее: как собрать свою Personal OS или как Claude Code монтирует ролики.


Видео недоступно для предпросмотра
Смотреть в Telegram
Opus 5.5 это что-то невероятное, особенно в анимации. За последние несколько дней я сделал с ним уже десяток сногсшибательных роликов о продуктах и проектах. Вот последний, просто ради фана попросил сделать ролик используя контекст моего телеграм-канала:

make a dynamic 15-second motion graphics video that shows what an incredible motion designer
you are, like it's your showreel for a résumé. video about my telegram channel t.me/pavlenkodev. go all out.
dont use any my custom skills


Моушен-дизайнеры, как вам результат?


Репост из: Уставший техдир
Видео недоступно для предпросмотра
Смотреть в Telegram
История топовых AI-компаний в одном ролике

А ведь еще недавно, мысль, что нейронки будут выдавать качественную кинематографичную картинку у большинства скептиков вызывала смех


Канал сменил название. Был «Павленко про Dev & AI», стал «Павленко внедряет ИИ».

Причина простая. Каналов «про AI» тысячи: релизы, бенчмарки, пересказы твитов. Я этим не занимаюсь. Я внедряю ИИ в разработку внутри больших компаний: сначала в Lamoda, теперь в АФЛТ-Системс. Согласовываю с безопасниками, запускаю пилоты и смотрю, что вышло на самом деле, а не в презентации вендора.

Старое название говорило, о чём я пишу. Новое говорит, что я делаю.

Что здесь будет дальше: пилоты с цифрами до и после, агенты в CI/CD, разбор, где это ломается и почему. Новости тоже останутся, но с моей оценкой: что из этого заработает в корпорации, а что нет.


Яндекс выложил AliceAI-Foundation-80B-A3B-Base. Это первая суверенная модель полностью обученная с нуля.

Модель действительно обучена с нуля: свой корпус, свой токенизатор, ~18T токенов, лицензия Apache 2.0 без условий. 80B параметров, 3B активных на токен, контекст 262K. И вот это, по-моему, главная новость: предыдущий флагман Alice AI LLM 235B был инициализирован от Qwen. А тут впервые настоящая собственная база. Сами Яндекс называют её экспериментальной и обкатывают на ней архитектуру будущей рассуждающей модели для агентов Алисы AI.

Архитектура любопытная: три слоя линейного внимания Kimi Delta Attention на один слой обычного, MoE на 512 экспертов, из них 10 активных плюс один общий. Отсюда 262K контекста без взрыва KV-кэша.

Цифры. Сравнивали с базовыми Qwen3.5-35B-A3B, Nemotron-3-Super-120B и DeepSeek-V4-Flash. На русских фактах и экспертных знаниях отрыв большой: WikiWebFacts 86.5 против 62.4 у Qwen, право 49.6 против 27.9. На математике и коде паритет с Qwen того же размера: AIME ровно 96.7 у обеих. На английских знаниях проигрывает крупным: TriviaQA 79 против 89. Два самых сильных бенчмарка собственные яндексовские, но выложены с протоколом, перепроверить можно.

Относительно лидеров опенсорса это другая весовая категория: у Kimi K3 и GLM-5.3 десятки миллиардов активных параметров, тут три. В своём классе это уровень Qwen3.5 плюс русский. Догонят ли быстро, не думаю: разрыв сейчас в post-training и RL для агентов, а этого Яндекс пока не показал.

Кому смотреть: если продукт на русском и про знания, а не про код. Плюс Apache 2.0 закрывает вопрос про иностранные веса, который в госкомпаниях задают постоянно. Минус: 160 GB в bf16, запуск на 4 GPU, квантов пока нет, до чата нужен свой SFT.

huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base




Anthropic объединяет Cowork, Claude Design и обычный чат в одном интерфейсе — больше не нужно выбирать, куда нести задачу.

Ещё появились Claude Docs и Claude Slides, а Design теперь работает прямо в диалоге. Результат можно редактировать, показать по ссылке, презентовать из Claude или скачать в PDF/PowerPoint. Всё три — пока в бете на платных планах. Раскатка началась для Pro и Max, Free и Team подключат позже, а Enterprise предупредят минимум за 30 дней.

Очень логичный шаг. Всё чаще вижу, как приживаются «народные» интерфейсы для агентов — с тем же успехом в массы идёт и GPT Work.

Подробнее про релизы — [тут](https://claude.com/blog/cowork-is-now-claude).


Репост из: Data Secrets
Видео недоступно для предпросмотра
Смотреть в Telegram
AlphaXiv выпустили оркестратор, который может превратить любого агента в автономного исследователя

Проект занял 1 место в рейтинге GitHub пару дней назад.

https://github.com/alphaXiv/OpenResearch

По сути, это локальный воркспейс, который перепрошивает Claude Code, Open Code или Codex под R&D: чтение литературы, циклы предложения и проверки гипотез, запуски экспериментов и производство артефактов.

Интерфейс поддерживает параллельные эксперименты, то есть агенты могут запускать несколько проверок гипотез одновременно, а результаты хранятся в git-native дереве экспериментов с неизменяемыми архивами коммитов, что дает полную воспроизводимость.

Доступно для загрузки под любую ОС


Репост из: Machinelearning
⚡️ DeepSeek открыла веса V4.1-Flash

DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.

Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.

На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.


В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.

Каждому слою внимания заранее назначен один из трёх режимов:

🟢в полном слой считает свои ключи и значения сам;
🟢в режиме переиндексации берёт их у предыдущего слоя, но заново выбирает, на что смотреть;
🟢в режиме повторного использования не считает ничего - берёт и чужой кэш, и чужой выбор.

Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.

🟡Causal Encoder-Decoder

Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.

40 слоёв разделены пополам: 20 на энкодер, 20 - декодер. К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.

Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.

Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.


🟡Бенчмарки

На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.

На Terminal-Bench 2.1 - 90,6% (выше всех).

На AutomationBench - 54,8% против 50,3 у Opus 5.

А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.


Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.

Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.

Сообщество на Hugging Face уже сделало квантованные версии практически под всё.


📌Лицензирование: MIT License


🟡Блогпост
🟡Веса
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #MMLM #MoE #Deepseek


Репост из: Psy Eyes
Видео недоступно для предпросмотра
Смотреть в Telegram
Black Magic Design: выпустили DaVinci Resolve 21.1.

Наиболее интересное нововведение: работа с AI-ассистентами (Claude, Codex, ChatGPT). Встроенный MCP-сервер позволяет сэкономить время за счет устранения механической работы в проектах и создания новых инструментов/стилей.

Основные возможности:

— Автоматизация шаблонных действий: ужать 10 мин видео до 3 мин, основываясь на произнесённой речи; удалить фрагменты короче 1 сек; найти все фрагменты с конкретным маркером и переместить в другой проект; отрендерить видео в H.264/H.265; итд.
— Создание и изменение пользовательских LUT и DCTL (цветовых преобразований) на основе простого описания.
— Сохранение любимых рабочих процессов в виде сценариев, которые можно запускать по запросу.

Настройка:

МСР-сервер активен только в том случае, если одновременно запущены как DaVinci Resolve Studio, так и десктопная версия Claude или другого агента. Во Free версии Resolve этой фичи нет — нужна именно DaVinci Resolve Studio.

PS: осталось, чтобы генерилось видео прямо на таймлайне по описанию/раскадровке. Где-то я уже видел плагины на эту тему...

Сайт
YouTube

Показано 20 последних публикаций.