AI Dev Broadcast


Гео и язык канала: Россия, Русский
Категория: Технологии


Всё про разработку с использованием AI технологий
Наш канал про Android - @android_broadcast
Видео как работать с AI - abdev.by/broadcast_ai_plus

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


🧠 JetBrains выпустила Mellum2.1: открытую модель для своих агентов на своём железе

Это не готовая фича в IDE и не замена Claude или GPT, а модель для тех, кто собирает своих агентов или хочет держать код у себя. Внутри 12B MoE (2.5B активных), лицензия Apache 2.0. Новое дал RL: в миллионах sandbox'ов модель училась изучать репозиторий, править файлы и проверять изменения.

Сценарии от JetBrains:
👉 исполнитель в агентной системе: найти причину падающего теста, набросать фикс и проверить его
👉 быстрый sub-agent: под нагрузкой почти вдвое быстрее Qwen3.5-9B, а с MTP одиночный запрос быстрее в ~1,6 раза
👉 приватный self-hosted деплой
👉 общий ассистент, включая математику и reasoning

⚠️ Важно: сравнивают с моделями класса 9B. На SWE-bench Verified рост с 2 до 47, но Qwen3.5-9B выше (50). Цифры от JetBrains, про IDE и Junie в анонсе ничего.

На Hugging Face уже есть веса и GGUF для llama.cpp, Ollama и LM Studio, а MTP head для vLLM будет позже.

🔗 Анонс в блоге
🤗 Hugging Face

#AI #JetBrains #Mellum #LLM


🧠 Подписку Claude Max и Team теперь можно использовать не только в Claude Code

В Max и Team добавили ежемесячные кредиты на Claude API. Их можно тратить в своём коде и сторонних harness'ах, то есть везде, где работает API-ключ, и на любую модель, включая Haiku 5.5.

Сколько дают:
👉 Max 5x — $100 в месяц
👉 Max 20x — $200 в месяц
👉 Team — $20 за Standard seat и $100 за Premium seat, общий пул до $500

Покрываются Messages API, Batches API, Playground, Claude Managed Agents и Claude Agent SDK. claude -p тоже, но только с API-ключом из привязанной организации, а не при входе через подписку.

Забрать кредиты можно на claude.ai в Settings → Billing, привязав организацию из Claude Console. Подписке нужно минимум 7 дней, раскатывают постепенно.

⚠️ Важно: у Pro и Enterprise кредитов нет. Интерактивный Claude Code и extra usage они не покрывают, на следующий месяц не переносятся, а привязать можно только одну организацию.

🔗 Условия в Claude Help Center
🔗 Анонс в X

#AI #Claude #Anthropic


🧠 Наконец-то обновили самую лайтовую модель: вышла Claude Haiku 5.5

Главное здесь цена: $0,10 за 1M входных и $0,50 за 1M выходных токенов против $1 / $5 у Haiku 4.5, то есть в 10 раз дешевле. Но если промпт длиннее 100K токенов, цена уже $0,50 / $2,50, и выгода только двукратная.

Что ещё изменилось по сравнению с Haiku 4.5:
👉 Контекст вырос с 200K до 1M токенов
👉 В агентном кодинге на Terminal-Bench 4.0 у новой модели 39,2%, у старой было 0,0%
👉 Это самая быстрая модель Anthropic, и впервые у Haiku можно выбирать effort

Для сложного кодинга Anthropic сама советует Sonnet 5.5 или Opus 5.5. Haiku 5.5 нужна для саб-агентов, суммаризации, классификации и роутинга. Уже доступна в API.

По цене Haiku наконец-то дотянулась до дешёвых Flash-моделей, и под саб-агентов это ровно то, чего не хватало. Только помните про порог 100K и что все бенчи пока от самой Anthropic.

🔗 Анонс Anthropic

#AI #Claude #Anthropic


🛠 JetBrains Research: как ревьюить код, который написал AI-агент

Команда Human-AI eXperience из JetBrains и Лундский университет описали, каким должен быть инструмент для ревью AI-кода. Главная мысль: проблема не в диффе, а в доверии. Модель пишет каждую строку с одинаковой уверенностью, и непонятно, куда смотреть внимательнее. Поэтому предлагают три шага:
👉 Обзор всего изменения с пояснением агента, что и зачем он сделал
👉 Оценка рисков по файлам: правки в редко меняющемся коде рискованнее, а AI-судья подсвечивает проблемные места без учета истории файла
👉 Детальное чтение только рискованных фрагментов

Идеи собрали на воркшопах с 17 практиками, прототип оценили 43 разработчика. Забавно, что ещё 54 ответа на опрос отсеяли, потому что их написал AI 😂.

Мне нравится идея смотреть не на весь дифф, а туда, где агент мог ошибиться. Пока это прототип, но хочется увидеть такое в инструментах. Видно в JB готовят что-то интересное

🔗 Пост в блоге JetBrains Research
📄 Статья

#AI #CodeReview #JetBrains


🐱 GitHub выпустил ReviewBench — открытый бенчмарк для AI-ревьюеров кода

Проверяют на 219 PR из 187 open source репозиториев на 19 языках. Подбирали по распределению 103,9 млн реальных PR на GitHub, но мелких однофайловых правок взяли меньше. Эталонные находки собрали из комментариев людей, статических анализаторов и фронтир-моделей, разметили по критичности и категориям. Судит Claude Sonnet 5 по опубликованной рубрике, а сеньоры независимо перепроверили результаты и они совпали в 96,6% случаев.

Своего агента можно прогнать самому. Есть контейнер + и нужен свой ключ к модели для оценки.

Топ лидерборда:
🏆 Copilot Code Review — 40,1
🥈 Devin AI — 37,0
🥉 Qodo — 35,1

Бенчмарк от GitHub, и по классике первое место у Copilot от GitHub. Неожиданно 😁 Прогоны конкурентов делала сама команда, вендоры их не проверяли. Но интереснее другое: даже лидер находит только ~26% известных проблем. Так что живой ревьюер пока без работы не останется.

🔗 Анонс в блоге GitHub
🏆 Лидерборд
🐱 GitHub

#AI #CodeReview #GitHub


Репост из: Кирилл Розов
🐱 Релиз Maven MCP 1.0. Агент сам смотрит актуальные версии зависимостей и что в них поменялось

Буду очень признателен если поставите звездочку на репозитории, что поддержит меня и замотивирует дальнейшее развитие проекта


Одна из проблем при работе с Gradle-проектами через AI-агентов: они ничего не знают про актуальные версии зависимостей, что в них поменялось и насколько безопасно это подключать. Баги, CVE, сломанная совместимость с AGP или Kotlin. Версию модель берёт из обучающих данных, а потом это приходится перепроверять руками.

Готового решения, удовлеторяющее моим требованиям, не нашёл, поэтому сделал свой Maven MCP.

Это плагин для Claude Code, Grok Build, Cursor и Codex, а также есть возможность подключить как MCP в любой агент. Внутри один Python-сервер на стандартной библиотеке, без pip-зависимостей. Версии смотрит в репозиториях, которые объявлены в билде, а не только в Maven Central. Gradle сканирует через wrapper и runtime classpath, Maven читает pom.xml, version catalog тоже.

Что агент теперь может сделать сам:
👉 Узнать последняя стабильная версия, а не альфа с максимальным номером
👉 что изменилось между двумя версиями: AndroidX, AGP, GitHub releases, CHANGELOG
👉 CVE через OSV, включая путь до транзитивной уязвимости
👉 совместимость AGP, Gradle, JDK, Kotlin
👉 конфликты версий, лицензии, EOL у JDK, Kotlin, Gradle и Spring Boot
👉 нормальная запись в libs.versions.toml

Перед правкой зависимости хук проверяет координаты и насколько безопасно подключить его (через хуки в плагинах).

🐱 Исходники на GitHub

Ранее Maven MCP жил в другом GitHub репо, но к релизу 1.0 выделил его в отдельный репозиторий


#AI #Gradle #Maven #MCP


🧠 *Модель сделает сама. Ваша работа - принять результат и понять вывод*

Новый пост от Карпати про реальность разработчиков и всех кто работает с AI: модели забирают всё больше черновой работы, и время уходит на проверку результата. Сырой ответ читать тяжело. Карпати предлагает сменить формат выдачи для повышения удобства. Четыре ступени, каждая следующая разбирается легче.

*1. Текст по ASD-STE100*

Simplified Technical English, стандарт инструкций по обслуживанию самолётов. Актуальная версия на сегодня (январь 2025): 53 правила и словарь около 900 разрешённых слов. У слова одно значение и одна часть речи. Активный залог, простые времена, одна мысль на предложение. В инструкции до ~20 слов, в описании до ~25. Из синонимов в словаре остаётся одно слово: start, а begin / initiate / commence туда не входят.

Объясни этот diff на ASD-STE100

Получаем сухую спеку. Карпати часто просит менее строго «80% пути к ASD-STE100»: те же короткие фразы и один смысл на слово, словарь чуть свободнее.

*2. Схема*

Картинка быстрее слов. Просите диаграммы и визуализацию.
Нарисуй диаграмму: кто кого вызывает, где живёт состояние, какой край ломает поведение

*3. HTML-страница*

Вместо чтения Markdown в терминале просите выдать финальный результат как HTML для ревью
Собери это одним HTML-файлом: клики по веткам, подсветка состояния. Открывается в браузере, без сборки

*4. Видео*

Формат, на который Карпати ставит больше всего - короткий ролик под одну тему, в духе 3Blue1Brown. Совсем уже для богатых кто имеет доступ к генерации видео

Сделай видео в стиле 3Blue1Brown про эту гонку. Озвучка через мой ключ ElevenLabs

Сюда можно и просить все сделать как презентацию

——————
Ключевая идея сходится к том чтобы AI агент не вывали простыню текста на ревью, а выдавал все четко и по делу в удобном формате. Какой он для вас - знаете только вы, но думаю что суть идеи вы уловили

#AI #LLM

1.8k 0 67 12 19

👨🏻‍💻 Строим мультиагентные системы для разработки на Podlodka AI Crew

Инженерные задачи редко состоят из одного действия.
В традиционной разработке их распределяют между специалистами. Мультиагентный подход переносит эту логику в ИИ: вместо одного исполнителя работают несколько виртуальных агентов. Как построить такую систему и сделать её эффективной?

Эксперты Podlodka AI Crew ответят на этот вопрос в новом сезоне «Мультиагентные системы» с 12 по 16 октября. Генеральный партнёр — RWB.

Что узнаете:
🧩 Как построить внутреннюю ИИ-платформу разработки
🧠 Как устроен «мозг» агента
🔄 Как убрать себя из агентского цикла с помощью оркестрации
🏭 Как построить «завод» из ИИ-агентов с узкими задачами
🔍 Как быстро находить ошибки и не тратить лишние токены


Формат: онлайн, 5 дней, утренние и вечерние сессии в Zoom. Много практики и обсуждений в закрытом Telegram-канале. Цена ниже привычных конференций.

🎟 Промокод AI_BROADCAST — скидка на сайте

#реклама


🧠 Anthropic собрала инженерные заметки своей команды на claude.dev

Это не продуктовый блог и не дока. claude.dev — портал с тем, как сами разработчики Anthropic строят на Claude: скиллы, агенты, харнесс, контекст, стоимость задачи. Доки по-прежнему на code.claude.com.

Разделы: Agents, Engineering, Playbooks, Skills.

Из того, что реально стоит времени:
👉 How we use skills — как внутри Anthropic устроены сотни скиллов, не гайд «создай SKILL.md»
👉 The new rules of context engineering — что грузить в контекст на моделях поколения Claude 5, и зачем гонять /doctor
👉 A harness for every task — динамические workflow в Claude Code
👉 What a task costs on Opus 5.5 и Getting the most out of Opus 5.5 — цена прогона и как вести длинную сессию

Будет полензо тем, кто уже сидит в Claude Code и собирает свой харнесс. Часть текстов не новая, их просто свели в одно место, свежие лежат сверху ленты.

#AI #ClaudeCode #Agents


Классная демонстрация сравнения ума моделей между собой


🧠 Вышел Claude Sonnet 5.5, который лучше GPT-6 Sol, а самое главное - стал дешевле и потребляет меньше токенов. Кажется, наступают времени когда можно снова вернутся на подписку Claude Code.

Цена Sonnet 5.5 в 2 раза ниже чем Opus 5.5, хотя по качеству приближается к ней, что также радует.

Еще из важного - скорость ответа стала быстрее.

#Claude


Репост из: Nek.12 | AI, SWE, Tech [RU]
https://youtu.be/32zpk7tqs0M

Запись доклада уже доступна на ютубе!

Напомню, что я сравнил Kent и Codex по куче параметров на одной и той же задаче в Респавне, моем KMP-приложении, а также рассказываю про проблемные зоны в сфере, почему агенты не слушаются инструкций, как работает внимание у моделей, как делать хорошие агентные графы на примере.




❤️ Яндекс открыл претрей, которую учили с нуля - AliceAI-Foundation-80B-A3B-Base

Сразу стоит сказать - это не конкурент ChatGPT или Claude. Base-модель: MoE 80B параметров, на токен активны 3B, контекст до 262k, лицензия Apache 2.0. Веса на Hugging Face, разбор пайплайна и замеров в техрепорте на Хабре.

Предыдущая модель Яндекса Alice AI LLM 235B была сделана на основе весов Qwen3-235B. Здесь чужих весов нет, да и архитектура своя. Для российского стека это уже не «докрутили чужой чекпойнт и назвали своим».

По коду цифры Яндекса среди open моделей выглядят нормально, но и это лишь первый релиз и важно как будут дальше развиваться модели компаний. Как минимум они дали новый фундамент, который можно дальше дообучать для разных целей.

#AI #LLM #Yandex

2k 0 13 13 23

⚡️⚡️AI-агент съел токены и потерял контекст. Что делать? Разберемся на Mobius 2026 Autumn.

Когда AI становится частью рабочего процесса, появляются вполне инженерные вопросы: сколько токенов уходит на задачу, где агент теряет контекст, оправдан ли MCP, как поделиться рабочими практиками внутри команды и где автоматизация начинает создавать больше проблем, чем решает.

Этим вопросам посвятят отдельный блок на Mobius 2026 Autumn — конференции по мобильной разработке. Восемь докладов, где AI-разработку рассмотрят с разных сторон: от оптимизации агентов и оркестрации до юридических ограничений и локальных моделей.

Подробности — в карточках и на сайте.

Конференция пройдет 21–22 октября в Санкт-Петербурге + онлайн. 

🔥С промокодом aidevbroadcast персональные билеты дешевле

Купить билет

Реклама. ООО «Джуг Ру Груп». ИНН 7801341446


🤯 Вышла Grok 4.7

Модель прокачали во всем по сравнению с Grok 4.6 и соперничает с Fable 5.1 и GPT-5.6 Sol (GPT 6 далеко впереди всех). Цена по API доступу не менялась

Уже доступна в Grok, Grok Build и Cursor!

#SpaceXAI #Grok #Cursor

Показано 16 последних публикаций.