AI for Devs


Kanal geosi va tili: Rossiya, Ruscha


По сотрудничеству пишите в личные сообщения канала.
Канал для разработчиков про AI. Модели, ИИ-агенты, практические кейсы и новости из мира AI. Всё, что можно применить в работе.
Технологический партнер: veai.ru

Зарегистрирован в РКН
Связанные каналы

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


⚡️ Новая stealth-модель обгоняет Fable 5 и GPT-5.6 Sol на DeepSWE

У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.

Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.

Модель прогнали на 10 задачах DeepSWE: Ox Alpha набрала 80%, Fable 5 — 65%, GLM-5.3 и Grok 4.6 — по 62%, GPT-5.6 Sol — 52%.

Выборка маленькая, поэтому до полноценного бенчмарка далеко, но результат внушительный.


Кто сделал модель, неизвестно. Вероятнее всего это новая GLM-5.x: совпадают токенизатор, видеоэнкодер, стиль ответов и реакция на аудио.

@ai_for_devs


⚡️ Claude Code получил нативный аналог Caveman

Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.

По сути, это нативный аналог Caveman: скилла, который заставляет агента говорить как пещерный человек и экономить output-токены. Только теперь ничего устанавливать не нужно.


Включается через /config → Output style → Concise или строчкой "outputStyle": "Concise" в settings.json.

@ai_for_devs


⚡️ Cursor запустил Origin: конкурента GitHub для AI-агентов

Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.

Доступ получают пользователи всех платных тарифов. На старте доступны репозитории, пул-реквесты, просмотр и поиск кода, а также синхронизация с GitHub.


Создать репозиторий можно во вкладке Codebase, после чего Cursor покажет CLI-команды для клонирования или загрузки локального проекта.

Репозитории из GitHub можно подключать выборочно и отключать в любой момент.

@ai_for_devs


⚡️ GPT-5.6 Sol разогнали до 750 токенов в секунду

OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.

На всех 2500 вопросах Humanity's Last Exam Sol закончила работу за 11 часов 11 минут. Claude Fable 5 понадобилось 78 часов 27 минут при сопоставимой точности.


Для сравнения, нынешний Fast mode ускоряет Sol только до 2,5 раза и стоит вдвое дороже Standard. Цену Ultrafast пока не раскрыли, а доступ дали лишь нескольким клиентам.

Можно попробовать оставить заявку на ранний доступ.

@ai_for_devs


⚡️ Qwen3.8-27B запускается локально и местами обходит Opus 4.6

Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.

По совокупности тестов новинка оказалась сильнее даже предыдущей облачной Qwen3.7-Plus.


В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом.

Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти.

@ai_for_devs


⚡️ Google выпустили Gemini 3.7 Flash

Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.

По coding-бенчмаркам 3.7 Flash примерно на уровне GPT-5.6 Terra и в среднем немного лучше Sonnet 5. На DeepSWE — 65.3% против 69.6% у Terra и 53.8% у Sonnet, на FrontierCode уже обходит обе: 43.6% против 41.3% и 42.7%.


До конца года стоимость $0.75/$3.75 за миллион токенов (input/output). Это в 2.7 раза дешевле Sonnet 5 по output и больше чем в 3 раза дешевле Terra.

Контекст 1M, модель уже доступна через API, в AI Studio и Antigravity.

@ai_for_devs


⚡️ DeepSeek поднимают цены на API до 12 раз

С 16 августа DeepSeek вводят часы пик. В это время API будет стоить вдвое дороже, чем в остальные часы. Сами базовые цены тоже выросли.

Генерация V4 Flash подорожает с $0,28 до $0,66–1,32 за миллион токенов, V4 Pro — с $0,87 до $1,98–3,96.

Сильнее всего досталось кэшированному входу V4 Pro: вместо $0,003625 придётся платить $0,022 вне часов пик и $0,044 в часы пик. Это в 6–12 раз дороже.


Эпоха почти бесплатного DeepSeek подошла к концу.

@ai_for_devs


⚡️ Z.ai выпустили GLM-5.3: обошла Opus 4.8 на, но уступила Fable 5 и GPT-5.6 Sol

Технически внутри та же GLM-5.2: без нового претрейна и архитектуры, просто ещё месяц RL на длинных инженерных задачах DeepSWE вырос с 46,2% до 66,9%, Terminal-Bench 3.0 с 4,6% до 28,3%.

На Terminal-Bench 3.0 новинка обошла Kimi K3 и Opus 4.8, но не дотянула до Fable 5 и GPT-5.6 Sol.

Начиная с GLM-5.2 команда проверяла реальные кодовые базы несколькими своими моделями и нашла 2436 уязвимостей в 269 проектах; какие именно версии участвовали, Z.ai не уточняет.


GLM-5.3 уже раскатили в Coding Plan от $18/мес, а веса обещают через две недели; цены API за токены пока нет.

@ai_for_devs


На Hugging Face появился обратный отсчёт до релиза Qwen3.8-27B.

https://huggingface.co/Qwen/Qwen3.8-27B

Среди тех, кто запускает LLM на своём железе, Qwen 27B – это народный любимец.

За последнее время локальных моделей вышло немало.

Отсюда вопрос.


Ждём первый рэп-кодинг баттл 🤣


⚡️ DeepSeek обновили V4 Pro

Китайцы выкатили V4 Pro 0813: большое обновление апрельской Preview-версии модели, которое уже заменило старую модель в API.

После нового пост-тренинга почти все агентные бенчмарки заметно выросли: Terminal Bench поднялся с 72,1 до 87,9, вплотную к Kimi K3 и Fable 5 и выше Opus 4.8.

На DeepSWE результат вырос почти в пять раз: с 12,8 до 62,7. На бенчмарке от Code Arena новинка получила 1607 баллов и попала на Pareto frontier — сопоставимые по качеству модели стоят в разы дороже.


Цена тоже не изменилась: $0,435/$0,87 за миллион токенов. Веса модели пока что не опубликовали.

@ai_for_devs


⚡️ xAI выпустили Grok 4.6: модель сравнялась с GPT-5.6 Sol

В CursorBench Grok обошёл GPT-5.6 Sol: 69,9% против 67,2%.

Но на DeepSWE и Terminal-Bench GPT пока заметно впереди: 73% против 65,9% и 34,6% против 26%.

Цена $2 за миллион входных и $6 за миллион выходных токенов. Fast-версия вдвое дороже, а первую неделю в Cursor и Grok Build дают двойные лимиты.


Модель уже доступна в Cursor, Grok Build, API и OpenRouter.

@ai_for_devs


⚡️ SpaceXAI выпустили Grok Bot: мессенджер для взаимодействия с AI-агентами

Боты работают на облачном компьютере: входят в приложения и на сайты, используют сохранённые сессии и выполняют задачи.

Можно запустить несколько агентов параллельно. Они обмениваются контекстом, передают друг другу задачи и продолжают работать при выключенном компьютере.


Grok Bot работает на инфраструктуре Cursor и доступен по подписке Cursor Ultra за $200 в месяц.

@ai_for_devs


⚡️ NVIDIA представили Nemotron 3.5 Lightning, быструю локальную модель

В тестах самой NVIDIA новинка уступила Qwen3.6 и Gemma 4. Недавно представленная Muse Glimmer, которая идёт примерно на уровне Qwen, тоже выглядит сильнее.

Зато козырь Lightning это скорость: на большой очереди типовых задач она справилась с работой на 30% быстрее Qwen при сопоставимом качестве.


Веса модели занимают около 20 ГБ. В OpenCode модель сейчас доступна бесплатно.

@ai_for_devs


⚡️ OpenAI выпустили GPT-5.6-Cyber для поиска zero-day и разработки эксплойтов

Модель зарелизили в рамках программы Daybreak, которая даёт проверенным специалистам расширенный доступ к AI-инструментам для кибербезопасности.

Вместе с ней появились два уровня доступа:

Daybreak Blue с GPT-5.6 Sol для аудита кода и защитных задач
Daybreak Red с GPT-5.6-Cyber для продвинутого исследования уязвимостей

На кибербенчмарках GPT-5.6-Cyber лучше Sol и GPT-5.5-Cyber справляется с разработкой эксплойтов и поиском zero-day, хотя в отдельных тестах обычная GPT-5.6 Sol всё ещё впереди.


По данным OpenAI, модель уже нашла две связанные уязвимости в V8/Chrome, минимум пять уязвимостей в мобильной ОС, три критические уязвимости в популярной базе данных и более 400 способов повышения привилегий в ядре ОС.

@ai_for_devs

15 ta oxirgi post ko‘rsatilgan.