#дайджест
Дайджест AI/ML за неделю 28 сентября – 4 октября 2026
Google: Gemini 4 Argon
Верните мне мой 2024-й. Google наконец выпустила фронтир, но не вам. Первое место в Vals Index с 68.9 против 67.0 у Opus 5.5, DeepSWE 77.9% против 74.2% у Opus и 74.1% у Astra. В индексе AA 53, то есть ровно Astra и Fable, Opus 5.5 с 58 впереди. Галлюцинирует меньше всех: 15% против 51% у Astra. Выход до 1М токенов. $2/$10 на старте, потом $4/$20.
Доступ только партнерам, потом платный API и Ultra, когда - не сказано. Но через Блумберг, сотрудники Google говорят, что на бенчах лучше чем в жизни.
Блогпост,
бенчмарки,
Vals
Anthropic: Claude Sonnet 5.5Sonnet, достойный Opus 5.5. Бьет Опус на Terminal-Bench 70.6% vs 66.4%, в остальном отстает на пару пунктов: CursorBench 55.5% против 57.8%. Цена та же $2/$10, на 30% быстрее Sonnet 5. В max режиме сжигает 193К токенов на задачу, больше всех измеренных моделей, так что считать его дешевле Opus стоит осторожно.
А еще теперь у Sonnet киберограничения как у Opus с откатом на Sonnet 5.
Блогпост
OpenAI: DevDay, GPT-6.1 Sol и DotsDevDay с 20+ анонсами.
GPT-6.1 Sol - апгрейд GPT-6 Sol за те же $2/$10 с кэшем $0.10: DeepSWE 75.2% против 68.8%, то есть по бенчам примерно уровень Astra в пять раз дешевле.
Dots - возмещение за обрезание $200 подписки пополам. Постоянно работающие агенты на Astra со своим облачным компьютером и 4000 интеграций.
Разное - новый тариф за $500 с режимом Ultrafast (до 8x скорости в Codex), Decisions API на Luna (Jev у нас дома), Agents API с computer use, Codex в облаке и тд и тп.
Рекап,
InfoQ
Runway: Praxis-1Runway вслед за FLUX теперь тоже про роботов. Praxis-1 - world action model на том же видео-претрейне, учится в основном на чужих роликах с YouTube, а не на телеоперации: после файнтюна ошибка 16.1см против 16.0 у претрейна на реальном роботе. Смогли мы всему научиться по видео на Youtube, смогут и роботы. Сравнений с FLUX 3 Action нет, веса обещают "в ближайшие месяцы".
Исследование
ElevenLabs: Eleven v4 и v4 TurboНовая архитектура, больше языков, клон голоса по 10 секундам, аудиотеги теперь можно стакать и модель выполняет их по порядку. Turbo для агентов с ~150 мс до первого звука и начинает говорить, пока LLM еще пишет. Первое место у Artificial Analysis. $22 и $11 за миллион символов со скидкой.
Блогпост,
TechCrunch
BFL: FLUX 3 ImageИз нового - редактирование без дрейфа: правишь объект, остальные пиксели не трогаются. Раскладка через рамки в промпте, до 10 референсов, до 4K. $0.048 за 1K, $0.61 за 4K, открытые веса "через несколько недель".
Модель
Ideogram: 4.5 - тоже про многошаговое редактирование без накопления артефактов, открытые веса тоже только обещают.
До 4 референсов на правку, нативные 2K, четыре режима качества от 0.8 до 22 центов за картинку
X
Менее важные новости:Jev: две недели спустя12 million views for a JSON classifier? Yeah, we're in a bubble.
Но и это не конец, JSON classifier за $40М породил индустрию. Опенсорс (и не только) успел наклепать примерно миллион копий.
Clef,
Kev имя им легион.
Figure: F.02 decommission - старые роботы крутят сальтухи в дуговую печь и косплеят Терминатор 2 с настоящим Шварценеггером, в общем просто красиво.
X
RoboParty: RP1 - полностью открытый гуманоид. На IROS его пинали посетители.
Пресс-релиз Bilibili: Index-Translate - переводчики на Qwen3.5. 150 языков, 2B/9B/35B-A3B, на FLORES 0.879 против 0.865 у GPT-5.6 Sol.
GitHub
Suno: Speech - озвучка текста с музыкой под него одним проходом, до 8 минут, бета для всех.
X