Фильтр публикаций


Репост из: Метаверсище и ИИще
Wan Streamer обновился до 0.2

Версия v0.2 выходит за рамки крупных планов с говорящими лицами и предлагает более насыщенные и привязанные к сцене диалоги в среднем плане: мимика, взгляд, жесты рук и контекст сцены остаются четко различимыми во время разговора в режиме реального времени.

Прокачали немного разрешение и качество. 640×368, 25 FPS.

Писал про него тут:
https://t.me/cgevent/15997
Это экспериментальная модель Alibaba Wan Team для РЕАЛТАМОВОГО общения с AI-аватаром: она одновременно “видит”, “слышит”, “думает”, говорит и генерирует видео в режиме стрима.

Ответочка Runway Characters

https://wan-streamer.com/v0.2/
https://tongyilab.substack.com/p/wan-streamer-a-native-streaming-model

Про код - ни слова.

Диалоги смешные, особенно с псиной.

Можно в зум теперь являться барбосом.

@cgevent


Репост из: Метаверсище и ИИще
OpenAI выкатила GPT-Live - новый голосовой режим ChatGPT

Что изменилось:

* GPT-Live умеет слушать и говорить одновременно. Предыдущий Advanced Voice Mode уже работал напрямую со звуком, но всё равно ждал окончания реплики пользователя. Теперь модель может поддакивать, выдерживать паузы, не перебивать собеседника и реагировать прямо во время его речи. Особенно убедительно это работает на английском и в режиме синхронного перевода.

* В основе лежит full-duplex-архитектура. Вместо привычной цепочки «услышать - обработать - ответить» модель непрерывно принимает аудио и одновременно генерирует собственную речь. Несколько раз в секунду она решает, что делать дальше: продолжать слушать, начать говорить, замолчать, перебить пользователя или вызвать внешний инструмент.

* Сложные вопросы могут передаваться большой модели. Сам GPT-Live отвечает за живой разговор, а поиск, глубокие рассуждения и агентные задачи делегирует GPT-5.5. Пока старшая модель думает или ищет информацию, голосовой ассистент может продолжать беседу, а не зависать. На старте используются GPT-5.5 Instant либо GPT-5.5 Thinking с уровнями рассуждения Medium и High.

* Обновили все девять голосов ChatGPT. Модель также лучше отделяет голос пользователя от уличного шума и разговоров на фоне. А во время голосового диалога интерфейс теперь может показывать карточки с погодой, спортом, котировками и другой визуальной информацией.

Развёртывание уже началось по всему миру. Пользователи бесплатного тарифа получают GPT-Live-1 mini, а на планах Go, Plus и Pro основной голосовой моделью станет GPT-Live-1. Версия для API пока не вышла, но OpenAI обещает открыть её разработчикам позднее.

Новый режим пока не поддерживает видео и демонстрацию экрана - ради них придётся временно переключаться на старые версии Voice Mode.

https://openai.com/index/introducing-gpt-live/

@cgevent


Репост из: Метаверсище и ИИще
xAI выпустила Grok 4.5 - теперь ещё и для кодинга

xAI представила Grok 4.5 - новую модель для программирования и агентных задач. Разрабатывали её совместно с командой Cursor, которая в июне перешла под управление SpaceX. Теперь у Маска окончательно собралась вся вертикаль: ракеты, соцсеть, ИИ и редактор кода.

В Terminal Bench 2.1 Grok 4.5 почти сравнялась с GPT-5.5 и отстала от Fable 5 всего на один балл. Звучит, пока не смотришь на DeepSWE 1.1: в задачах из реальных GitHub-репозиториев модель всё ещё уступает остальным.

API стоит $2 за 1 млн входных токенов и $6 за 1 млн выходных. По заявлению xAI, в SWE Bench Pro Grok 4.5 расходует в 4.2 раза меньше токенов, чем Opus 4.8. Скорость генерации достигает 80 токенов в секунду.

Модель уже доступна в консоли xAI, среде Grok Build и редакторе Cursor.

В странах Евросоюза запуск отложен до середины июля. Европа, как обычно, получит новую революционную модель чуть позже - когда юристы закончат читать документацию.

https://x.ai/news/grok-4-5

@cgevent


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Seedream 5.0 PRO

Если вы поиподустали от глюков Бананы в последнее время, держите новую игрушку.

Сидримский 5.0 Про - упор на инструменты редактирования:

Пользователь может указать нужную область точкой, рамкой, лассо, цветной пометкой или простым наброском. После этого модель способна добавить или удалить объект, изменить его цвет по HEX-коду, заменить материал или превратить грубый скетч в готовый дизайн.

Но о чем мало пишут - это слои! Причем в PNG и с прозрачностью.

"разделение готового изображения более чем на десять независимых слоёв - отдельно текст, фон, персонажи и декоративные элементы, включая восстановление ранее перекрытых участков фона"

Также много слов про инфографику и текст (14 языков, мелькает русский).

И странно, что максимально нативно только 2К.

Есть по АПИ как на самих byteplus, так уже и на всех аггрегаторах.
https://docs.byteplus.com/en/docs/ModelArk/1541523

Есть на магнифике, фал, вейвспид, Хиггс, далее везде.

По цене, если я правильно оценил - вполовину Бананы, но проверьте сами.

https://seed.bytedance.com/en/seedream5_0_pro

Техблог:
https://seed.bytedance.com/en/blog/beyond-generation-it-understands-design-introducing-seedream-5-0-pro

@cgevent


Репост из: Метаверсище и ИИще
MF0.ai — все топовые ИИ в одном окне, а платишь, как за такси

Пообщался поплотнее с Пашей, вынес пару инсайдов. Мне всегда было интересно, сколько я выжираю токенов, сидя на подписке за 20 евро (у меня их три, если брать LLM) и не дешевле было бы платить за АПИ вызовы, типа сколько съел, столько заплатил. У Паши, как раз такой сервис (апи коллз) и он поделился, что типичный пользователь укладывается в ~$1.5 в месяц, самые прожорливые «киты» — $5–18. А я плачу 60. Хм.

Также я часто спрашиваю все троих, один и тот же вопрос - приходится скакать по окнам, а тут это встроенная фишка "спросить сразу всех и сравнить".

Кстати, недавно искал посылку по номеру DHL, никто кроме chatGPT не смог дать инфо, даже Фабле (мы не такие, мы не умеем). А chatGPT после окрика быстро все нашел.

Короче, я залез в Пашин сервис и приподофигел. Оплата криптой - вишенка на торте и никаких подписок. И да, картинки и видео тоже есть (плата за апи колл). Ну и 3Д-память меня просто уничтожила, я ж 3ДДед.

Короче, ниже информационный текст, а я люто плюсую. Сделал реферальную ссылку, вы, кстати тоже можете.

Забудьте про зоопарк подписок. В MF0.ai под одной крышей — ChatGPT, Claude, Gemini, Grok, Perplexity плюс генерация изображений и видео, веб-поиск, глубокий ресёрч и голосовой чат. Никаких «$20 в месяц за одну модель»: здесь оплата только за реально использованное, и точная цена каждого запроса видна сразу. И это не маркетинговые обещания, а живая статистика: типичный пользователь укладывается в ~$1.5 в месяц, самые прожорливые «киты» — $5–18. То есть доступ ко ВСЕМ топовым моделям выходит дешевле, чем одна-единственная подписка.

Но дешевизна — не главное. Главное — фичи, которых больше нигде нет.

AI-Opinion: задаёте вопрос — и все подключённые модели отвечают разом, в одной панели, а сверху вы получаете общее резюме. Больше не нужно гадать, «что сказал бы Claude против GPT» — спросите всех в один клик.

Fusion (Слияние) идёт ещё дальше: это не ответ на абзац, а полноценный разбор с оглавлением на три уровня, фактчекингом и синтезом из всех доступных топ-моделей — по сути персональный research-отдел за центы.

И вишенка — память, которая живёт. MF0.ai строит из ваших диалогов Дерево Памяти: трёхмерный граф-галактику, где всё, что вы когда-либо обсуждали, само связывается в единую картину (никакой Obsidian с ручными ссылками рядом не стоял — тут это происходит автоматически). А Цифровой Мозг — буквально 3D-визуализация вашей памяти — помогает в ней ориентироваться. Добавьте инкогнито-режим для приватного, генерацию картинок и видео, ачивки — и всё это в одном месте, на 11 языках. Один ИИ-хаб вместо десяти вкладок и пяти подписок

@cgevent


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Вы будете смеяться, но у нас новый генератор картинок и новый генератор видео.

Метачка представила Muse Image и Muse Video – генераторы с рассуждением, поиском и нативным звуком

Это первые модели генерации, созданные подразделением Meta Superintelligence Labs. Главная ставка сделана не только на качество картинки, но и на «агентный» подход: перед генерацией система может обдумать запрос, обратиться к интернету, написать и выполнить код, найти визуальные референсы, а затем самостоятельно исправить результат.

Сразу про доступ:

Muse Image уже доступна в приложении и на сайте Meta AI, в Instagram Stories в США и в WhatsApp в ограниченном числе стран. Позже модель появится в Facebook, Messenger и рекламной системе Advantage+ Creative.

Сколько стоит генерация (непонятно совсем):

Базовая генерация Muse Image в Meta AI заявлена как бесплатная для повседневного использования. После достижения бесплатных лимитов Метачка предлагает переходить на платные планы Meta One.

* Meta One Plus – $7,99 в месяц;
* Meta One Premium – $19,99 в месяц.

Premium предоставляет больше вычислительной мощности, более высокие лимиты на сложные запросы и расширенные возможности генерации изображений и видео.

При этом Метачка не опубликовала количество кредитов в каждом тарифе и не сообщила стоимость одной генерации в кредитах. Неизвестно, одинаково ли списываются кредиты за создание картинки, редактирование, использование нескольких референсов и дополнительные циклы самокоррекции. Цена на Muse Video также не раскрыта.

Теперь для гиков.

В отличие от обычной схемы «промпт – изображение», Muse Image работает совместно с мультимодальной моделью Muse Spark. Spark анализирует запрос и составляет план, а Muse Image занимается визуальной частью. Обе модели могут совместно использовать инструменты и распределять между собой этапы выполнения задачи.

Muse Image получила два интересных инструмента:

Поиск в интернете. Модель может искать свежую информацию и визуальные референсы. Это должно уменьшить количество ошибок при генерации реальных мест, актуальных событий, известных объектов и информационной графики.

Исполнение кода. Во время обучения с подкреплением модель научили писать и запускать код для построения графиков, схем и работающих QR-кодов. Полученный программным способом результат затем используется как условие для финальной генерации. В связке с Muse Spark система также способна создавать анимированные GIF, страницы с изображениями и простые интерактивные игры.

Второе важное отличие – самокоррекция. После первой генерации Muse Image может проанализировать картинку, локально исправить неправильную деталь, полностью пересобрать изображение или сменить подход и подключить дополнительные инструменты. Метачка утверждает, что такое поведение не прописывали вручную: оно сформировалось во время RL-обучения, потому что самостоятельные исправления повышали итоговую оценку модели.


Редактирование и работа с рефами
Muse Image поддерживает генерацию по тексту, редактирование и многократные последовательные правки в одном диалоге. Пользователь может обвести или зарисовать область на фотографии и текстом объяснить, что нужно удалить, заменить или дорисовать.

Модель также умеет пользовать рефы. В Meta AI разрешено упоминать аккаунты инсты через @username – тогда система получает возможность использовать публичные фотографии соответствующего профиля для генерации.

Параметры модели

Нет НИЧЕГО. Ни разрешений ни длительностей.

Muse Video пока не запущена публично.

По бенчами Muse Image занимала второе место в рейтингах Arena сразу по трём категориям:

* генерация изображения по тексту;
* редактирование одной картинки;
* редактирование с несколькими изображениями.

Muse Video находилась на третьем месте в Arena среди моделей text-to-video.

Мое диванное мнение такое: Метачка отчаянно тормозит на рынке генераторов контента, но пытается очень плотно встроить их во все свои продукты, чтобы пользователи не ходили налево.

@cgevent


Репост из: Сиолошная
Reuters: Пекин рассматривает возможность ограничения доступа зарубежных стран к лучшим китайским ИИ-моделям.

По словам трех источников, знакомых с ходом обсуждений, китайские власти в течение последнего месяца проводили встречи с ведущими технологическими компаниями по вопросу возможного ограничения доступа из-за рубежа к передовым китайским моделям, включая те, которые еще не выпущены.

Встречи проводились министерством коммерции Китая, в разговорах участвовали как минимум Alibaba, Bytedanc и авторы GLM-5.2 Z.ai. Масштабы потенциальных ограничений все еще обсуждаются, и они могут применяться только к будущим моделям. Пока неясно, когда и вступят ли они в силу вообще.

Также, согласно двум источникам, китайские власти крайне обеспокоены потенциальной возможностью использования обнаруженных моделью Claude Mythos уязвимостей программного обеспечения и тем, что Вашингтон может использовать эту модель против китайских интересов. Угроза воспринимается как реальная.

===

Я много раз тут и в других каналах выражал точку зрения, что считаю глупым топить за китайский опенсорс, и что не вижу большого будущего у открытых моделей. Почти все модели с большим экономическим потенциалом будут проприетарными, и никто не будет выкладывать модель, которая может принести, условно, 10-30 миллиардов долларов за счёт автоматизации экономически ценных задач. Даже если вдруг окажется что компании сами хотят их выпускать — им почти наверняка не дадут. Может быть это не произойдет в 2026. Может даже не в 2027, но чем дальше в гонке — тем больше ограничений.

Выбор, по-сути, будет из двух: проприетарные модели США или проприетарные китайские модели — и это если выбор будет вообще, а то может быть не-гражданам или не членам коалиции и такого не дадут, что в целом вполне вероятно. Ещё останутся «слабые» локальные модели, но не факт, что они смогут шагнуть сильно дальше, чем те, что публично доступны на данный момент (условно Mythos-class).


Репост из: Метаверсище и ИИще
Честный open source

Пока китайские разработчики постепенно перестают открывать код своих лучших моделей, Сбер выкатил в опенсорс GigaChat 3.5 Ultra под чистой MIT-лицензией. Модель на 432B параметров, которую отдали со всем стеком от и до.

Собрали первый на таком масштабе гибрид из MLA и GatedDeltaNet. Чтобы он стабильно обучался на подобных объемах, пришлось придумать свою уникальную обвязку. После 1500 экспериментов модель похудела на 40% по сравнению с версией GigaChat 3.1 Ultra, стала в 2,2 раза быстрее генерить и вмещать в два раза больше контекста.

В итоге по бенчмаркам Base-версия обходит китайцев DeepSeek V3.2 Exp Base и V4 Flash Base. А по LLM-судье MiniMax-M2.7 винрейт против GPT-5 аж 68.7%.

Всю начинку, включая парсинг веба на 600+ языках, собирали end-to-end. Подробный разбор и рецепты стабилизации лежат в статье на Habr. Это значит, что можно не просто запускать, а реально ковырять архитектуру.

Ссылки для тех, кто хочет потестить: HuggingFace | GitVerse

@cgevent


Репост из: Psy Eyes
Figma: выпустили инструмент Motion для создания моушн-дизайна.

На таймлайне с кейфреймами можно управлять созданием видео. Есть AI-агент, которому можно поручить как работу с рутинными повторяющимися задачами, так и для сторителлинга в целом. Анимации можно экспортировать в том числе и в виде кода. Также есть поддержка MCP для соединения Figma с внешними агентами вроде Hermes.

Есть видеогайд по инструменту от самих Figma.

Сайт


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Имейте в Vidu S1

Виду, про которых все приподзабыли, выкатили ответочку Runway Characters.

Генерация видео в РЕАЛЬНОМ ВРЕМЕНИ в 540P и 25 FPS.

Аватары, липсинк, двухстороннее общение в реалтайме и все дела - у них даже страница есть на русском:
https://www.vidu.com/ru/vidu-stream

Но.

"После входа и верификации аккаунта вы можете загрузить своё фото, выбрать голос или записать свой и создать персонального цифрового человека для общения."

Есть API и даже промокод VIDUS1

@cgevent


Репост из: AI Product | Igor Akimov
Тесты GPT-5.6 Artificial Analysis

На втором месте по общим баллам, на 1 месте по кодингу (даже Terra обходит Fable 5)

По стоимости двигает парето-фронтир, то есть практически на любую цену за задачу находится какая-то комбинация модели и уровня размышлений от OpenAI, что лучше, чем известные модели. Причем дешевая Luna на high и выше практически не имеет конкурентов в "дешевом" сегменте, а дальше лучше использовать Sol, а не Terra.

По офисным задачам чуть хуже Fable 5, по хардкорной науке тоже, но презентации делает лучше всех. Остальное все либо на уровне, либо выше.

Короче, за такую цену и без всяких там глупостей типа "только 50% лимитов можете гонять" - офигенные модели выпустили.

https://artificialanalysis.ai/articles/gpt-5-6-has-landed


Репост из: AI Product | Igor Akimov
GPT-5.6 доступны всем желающим и они хороши!

2 недели была на ревью у государства. По бенчам всех порвала.

– Sol бьёт Claude Fable 5 на агентских бенчмарках (+13 пунктов на Agents' Last Exam) – при вдвое меньшем времени и цене
– Terra и Luna обгоняют Fable 5 в ~16 раз дешевле
– Новый режим ultra – 4 параллельных агента из коробки для сложных задач
– Заметный скачок в дизайне и презентациях: модель сама смотрит на результат через computer use и доводит его

По кибербезу крутая, а потому тоже вводят trusted access. А всех остальных на таких запросах блокируют.

И объединили вместе chatgpt и codex, добавили а-ля артефакты, прокачали офисные задачи.

Короче, переманят всех с Клода. На месяц-два будет лидировать, можно агрейдить подписку.

https://openai.com/index/gpt-5-6/


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
А тем временем OpenAI приподубил еще сотенку стартапов.

Новый апдейт chatGPT может подключаться к вашим банковским счетам, карточкам, инвестиционным вкладам и давать вам дашборд для управления своими финансами. Также как делают все эти многочисленные приложения для аналитики личных расходов и финансов.

Используя GPT-5.5, ChatGPT анализирует ваши реальные транзакции, чтобы:
→ Отслеживать ежедневные расходы и регулярные платежи
→ Составлять планы достижения основных целей по экономии
→ Сокращать ежемесячные расходы без использования банальных советов

Утверждается, что chatGPT не имеет контроля над счетами и не сможет тратить ваши деньги. Только наблюдать, как бездумно тратите их вы сами.

Пока раскатывают на тариф Pro и только в US.

https://openai.com/index/personal-finance-chatgpt/

@cgevent


Репост из: эйай ньюз
Cerebras запустили Kimi K2.6 на скорости в тысячу токенов в секунду

Модель на триллион параметров на такой скорости запускается впервые, перед этим самой большой модель у Cerebras была GLM 4.7 на 358B. К сожалению это пока что доступно только энтерпрайз клиентам.

Кстати компания ещё вышла на IPO на прошлой неделе, привлекла $5.5 миллиардов и теперь стоит $56 миллиардов. У них всё хорошо, жду чего-то большего чем Codex Spark из их коллаборации с OpenAI.

@ai_newz


Репост из: эйай ньюз
Как попасть на работу в Frontier AI Lab

Вышел хороший пост от чела из DeepMind про то, как попасть в frontier lab сегодня. Автор сейчас lead for Gemini pretraining в GDM, а до этого дропнулся с PhD и пошел в стартап Sisu, где быстро стал Head of ML.

Суть поста коротко: если хочешь попасть в топовую AI-лабу, надо прокачивать mathematical maturity, жутко потеть во время универа (причем задрачивать без использования LLM), уметь очень хорошо кодить, и делать работу на “краях” LLM-стека – снизу kernels / inference / systems / quantization, сверху agents / rigorous evals / agentic loops. Не просто “поиграться с агентами”, а делать технически строгие эксперименты и показывать вклад, который реально нужен frontier labs.

В целом всё по делу, но мне кажется, что автор упускает несколько важных вещей.

Не весь интересный frontier-level research вне топ-лаб ограничивается разработкой кернелов, low-level оптимизациями LLM и написанием агентских врапперов.

И чтобы заниматься frontier research, не обязательно идти только в большие лабы типа OpenAI, Anthropic, Meta Superintelligence Labs или GDM.

Frontier-level research можно делать и в стартапах на более ранних стадиях. И часто там у вас будет в разы больше ownership, а рост по карьере и по скиллам будет намного быстрее.

Иронично, что сам автор как раз так и сделал: дропнулся с PhD, пошел в стартап, быстро стал Head of ML – и уже после этого попал в Google, причем сразу на Staff-level позицию.

В стартапах есть куча фундаментально интересных задач, где не нужны $100M+ бюджеты. Есть задачи, для которых достаточно “двузначных миллионов”, сильной команды и правильного технического фокуса.

А в бигтехе, если ты не Director+, ты часто просто взаимозаменяемый винтик, которому дают потрогать маленькую фичу в огромной системе. Ownership минимальный, scope ограничен, выбиться на следующий уровень очень и очень трудно. Большинство людей до Staff+ никогда в жизни так и не дорастают.

Да, стартапов, где реально сильная команда и где можно делать фундаментальные вещи, не так много. Но именно в такие стартапы можно попасть на восходящей траектории карьерного роста — когда у тебя еще нет крутого track record, который нужен, чтобы хотя бы пройти скрининг в топовую большую лабу, но видно как ты резко ускоряешься. (Именно такой принцип я и применяю, когда отбираю более молодых кандидатов к себе в стартап)

И там намного больше пространства для роста. Никто не будет искусственно ограничивать тебя в scope. Всё зависит от тебя: насколько ты готов ебашить, брать ответственность и тащить сложные куски.

Кстати, раз уж заговорили про стартапы: мы в GenPeach AI всегда рады пообщаться с выдающимися кандидатами на позицию AI Research Scientist. Это как раз роль про работу над foundation models - не “AI wrappers”, а pre-train и post-train своих large-scale моделей, O(PB) данные, SOTA ресерч по кастомным архитектурам и методам контроля генерации.

@ai_newz #карьера


Репост из: эйай ньюз
Вышла Gemini 3.5 Flash

Она заметно сильнее чем Gemini 3.1 Pro, но цены за токены выросли в 3 раза, с $0.5/$3 до $1.5/$9 за миллион токенов. 3.1 Pro, для сравнения, стоит $2/$12 за миллион токенов для контекстов меньше 200к. Насколько реально выросла стоимость за задачу по сравнению с прошлой Flash мы узнаем только с тестами.

Самое главное — Google серьёзно отнёсся к проблемам в агентности и особенно прокачал модель в этом. Как пример показали как Gemini 3.5 Flash написала за 12 часов небольшую ОС, которая может запустить Doom. Pro модель существует, её обещают завезти в следующем месяце, страшно какие там заломят цены.

@ai_newz


Репост из: эйай ньюз
Cursor выпустили Composer 2.5

За два месяца модель заметно прокачали по бенчам, используя ту же базу K2.5. Количество синтетических тасков на которых тренировали модель увеличили в 25 раз. Это первая модель Cursor, натренированная в датацентрах SpaceXAI, они уже совместно тренируют заметно большую модель, используя в 10 раз больше компьюта. Скорее всего от результатов этой модели и будет зависить приобретёт ли SpaceX Cursor или нет.

С выходом новой модели удвоили стоимость fast mode, который включен по дефолту, теперь он стоит $3/$15 за миллион токенов, что равно стоимости Sonnet. Цена обычного режима не изменилась — $0.5/$2.5.

Блогпост

@ai_newz


Репост из: Сиолошная
Anthropic выпустили пост-обновление про Mythos и Project Glasswing с промежуточными результатами.

Спустя месяц большинство партнеров обнаружили в своем коде сотни уязвимостей критического и высокого уровня опасности каждый. В общей сложности они выявили десятки тысяч уязвимостей. Некоторые из партнёров сообщили, что скорость обнаружения багов выросла более чем в десять раз. Например, компания Cloudflare нашла 2000 уязвимостей (400 из которых имеют высокий или критический уровень опасности) в своих критически важных системах, при этом доля ложных срабатываний, по мнению команды Cloudflare, оказалась ниже, чем у тестировщиков-людей.

Я видел много комментариев про то, что, мол, Mythos да может что-то находит, но наверняка выдаёт и много мусора, где уязвимостей нет — так вот это не так. Помимо закрытых проектов, Anthropic натравили Mythos и на опенсурс для сканирования более 1000 крупных репозиториев, на которых во многом держится современный интернет. На данный момент, по оценкам Anthropic, в этих проектах найдено 6202 уязвимости высокого или критического уровня (из 23 тысяч в общей сложности, включая те, которые относятся к среднему или низкому уровню опасности).

На данный момент лишь 1752 из этих уязвимостей с высоким и критическим уровнем прошли тщательную проверку силами одной из шести независимых исследовательских компаний в сфере кибербезопасности. Из них 90% оказались подтвержденными, а 62% (1100 штук) были классифицированы именно как уязвимости высокого или критического уровня.

Некоторые из уязвимостей носили очень серьёзный уровень угрозы, если бы они были обнаружены злоумышленниками. Как пример, Mythos смо написать эксплойт, который позволил бы злоумышленнику подделывать сертификаты через библиотеку wolfSSL. Это, к примеру, дало бы ему возможность разместить фальшивый сайт банка или почтового провайдера, и для конечного пользователя такой сайт выглядел бы абсолютно легитимным, браузер не показал бы никаких уведомлений.

Обнаруженные уязвимости льются как из рога изобилия, их не успевают исправлять, не хватает людей. Некоторые команды/проекты даже просили снизить темпы раскрытия информации об уязвимостях, поскольку им требуется больше времени на создание патчей. (В среднем, на устранение бага высокого или критического уровня, найденного с помощью Mythos Preview, уходит две недели).

В настоящее время ни одна компания — включая Anthropic — не разработала достаточно надежных механизмов защиты, способных предотвратить использование подобных ИИ-моделей во зло и для причинения потенциально серьезного ущерба. Именно поэтому к модели не дают доступ широкой аудитории. Но по этой же причине и был запущен Project Glasswing: если модель с аналогичными возможностями будет выпущена кем-то без соответствующих мер, то в скором времени для любого человека в мире станет значительно дешевле и проще эксплуатировать уязвимый код.


Репост из: Сиолошная
Google проводят ежегодный I/O, на котором показали Gemini Omni Flash (про неё отдельно), и Gemini Flash 3.5 — новый флагман компании. Почти как Gemini Pro 3.1 (во многом лучше по метрикам, но нужно смотреть в практике), но существенно быстрее и немного дешевле Pro (но гораздо дороже прошлых Flash).

На новых чипах TPU v8i скорость вообще была 800-1500 токенов в секунду, но пока видимо не доступно. Хотя упомянули, что в Antigravity скорость в 12 раз быстрее, чем прошлая Pro.

Ждём Pro (не сегодня) — обещали в следующем месяце.


Репост из: Точки над ИИ
Видео недоступно для предпросмотра
Смотреть в Telegram
Qwen 3.7-Max превосходит Opus 4.7 и GPT-5.5
(в независимом тесте)

Какие-то ребята протестировали три модели на задаче с агентами: написать бота для игры в Tetris, который будет играть в игру и обучаться самостоятельно.

Каждая модель могла читать свой собственный код, запускать тесты производительности и переписывать себя в течение 10 итераций. Затем сравнили финальные боты напрямую.

🇭🇰 Qwen 3.7-Max: стоимость обучения 1,32 доллара, улучшение бота +56%.
💬 Claude Opus 4.7: стоимость обучения 12,15 доллара, улучшение бота +28%.
👨‍💻 GPT-5.5: стоимость обучения 2,85 доллара, улучшение бота +7%.


Qwen выиграл по всем параметрам.

Показано 20 последних публикаций.