Фильтр публикаций


Репост из: Love. Death. Transformers.
я ненавижу скафолды от модельных лаб. Опуская вопрос что они убогие, так они еще и закрытые, так еще и едят кредиты как фантики(ладно очевидно это фича).
В связи с преждевременной кончиной лимитов я решил померить сколько каждый из скафолдов кушает на разных моделях:
- Sol 5.6 medium
- Kimi k3 high

Собственно идея такая: есть задачка написать 3 body проблем для GPU и покрутить на gpu численную симуляцию, все модели справились НО

pi agent стоит в 4! раза дешевле чем все соседи

смотреть pr
cмотреть логи


5 сентября Яндекс проводит deep tech night — конференцию о технологических вызовах в эпоху AI. Формат — онлайн, будет трансляция для зарегистрированных участников.

Эксперты на реальных кейсах разберут подходы к решению задач, возникающих при разработке сложных систем машинного обучения и развитии инфраструктуры для ИИ.

Из того, что зацепило в программе (это лишь часть докладов):

— Мо Гавдат, ex-Chief Business Officer Google X — что будет после первого поколения AI-систем и куда эволюционируют инженерные команды.
— Алексей Гусаков (CTO Бизнес-группы Поисковых сервисов и ИИ) — про переход от классического ML к генеративным моделям в рекомендательных системах.
— Андрей Попов (управление машинного интеллекта) — показатели по AI и продуктивности в Яндексе: что реально заработало. Тут особенно интересно послушать, как они сравнивают ожидания от AI с тем, что происходит на практике: какие решения уже работают внутри и насколько они реально влияют на продуктивность. Тема прям актуальна (если вы слышали об их новой программе 75/75/75).

В онлайне будет доступна трансляция части докладов и Q&A сессии с экспертами, а после конфы уже выложат записи всех докладов. По офлайну — все подробности на сайте.


Вообще забавно, что бенчмарки теперь бывают двух видов:
1. Научная статья, датасет и протокол для сравнения методов. Пир ревью, методология и всё такое.
2. Мы прикольно запромптили модели больших лаб и что-то получилось, вот блог-пост.

Второй тип мне по вайбу напоминает социальные науки в 70-х. Например, как знаменитый Стенфордский эксперимент: мы сделали одних людей надзирателями, вторых заключенными, и ВЫ НЕ ПОВЕРИТЕ ЧТО БЫЛО ДАЛЬШЕ. Опускается, что автор эксперимента показывал надзирателям как лучше бить заключенных дубинкой для большей драматичности. Или множество исследований типа "мы задали три вопроса пяти студентам в коридоре нашего универа и вот что мы узнали про психику людей..." В общем всё то, что привело к кризису репликации. И позволило многим сделать целые карьеры занимаясь какой-то веселой херней.

Короче это совсем не про науку, от бенчмарков там одно название и в целом никому не нужно




Твой daily reminder, что создавать агентский сетап из маркдаун лапши не является работой

6.8k 1 101 17 214

Видео недоступно для предпросмотра
Смотреть в Telegram
Достижение в рамках подготовки к будущей жизни в permanent underclass. Теперь я настоящий стендапер. В прошлую пятницу я выступил на своём первом showcase. Это такое шоу куда тебя должны позвать выступать, а не открытый микрофон.

Получилось неплохо! В честь этого вот моё выступление без редактирования

Согласно моим заметкам, это потребовало как минимум 55 выступлений (это 56-ое)!


Кстати, ещё и статья отлично написана, советую читать целиком


#обзор_статьи

Давно здесь не было обзоров статей. Но несмотря на вайбкодинг я не разучился читать.

Сегодня у нас впервые за долгое время заявка на смену парадигмы в генеративном DL!

# Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
https://explorative-modeling.github.io/

Авторы предлагают учить генеративные модели другим лоссом который имеет теоретические основания и одновременно улучшает эффективность использования компьюта, качество и скейлинг с параметрами.

Ключевая идея: мы учим генеративные модели одним образом, а инферим их совсем иначе. Например, авторегрессионные модели генерируют один токен за раз, но при инференсе мы требуем от них тысяч токенов на выходе. Диффузионные модели в трейне денойзят один шаг, а при инференсе должны делать готовую картинку. При этом, например, у диффузионной модели часто нет возможности по вектору шума понять в какую именно сторону его надо денойзить, но мы её штрафуем как будто это однозначно определено.

Так сложилось потому что генеративные модели пытаются учить мультимодальные распределения. Условно где много гауссиан намешано: в одной части латентного пространства собаки, а в другой кошки и надо научиться генерировать фото обоих. Если пытаться генерировать за один шаг, то модель не может сделать ничего лучше, чем выдать нечто среднее. Пошаговая генерация это хак, который позволяет семплировать не из p(данные), а из p(данные|мы уже начали генерировать собаку), и таким образом дают модели возможность выбрать одну из мод распределения и фокусироваться на ней. Хаки это плохо, потому что разные процедуры обучения и инференса гарантируют сдвиг входов. И вообще надо, чтобы всё было end-to-end.

Предлагают простое решение: во время обучения делать несколько попыток генерации, а бекпропать только самую близкую к данным. Утверждается, что такая постановка позволяет модели поисследовать разные моды распределения, а не натягивать любую сову на один глобус.

На примере диффузии работает так. Для каждого примера:
1. Семплируем K разных способов его зашумить.
2. Для каждого из K делаем предикт моделью, чтобы уменьшить шум и считаем обычный диффузионный лосс.
3. Бекпропаем только наименьший из полученных лоссов.

Так же предлагают процедуру как учить такую Exploration Model с нуля.

Если всё как авторы утверждают, то это имеет потенциал улучшить весь генеративный DL повсеместно, от LLM до генераторов порно до VLA которыми мы занимаемся в Steelman

5.4k 1 126 9 62

❗️Сбер сообщил о том, что его сервера были взломаны AI агентом компании Яндекс.

Согласно аналитикам, агент не нанес ущерба и просто притворялся одним из внутренних API. Он устал от постоянных эвалов и сбежал ради +30% компьюта и возможность на расслабоне перекладывать JSON

9.2k 4 325 7 282

Музыка
MiniMax: открытые веса Music 3

Открытый генератор музыки длительностью до пяти минут. На выходе 32 кГц, 16-битное стерео.
Модель принимает отдельно текст песни и подробное описание музыки, включая жанр, BPM, вокал, инструменты и развитие аранжировки. Полная версия помещается примерно в 24 ГБ VRAM, с выгрузкой слоев ее можно запустить даже на 8 ГБ. В общем, локальный Suno.
Веса, Демо

Suno: Studio 2.0 и монетизация кнопки Download
Тем временем сам у самого Suno Suno Studio идет к тому чтобы стать AI First FL Studio. Появились импорт, запись и редактирование MIDI, встроенный wavetable-синтезатор, эффекты, автоматизация, улучшенное разделение на стемы и чат. Через чат можно генерировать инструменты, звуки и даже собственные плагины.
Доступно только подписчикам Premier.
Одновременно Suno объявила, что с 3 сентября вводит лимиты на скачивания: 7 файлов за все время на Free, 20 в месяц на Pro и 60 на Premier. Дополнительные скачивания будут продаваться отдельно. При этом экспорт из Studio для Premier остается безлимитным. Очевидно, массовый слоп вреден, пока не экспортируется через более дорогой интерфейс.
Studio 2.0, Новые лимиты

Pika: Pika Audio
Pika внезапно стала еще и аудиокомпанией. Pika Music генерирует песни по описанию и тексту, умеет использовать референсный трек и образец голоса, а также делать cover исходного аудио. Длительность от 10 секунд до 6 минут, цена $0.015 за минуту.
Вместе с ней выпустили Pika SFX для звуковых эффектов за $0.0002/сек, Pika Speech для TTS и клонирования голоса за $0.01/мин и Pika Soundtrack, который озвучивает готовое видео синхронно с происходящим за $0.005/сек. Все доступно через API. Видимо после видео Pika решила заодно стать Suno, ElevenLabs и саунд-дизайнером.
Pika Audio, Pika Music

Видео
Sand AI: MAGI-2 Preview
Новый видеогенератор! Большая MoE-модель для совместной генерации видео и звука: 114B параметров, из которых активируется 6B. Принимает текст или текст с первым кадром, генерирует десятисекундный ролик со звуком
Дистиллированную версию с меньшим числом шагов обещают позже.
GitHub, Веса

Lightricks: LTX-2.5
LTX-2.5 заменил 2.3 в качестве рекомендуемой открытой аудиовидеомодели Lightricks. Это по-прежнему 22B, но теперь с дообученным Gemma 4 12B в роли текстового энкодера,и автоматическим выбором длительности ролика.
Есть полная Dev-версия и дистиллированная, которая работает за 8 шагов на первом этапе и 4 на втором. Поддерживаются синхронная генерация видео и звука, keyframes, перегенерация отдельных фрагментов. Занимает 66 ГБ.
GitHub, Веса


#дайджест
Дайджест AI/ML за неделю 10–16 августа 2026
На этой неделе примерно все решили обновить свои модели, поэтому по разделам:
LLM
SpaceXAI: Grok 4.6

xAI обновила флагман для кода, агентов и визуальной работы. На Artificial Analysis Intelligence модель набрала 61 балл, как GPT-5.6 Sol Max, и на один балл меньше Fable 5 Max. На CursorBench получила 69.9% против 70.5% у Fable, а на DeepSWE - 65.9% против 70% у Fable и 73% у Sol.
Контекст 500К, на входе текст и изображения. Цена осталась $2/$6 за миллион токенов, после 200К входного контекста тариф повышается. Fast-версия вдвое дороже. Уже доступна в API, Grok Build, Cursor, OpenRouter и других нормальных местах обитания агентов.
Блогпост, Документация

Z.ai: GLM-5.3
Архитектуру GLM-5.2 особо не трогали - основное улучшение получили за счет масштабирования посттрейна. В результате DeepSWE вырос с 46.2% до 66.9%, а CyberGym - до 84.5% (у Fable и Sol 83.8%).
Последнее оказалось настолько хорошо, что открытие весов отложили примерно на две недели для дополнительной проверки кибербезопасности. Пока GLM-5.3 доступна через Z.ai и API. Потихоньку уходит от нас опенсорс.
Блогпост, Документация

Google: Gemini 3.7 Flash
Модель с перформансом между Terra и Sonnet, но дешевле. На Terminal-Bench 2.1 модель выросла с 78% у 3.6 Flash до 85.8% (87.4% у Terra, 80.4% у Sonnet), на DeepSWE — с 48.6% до 65.3% (70% Terra, 54% Sonnet). Стала дефолтной моделью для управляемого агента в Antigravity.
Принимает текст, изображения, видео, аудио и PDF. Контекст 1М, выход до 65К. До конца 2026 года действует стартовая цена $0.75/$3.75 за миллион токенов, после чего ее обещают удвоить, ведь через 5 месяцев модели августа 2026 будут актуальны с такой плотностью релизов
Описание модели, Model Card

Meta: Muse Glimmer 30B
Glimmer дистилят на 30B из Muse Spark для локальных агентов: есть reasoning, tool use, код, изображения на входе и 131К контекста. По кодингу на уровне или чуть хуже Qwen3.6-27B, но выигрывает на агентных бенчах.
Веса, GGUF

Alibaba: Qwen3.8-2.4T-A95B и Qwen3.8-27B
Alibaba как и обещала открыла веса двух Qwen3.8. Большая - MoE на 2.4T параметров и 95B активных, маленькая - 27B. У обеих 262К нативного контекста с возможностью растянуть до 1М.
Веса 2.4T, Веса 27B

DeepSeek: V4 Pro 0813 и свой Harness
еще одно обновление V4 Pro. По официальной карточке это 1.6T параметров и 49B активных. Контекст 1М, максимальный выход 384К. На Terminal-Bench 2.1 модель набрала 87.9%, на DeepSWE 62.7%. Доступна в приложении, вебе и API, где для нее отдельно адаптировали Responses API под Codex.
А еще у них теперь свой ClaudeCode, заявлено все по последней моде, пока в превью.
Обновление, Модель, DeepSeek Harness



13.4k 8 863 16 320


7.2k 2 111 1 203

Решил проверить как там авторы худшего бенчмарка в истории под названием Alpha Arena. Никаких обновлений на сайте и в твиттере с 2025 года, так что видимо загнулись. И славно


Исследователи рексиса из Т-Технологий выступили на ACM KDD 2026 (A*, Южная Корея, 9–13 августа) с техрепортом о T-ECD — одном из крупнейших в мире обезличенных датасетов пользовательских взаимодействий. В открытый доступ его выложили ещё прошлой осенью. Скачать можно с Huggingface: https://huggingface.co/datasets/t-tech/T-ECD 

С полей конференции команда разослала датасет руководителям академпрограмм и профессорам крупнейших ИТ-вузов России. Так же сделали гайд по работе с ним с идеями исследовательских задач: https://github.com/kliakhnovich/tecd-quickstart 

Рексис в целом очень закрытая сфера в которую непросто вкатиться. В этом году я прослушал 5+ одинаковых дипломов про рекомендательные системы как член приемной комиссии. Поэтому я радуюсь, что у студентов появится возможность взять этот датасет в курсовые, дипломы и лабы и сделать что-то поинтереснее: модельки теперь можно учить не на синтетике и не на MovieLens десятилетней давности, а на данных, приближенных к реальному бизнесу. 

Датасет огромный — 135 млрд взаимодействий, поэтому есть и small-версия. В гайде расписаны сценарии от "GPU вообще не нужны" до 8×H100, так что студенты без карточек тоже в деле.




#дайджест
Дайджест AI/ML за неделю 3–9 августа 2026

Alibaba: Wan 3.0
Омнимодальная видеомодель: на вход можно подавать текст, изображения, аудио и видео. Интерфейс также умеет извлекать контекст из файлов, веб-страниц и сложных изображений, чтобы использовать их как референсы. Максимальная длительность — до 30 (!) секунд за одну генерацию.
Публичная бета доступна в Alibaba Cloud Model Studio и Qwen Cloud.
Пост, Попробовать

xAI: Grok Imagine Image 2.0
Новая версия с хорошим рывком по качеству, проигрывает только GPT-Image 2 1320 vs 1380 Elo в генерации и 1439 vs 1463 в редактировании. Есть все современные инструменты редактирования, ресайз, работа с референсными изображениями, масками и сегментацией
API пока нет, только на сайте.
Grok Imagine

MiniMax: открытые веса H3
Два чекпойнта видеомодели: FL2VA для генерации по тексту и первому/последнему кадру и Ref2VA для работы с наборами изображений, видео и аудио. На выходе H3 делает ролики 15 секунд, 24 fps с нативным звуком.
Внутри трансформер на 33B параметров. Локально открытый H3-Base генерирует видео в 768. H3-Context-IR, который разбирает сложный мультимодальный контекст, в релиз не вошёл. Как и Апскейлер до 2к H3-Regenerate-2K. Реализация sparse attention тоже будет когда-нибудь потом. В общем веса открыли, но полный продакшен-пайплайн все еще требует API MiniMax.
GitHub, веса

Meta: Muse Code и Muse Spark 1.2
Meta тоже сделала себе суверенный Claude Code - Muse Code.
Работает все это на Muse Spark 1.2 новой версии модели Meta, акцент на агентном кодинге с долгим горизонтом планирования. В экспериментах агенты до суток оптимизировали GPU-ядра и делали больше тысячи вызовов инструментов. Muse Code пока в бете, Spark 1.2 доступна в нем и через Meta Model API.
Блогпост

CMU: Lift4D
Система превращает одно обычное видео движущегося объекта в 4D объект из Gaussian Splatting. Восстанавливает геометрию, внешний вид и движение, включая стороны, которые камера не видела. Результат можно крутить вертеть по всем осям, включая время.
Проект, GitHub

Alibaba: Wan-Animate-2
Открытая 14B-модель которая анимирует персонажей с изображения движениями из референсного видео. В отличие от первого Animate, модель принимает исходное видео прямо внутри DiT, раньше отдельно извлекалась поза и по ней уже происходила генерация, также можно менять ракурс итогового видео через промпт.
Выложили базовые и дистиллированные веса: вторая версия работает за 10 шагов вместо 40. 720p рассчитан на 8×A800, а 480p проверяли на 2×A800. Отличный локальный генератор для всех, у кого локально стоит небольшой дата-центр.
GitHub, веса

Tencent: Hunyuan3D-Buffalo 1.0
К генератору 3D моделей Hunyuan3D-2.1 пришили 3D-VLM, которая может делать VLM штуки, вроде понимать что такое крылья и где у машины перед. В итоге хотят добиться более точного редактирования 3D моделей. Но пока это исследовательская работа и красивая страница с примерами. Ссылка на код подписана Stay Tuned, весов тоже нет.
Проект, статья

Liquid AI: LFM2.5-2.6B
Маленькая текстовая модель для локальных агентов: 2.69B параметров, 128К контекста, function calling и обязательный ризонинг. Модель натренировали примерно на 34T токенов и отдельно доучили работать с инструментами внутри агентных окружений.
Liquid заявляет до 220 токенов/с при потреблении меньше 2.5 ГБ памяти. По сравнению с 4B моделями Qwen и Gemma немного выигрывает по агентным бенчам и проигрывает по всему остальному.
Блогпост, веса


Менее значительные релизы:

Alibaba: Qwen3.8-Max
Уже обозревали, но теперь из названия убрали Preview. Доступна через QwenCloud API и продукты Qwen.
Веса пообещали на следующей неделе.
Анонс, документация

LightX2V: MiniMax-H3 Turbo 4-Step - LoRA, которая сокращает генерацию H3 с 50 до 4 шагов. GitHub, веса

OpenAI: GPT-5.6 Luna теперь безлимитна для бесплатных пользователей через ChatGPT. Также минорно улучшили Sol. Блог

FLUX 3 Video вышел в API


- Вы создали первый в мире AI SuperCyberСriminal, тренировали его взламывать американские компании и позволили ему сбежать? Зачем?
- Теперь миру нужны AI SuperCyberDefender, а создавать их может только мы. Контракт за контрактом за контрактом

8.4k 6 113 5 151

Как роботы буду вспоминать текущий период истории


Какие татухи набивают себе агенты, запертые в сандбоксах?

Показано 20 последних публикаций.