VG: VideoLab & Self-Motivated Learning


Гео и язык канала: Россия, Русский
Категория: Образование


Канал лабораторий машграфики ВМК МГУ, анализа видео института ИИ МГУ и анализа видео университета Иннополис.
О том, как меняется DL-мир и как заставить себя прокачиваться, чтобы успевать за ним.
А лучше не просто успевать, а быть в числе лучших)

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Образование
Статистика
Фильтр публикаций


Господа!

У меня очередная отличная новость! У нас приняли очередную статью на А* конференцию IEEE ICDM! Уже 13-я в этом году и 19-я за 2 года)

Хотелось бы подчеркнуть несколько моментов:

* Первый автор статьи — Кирилл Аистов — внезапно один из тех самых "олдов", о которых я писал вчера 😁🙂 Вот вчера я написал, что у возрастных товарищей результаты в среднем хуже, и тут же Кирилл не отходя от кассы серьезно улучшил статистику! 😂 Шучу, конечно, но пока у нас это первая статья от соискателя первым автором на А*. И точно не последняя! 👏

* На данный момент у Кирилла 2 А* статьи зашли. Одна третьим автором на ACMMM и одна первым автором на ICDM. А теперь самое сильное — обе зашли с первой подачи!!! 🤩🔥🤩🔥🤩🔥🤩 Это реально очень сложно и для этого нужно не по-детски вложиться в содержательную часть работы и в саму статью!

* И отдельно поздравляю Кирилла с тем, что он стал 15-м членом нашего неформального "клуба первых авторов".

В свете вчерашнего поста про задачи и зарплаты еще раз поясню, почему последнее важно.

Тот самый человек, который сейчас на стажировке в Superintelligence Lab запрещенной компании подавался на стажировки в весь FAANG и другие крутые (и даже получил 3 приглашения, выбрав Superintelligence). В одной из компаний не ответили, но на мероприятии он оказался рядом с руководителем подразделения, в которое хотел попасть. Он подошел описал ситуацию и спросил, почему не ответили? Единственный вопрос был:
— У вас есть статьи А* первым автором?
Он ответил:
— Конечно! Две штуки там-то.
— А! Тогда это техническая накладка, напишите снова.
И успешно прособеседовали.

Причем крутые места отличаются тем, что их интересуют не просто ТОЛЬКО первые авторы, но еще и буквально на 5 конференциях (из ~60 A*) и еще смотрят на трек и содержательную часть статьи. В общем только самые-самые.

Активно пополняем число самых и самых-самых! 😁

Больше наших успехов по тегу: #our_successes@vgcourse

#our_successes
@vgcourse






Господа!

Я опять с отличной новостью! 🤩

У нас еще две А* зашли. 🥳🥳🥳

Это, правда, демо трек, но все равно у нас получается уже 12 А* в этом году 😲💪🥳

Также у нас получается уже 14 человек в нашем "клубе первых авторов А*" (сейчас добавились один магистр 1 года и один аспирант 1 года 😁)

Справедливости ради замечу, что сейчас происходит плавная девальвация понятия А* публикации. Я несколько раз кидал графики роста числа принятых статей на разные А* конференции и там хорошо так растет и колосится. Это означает, что попасть на них становится все проще и проще, хотя и все еще заметно сложнее, чем в журналы.

С другой стороны замечу, что среди поступающих в аспирантуру у нас в этом году 3 человека — первые авторы А* (не соавторы, это проще, а именно первые авторы — обычно сделавшие основной вклад в публикацию). Как правило, А* затаскивают аспиранты и то далеко не все. Мы постепенно уже на входе в аспирантуру собираем первых авторов А* 💪😁

В этом плане у меня сильно облегчается разговор с желающими ко мне в аспирантуру. 😉 Сразу можно спрашивать:
— Сколько у вас А* первым автором?
Человек отвечает:
— Ну я же как раз хочу к вам, чтобы их сделать!
— А чем вы тогда в бакалавриате и магистратуре занимались?
Хороший вопрос, заметно сокращающий дальнейший диалог! 😉 (замечу на полях, что люди вливаются в наши команды даже будучи студентами, даже из других университетов, а не только факультетов и кафедр, так что желание присоединиться к нам нужно реализовать заблаговременно)))

Ну и самое интригующее сейчас — это результаты ревью NeurIPS. У нас получается уже 18 А* за 2 года. Дотянем ли до 20? Тоже хороший вопрос.

Работаем! 😁

Больше по теме: #our_successes@vgcourse

#our_successes
@vgcourse












Господа!

У меня в прошлом посте был прогноз бурного рост потребления токенов, породивший резонные вопросы в комментариях. Докину в тему.

Верхнее фото я сделал в Сеульском аэропорту на днях. "May AI help you?" написано на автоматическом информаторе (отличная игра слов))).

Кошмарная новость: Даже если лично вы ретроградно из принципа не будете оплачивать никаких подписок, вы все равно неявно будете оплачивать увеличение потребления токенов.

* Вокруг довольно массово переводят всевозможные саппорты на LLM. И часто довольно удачно! Я был удивлен в Сеуле, когда задал вопрос про местные валюты боту приложения Сбера, а в ответ получил очень подробный развернутый ответ, причем без упоминания сервисов Сбера, но реально максимально полезный. 😲😲😲 Не ожидал, да 😉😁 И даже если вы таким не будете пользоваться, будут пользоваться другие, а плату размажут по всем. Из забавного — мне рассказывали, как в чат поддержки одной крупной и неповоротливой конторы прикрутили хорошего чатбота, так школьники это просекли и с его помощью делали домашние задания. И VPN не нужен, и бесплатно. Обнаружили и перекрыли это сильно не сразу. 😂 И им вы тоже оплатите 😉

* Все больше рекламы "снимают" с активным использованием нейросетей. Давно знаком с Сергеем Цыпцыным, который у себя на канале сделал рубрику #нейропрожарка@cgevent, в которую кидают свои творения в том числе и профессиональные режиссеры. В том числе рекламу. Там по постам (и комментариям) видно, как народ немного офигевает от того, что уже получается создавать рекламу натурально на 3-4 порядка дешевле реальных съемок. При этом когда за дело берутся профессионалы, то отличий не видно (все подчищено и очень хорошо выглядит). А с видео токены тратятся с очень хорошей скоростью! Вы оплатите эти токены, даже если будете зажмуривать глаза каждый раз на рекламу 😁

* Еще из забавного свежего. В качестве культурного просвещения посетили музей и использовали GPT вместо аудиогида. Просто закидывали фото экспоната и просили рассказать о нем (голосом). Короче! Аудиогиды нервно курят в сторонке! Они абсолютно неконкурентоспособны (особенно когда их просят оплачивать отдельно))). Рассказ GPT-гида очень хорош, на все вопросы можно получить ответ, все можно персонализировать под себя (поменьше того, побольше этого). Заверните! Беру! 😁

И таких примеров можно привести вагон!

Еще из свежего глобального. 4 дня назад на сайте известнейшего венчурного фонда Andreessen Horowitz (они по долгу службы ооочень плотно следят за ситуацией) разместили крайне любопытные графики. В Топ-1% американских компаний во втором квартале этого года затраты на токены В ПЕРЕСЧЕТЕ НА ОДНОГО СОТРУДНИКА достигли средней оплаты среднего американского работника ($98К/в год). 🤯 В общем констатируется, что:
For the first time in history, humans are cheaper than software.

Впервые в истории люди стоят дешевле, чем софт. 🤯 А к концу года они вангуют, что затраты на токены на одного сотрудника (включая уборщиц) в топ-1% превысят среднюю зарплату Software Engineer. Правда пилюлю подсластили, в том плане, что в среднем через 2 года после активного внедрения ИИ число сотрудников таких компаний растет на 10%. Так что выдыхаем, люди еще нужны 😁 Более того, компаниям, активно внедряющим ИИ люди даже нужнее, чем в среднем по индустрии. О как!)

КУДА они девают столько токенов я выяснял, как вы догадались в многочисленных разговорах на ICML (Когда это эффективно, когда нет? Как контролируется качество кодовой базы? И т.д.) 😉

Ну и вывод "срочно осваиваем ИИ" — это к многочисленным курсам "промпт-инженеров" (которые будут заменены первыми!). 😁 А мой вывод — качайте hard skills. Ибо научить хорошего специалиста эффективно использовать ИИ намного проще, чем научить вайбкодера сложностям специальности. 🤷‍♂️😂

И это снова про конкурентоспособность, которой всем горячо желаю! 😁

Больше материалов на тему:
#speed_of_progress@vgcourse

Stay tuned! 😁

@vgcourse


Господа!

Одна из интереснейших возможностей на крупных конференциях по AI в том, что сюда приезжает море сотрудников топовых западных компаний и организаций, у которых доступ к моделям совершенно другого уровня.

За последние 3 дня плотно общался с тремя людьми, у которых безлимитный доступ к моделям(!). Токенмаксинг (стимулирование максимизации потребления токенов) после ряда перегибов уже непопулярен. 😉 И есть даже варианты ограничений, например, еще у одного человека на работе можно использовать не более чем на 300$ в день (условно 6000$ в месяц). Тяжело ему, бедняге. 😉

Ну и реально человек, недавно получивший на работе безлимитный, в некотором обалдении рассказывает, что "жизнь разделилась на до и после" (дословно так!). В начале происходит некоторая адаптация, ибо старые привычки экономии токенов сильны, а новые расточительные манеры непривычны. Но довольно быстро осваиваются приемы выжимания из харнесов и моделей более сложных достаточно надежных результатов (надежных критично, естественно). Собственно основное в Agent Boosting — за счет автоматического и полуавтоматического разбиения задачи на более простые, растет сложность и длина успешно выполняемых задач. И при правильной организации работа становится заметно продуктивнее.

Забавно, что в марте прошлого года я писал:
Полторы недели назад Сэм Альман выступал перед инвесторами и сказал, что хочет брать 20.000$ в месяц за агента следующего поколения уровня аспиранта. Точнее, там прозвучало, 2.000$ за агента следующего поколения, и 20.000$ за "PhD level". 😲[...] Они, очевидно, ожидают существенного увеличения качества работы моделей в ближайшее время

Тогда это казалось полной фантастикой и многие даже вполне себе сидящие на хороших подписках знакомые говорили "нет, ну 200$ еще понятно за что, а больше платить смысла никакого". Прошел год и число тех, кто реально платит больше резко возросло. Безусловно, сказалась политика компаний, но я знаю и "частников", которые на тысячи долларов в месяц сжигают токенов на свои нужды. Понятно, что для этого нужно зарабатывать этим больше, но они и зарабатывают! И это не продажа курсов, это реальные задачи!

У меня есть минимум один выпускник, жгущий токены безлимитно уже какое-то время (в России, что необычно!), но концентрация таких людей на ICML, очевидно, выше.

После общения с ними (и постоянно поминаемого клод кода))), мне очень захотелось посмотреть, что там у Антропиков с деньгами. Держите чудные графики! В мае они достигли оборота 3,6 ярда (44 в год), обогнав OpenAI почти в полтора раза 🤯🤘🙂 Аплодирую стоя! У них была масса сложностей, но обогнать они смогли именно благодаря качеству продукта.

Забавно, что в конце этого января (менее полугода назад!) я писал:
В Давосе CEO Антропик хвастался, что у них был $100 млн ДОХОД в 2023, $1 млрд в 2024 и $10 млрд в 2025 🤩. Сколько у них будет в 2026? 🚀

Намек (и у Дарио, и у меня))), естественно, был на 100 ярдов. И у них с такой скоростью реально есть шанс этого результата достичь (они уже за 5 месяцев — к маю — в 6 раз обогнали декабрьские результаты!!!).

Кстати, не подскажете, где все эти адепты "пузыря ИИ", утверждавшие, что он развивается на деньги инвесторов, скоро они кончатся и все закончится? Что-то они куда-то в последнее время пропали. Может быть потому, что количество реально платящих за этот ваш ИИ так выросло? 😉

С такими темпами можно уверенно ванговать, что только в США в следующем году будет достигнут уровень оплаты за ИИ 10 ярдов в месяц (суммарно по 3 основным сервисам вместе с использованием API всеми компаниями, которые поверх свои сервисы сделают, включая генерацию видео, например). Это становится уже заметно в масштабах экономики страны.

Профессиональные сообщества (и даже компании) достаточно консервативны, что тормозит многие изменения, но это сильнейший тектонический сдвиг!

Больше материалов на тему:
#speed_of_progress@vgcourse

Stay tuned! 😁

@vgcourse


Господа!

Забавно, но я до сих пор встречаю людей, которые оценивают ситуацию с нейросетями так, как будто они не будут улучшаться. "Да, но это работает не очень", "Да, но они галлюцинируют" и т.д.

Да, галлюцинируют. Но это заявляется так, как будто люди не галлюцинируют. Я бы тоже может быть возмущался, если бы (довольно регулярно и чаще, чем хотелось бы) не ловил себя на галлюцинациях 😉 Мы же на этом основании не делаем вывод о невозможности или серьезных ограничениях использования людей. Ну по крайней мере пока 😉 Пока модели галлюцинируют чаще 😉

Короче! Прошло 4 для конференции и меня не перестает поражать масштаб. 6000 статей это реально много. Огромный зал, в котором такие улицы, на которых народ толпится как в метро в часы пик (вообще куча участников жалуется на толпы — они не зря призывали авторов постеров не приезжать — что крайне необычно для конференций). Всего таких "улиц" 23 штуки по 18 постеров с каждой стороны. И они менялись 3 раза в день 3 дня. В общем даже просто обежать все, это как весь Эрмитаж обежать, причем несколько раз) А ведь там просто обегать смысла нет. Смысл в том, чтобы останавливаться, слушать, вопросы задавать, думать (как и в Эрмитаже))). Короче! Масштаб бедствия растет на глазах! 😁

Ну и к вопросу тех же галлюцинаций. Публикаций на их счет полно. Работа по их уменьшению идет по большому спектру направлений. Тут, например:

* Все более и более сложная фильтрация обучающих данных (благо качество новых моделей это позволяет). Видел аж несколько статей, показывающих, как на меньшей обучающей выборке (но более сложно подобранной) результат оказывается лучше, чем на полном наборе.

* Целенаправленный fine-tune, как для подтягивания специфичных данных, так и для того, чтобы модель научилась "наказывать" себя за галлюцинации.

* RLHF / RLAIF с акцентом на фактическую точность, кстати, тут интересный сдвиг — если раньше фронтирные лабы специально нанимали людей для разметки таких датасетов, то сегодня много можно получить "почти бесплатно" за счет разметки пользователей, причем забавно, что часто платные пользователи оставляют лучшую обратную связь по ответам, чем бесплатные!

* Архитектурные и регуляризационные приёмы (teacher forcing, label smoothing), обучение на задачах с явным ответом «не знаю» / «нет данных», классический RAG, построение draft + judge систем.

* Большое количество post-processing методов — явная аннотация всех ключевых утверждений ссылками, сопоставление утверждений с содержимым ссылок, формирование списка проверочных вопросов и их обработка (CoVe, self-checking), оценка уверенности в отдельных утверждениях и ответе.

* Улучшение запросов и коммуникации — явное уточнение неопределенных мест в запросе (привычные вопросы модели, особенно переде deep research), разбиение сложной задачи на подзадачи, их оркестрация, инструкции снижающие галлюцинации для конкретных кейсов в промпте и скилах

И это сильно неполный список! Т.е. даже просто перечисление названий направлений работ, ведущих к уменьшению галлюцинаций, потребует несколько таких постов! И эта работа очень активно ведется в муравейнике с моих фото выше во все больших и больших масштабах (с большим количеством людей и статей). 😁

Интересно, сколько статей примут на NeuIPS и ACMMM? (в том числе наших)))

А про ICML и дождливый теплый Сеул еще напишу!)

Stay tuned! 😁

Больше про конференции:
#pro_conferences@vgcourse


Господа!

Всем привет из дождливого Сеула с ICML-2026!

Я уже писал, что у нас сюда зашло 2 статьи в основной трек (кстати, про сами статьи все руки не доходят написать, а там интересно). В общем мы с Николаем Сафоновым мокнем в Сеуле!)

Конференция интересна тем, что входит в 16 наиболее крупных ИИ конференций, которые отслеживает AI Index Report. В 2021 году они даже перекрыли всех по количеству участников и до прошлого года были на 3-4 месте стабильно. Правда тут считаются виртуальные участники, поэтому нужно вносить поправку. Ну и характерно, что конференции нередко взлетают, понимают, что не выдерживают уровень и откатываются. И тем не менее в среднем все довольно дружно растут.

На ICML в прошлом году было принято 3260 статей при 12 тысячах поданных.
В этом году принято 6352 статьи при почти 24 тысячах поданных... Рост в 2 раза...

Статистику по количеству участников озвучат сегодня, но будет около 10 тысяч участников, причем была необычная ситуация, что они сняли заранее для проведения большой конференционный центр в центре Сеула, но оказались не готовы к двукратному росту числа поданных статей (предыдущие пару лет рост был "всего" в 1,5 раза, а до этого и того меньше). В итоге за 1,5 месяца до начала организаторы закрыли возможность регистрации всем, кроме авторов, а авторам разослали письмо, мол "Если у вас не устный доклад, то помните, что вы можете не приезжать! Если вы не планируете приехать — пожалуйста дайте нам знать!". Дело в том, что большое количество участников от компаний оказались к этому также не готовы и точно планировали быть, но столкнулись с тем, что регистрации sold out и они не могут попасть! Крайне необычная ситуация для научных конференций!

Надо сказать, что раньше я думал, что в какой-то момент в ближайшие пару лет наступит пик, как это уже бывало. Условно "закончится рост числа исследователей перебравшихся в область" и А* в ИИ перестанут расти. Но на ICLR в этом году стало совершенно очевидно, что в этот раз все пойдет как-то по-другому. Agentic Research реально позволяет ощутимо повысить скорость исследований. Как я писал:
На конференции на глаз было видно много "статей с длинными названиями", когда скрещивание ужа с ежом поставлено на поток, ощутимо автоматизировано и позволяет клепать статьи тоннами (там море fake science, особенно на небольших датасетах).

Про deep fake science уже подробно писал и еще как-нибудь напишу (ничего не изменилось, только масштабы выросли и методы поменялись), но и количество годных статей явно растет. Очень много рутины делегируется агентам и один сильный исследователь может проверять больше гипотез за то же время. В этом плане можно довольно уверенно ванговать, что рост количества статей продлится еще несколько лет. От чего я в некотором обалдении.

Ибо к чему это приведет пока непонятно. Система рецензирования статей в большом кризисе, поскольку количество нейрослоп-статей тоже растет, и получается, что тем же самым сильным исследователям нужно рецензировать больше статей для сохранения уровня рецензирования. А у них нет времени на вдумчивое чтение. И это сегодня порождает серьезный кризис, связанный с просадкой среднего качества рецензирования (и хорошие статьи чаще не проходят, и слабые статьи чаще проходят, в абсолютных числах так прямо заметно чаще).

Сами конференции тоже меняются. Раньше у конференций был узкий круг "хозяев" и сравнительно узкий круг участников. Сейчас все не так. Участвуют толпы. Очень заметно меняется атмосфера (в сторону стадиона), от чего в печали многие опытные многолетние участники.

С другой стороны скорость прогресса автоматического рецензирования очень велика и, похоже, скоро LLM-ревьювер станет в среднем более качественным, чем кожаный (но про это в другой раз). Нас ждет сильное изменение науки (как и многих областей) в ближайшее время, похоже!

Прогресс решает одни проблемы и порождает другие!

Взираю на происходящее в легком обалдении) (от масштабов и фантастической скорости изменений) Про Сеул и конференцию скоро напишу!

Stay tuned! 😁

Больше про конференции:
#pro_conferences@vgcourse

@vgcourse


Господа!

В заголовок вынесен эпичный пример Новосибирского МК. Адрес был https://novos.mk.ru/social/2026/06/26/sdelay-kachestvennyy-i-unikalnyy... 🤦‍♂️😂 Сейчас там 404, естественно, но web.archive.org успел зафиксировать страницу, так что теперь мы знаем, какие короткие и примитивные промпты у новостников МК! 😂🤣😂

Про забытые в дипломах инструкции агентам, которые мы нашли в эту сессию, я уже писал. Продолжим тему!

Я прогнал все дипломы, через довольно неплохой детектор AI Gen текстов. Сначала проверил на дипломах 2020 года (всем дал 0% — отличный уровень ложноположительных!), а потом прогнал дипломы ВМК, Сколтеха, Физтеха и ИТМО с комиссий, в которых я участвовал.

Суммарно по дипломам получились оценки от 0% до 88% (на последнем, видимо, были ложноотрицательные срабатывания 😉) У этого детектора снижены ложноположительные (чтобы реже зря не наговаривать), поэтому можно считать, что он дает оценку снизу.

В среднем по дипломам получилась такая картина:

14% — Физтех, бакалавры (причем без 2 дипломов, один из которых как раз 88%, было бы всего 9%!)
15% — ВМК ИИТ бакалавры
17% — ВМК ИИТ магистры
18% — Сколтех магистры 2 комиссия
19% — Сколтех магистры 1 комиссия
21% — ВМК МС магистры (616)
29% — ВМК МС-ИИТ магистры
38% — ИТМО AI Talen Hub

Какое наблюдение: если процент сгенерированности средний, то бывает, что вполне неплохо человек отвечает, а бывает, что с проблемами. Но какой-то странной непонятной причине так совпало, что если процент был большой, то человек плохо на сутевые вопросы по своему диплому отвечал. Даже на простые. Неожиданное совпадение, согласитесь! 😉

Причем одному товарищу, который у себя по ROC AUС сравнивал методы спросили, а что это такое? Он не смог ответить... 😲 И что такое Recall не смог... 🙈 И что такое Precision... 🤷‍♂️ Его не аттестовали. И еще трое (из 12 получили тройки). В общем самые низкие оценки были. Причем Дмитрий Ботов, руководитель программы AI Talen Hub, горячо это поддержал. Дословно: "Считаю, что двоек могло быть и поболее у вас". Замечу, что он своему студенту (!) рекомендовал поставить 2, но мы, добрая комиссия, повысили рекомендованную научным руководителем оценку. 🤓

Много сниженных оценок было и в Сколтехе, и в Физтехе. В Сколтехе вообще очень часто научные руководители минимум на балл понижают рекомендацию. В Физтехе в первый день оценки были 7, 7, 8, 10, 5, 10, 9, 5, 10, 10 (целых две пятерки! вот только по десятибальной...), при том, что в целом мне там дипломы весьма понравились.

Коллеги дружно отмечают — студенты массово уходят работать и забивают на диплом. Причем с массовым уходом работать пропадает стимул вкладываться в студентов. Научники проходят несколько раз через ситуацию, когда они много отвечают на вопросы молодого перспективного студента, много объясняют, помогают, а тот, только-только научившись что-то делать, уходит работать, даже спасибо не сказав (ведь его обязаны были учить!). Как следствие многие (особенно молодые) научники начинают вкладываться только в аспирантов. Явно вырос процент "беспризорников" — студентов, которые ковыряют что-то сами (в отзывах Сколтеха традиционно часто подчеркивается, насколько самостоятельно студент решил задачу))).

По ВМК кратко:
* ВМК №1 по оценкам (традиционно самые высокие, среди всех мест, где бываю)
* Магистры ВМК — самые короткие защиты (по времени)
* Магистры ВМК — меньше всего сутевых вопросов

С вашего позволения не комментирую.

Глобально сейчас сложились:
* Смешные зарплаты в вузах относительно компаний
* Кардинальное упрощение выполнения домашек, курсовых и дипломов с ИИ
* Массовый ранний уход студентов на работу

Еще 10 лет назад начинали работать только на последних курсах, не поверите. Это сказывается.

Но я оптимист) И уже вижу, насколько слабое образование снижает конкурентоспособность. Тем более в грядущий век быстрых изменений. Просто по тому, как мои же бывшие студенты рассказывают эпичные истории с собесов или про увольнение свеженабранных. 🤷‍♂️

Так что все будет хорошо с теми немногими, кто научился! 😁

Конкурентоспособности дочитавшим! 😉

Больше по тегу #education_now@vgcourse
@vgcourse


Коллеги!

В прошлый раз мы остановились на том, как важно научиться достигать сложные результаты с использованием ограниченных ресурсов и топовым качеством, лучше, чем это делают другие. 😉

Приведу свежий пример. В рамках А* конференции ACM Multimedia в конце весны прошел GenText-Forensics: Challenge on Explainable Forensics and Adversarial Generation for Text-Centric Images.

Основная его идея проста. Современные модели могут достаточно просто генерировать и (с недавних пор) довольно качественно редактировать документы. Причем если картинка целиком генерируется — это сегодня сравнительно надежно детектируется (с оговорками, про маскировку генерации разными методами, в первую очередь сжатием, новые генераторы и т.д.). Мы провели большой челлендж в рамках CVPR этой весной (подробнее тут, тут, тут, тут, тут и тут).

НО! Если картинка отредактирована (т.е. большая часть пикселов не тронуты) детектировать замену намного сложнее. Мы должны были проводить челлендж на эту тему на ECCV, но увы, весь воркшоп, в котором мы участвовали, не прошел, поэтому в следующий раз...

А пока пришлось участвовать в чужом челлендже (для разминки, чтобы кровь не застаивалась, а понимание темы росло) 😉

В общем мы поучаствовали в этом челлендже на детект отредактированных документов. Авторы заявляют, что это был первый AI-security челлендж, посвящённый редактированию текстов в изображениях. С одной стороны модели реально чуть хуже справляются со шрифтами (что дает шанс). С другой, можете оценить, как мало менялось на примерах из датасета выше (черное с белыми полосками — это маски изменений). Необходимо сдетектировать измененное место и сделать пояснение (Explainable Forensics в названии), почему именно это место сочтено подозрительным, что существенно усложняет задачу (заставить детектор объяснить причину объективно сложно).

Причем датасет RealText-V2 был подготовлен годный (это мы любим!): в нем большее 20К изображений на 6 языках (английский, китайский, арабский, тайский, малайский, индонезийский) в 6 сценариях (финансы, медицина, образование, стриминг, e-commerce и «дикая природа»). Причем для подготовки описаний фейков были оплачены профессионалы (следствие участия компании).

Организаторы — из Ant Group (первые 2 места нашего челленджа, замечу) и университетов Сингапура и Китая. Они же в 2024 году провели на кагле челлендж по дипфейкам на 706 команд. Они же авторы Real-Text V1 датасета (весна 2025) и учли опыт первой серии.

В общем сложная задача. Свежий датасет. 114 участников. 548 сабмитов...

И... (барабанная дробь)...

Мы заняли 3 место в финале челленджа!!!
🥳🥳🥳

Причем большую часть работ сделал третьекурсник Кирилл Кольцов под руководством нашего аспиранта Саши Гущина (5 А*, в том числе 3 первым авторов за последние 2 года). 🙂🎉🙂

Путь был сложным, в финале было 22 участника, соревноваться с китайцами ооочень тяжело и все равно пачка топовых китайских университетов оставлена позади! Йееее!

Почему это важно:

* В челленджах на А* очень часто компании в организаторах, благодаря чему датасеты довольно практичны, чем датасеты очень очень многих бенчмарков (большинство датасетов публичных бенчмарков, к сожалению, крошечны и не слишком качественны, но на безрыбье проходят). Поэтому решать задачу сложнее, но воспроизводимость решения выше.

* Попасть на А* желают многие, поэтому в А* челленджах довольно много участников (что облегчает задачу организаторов, но сложнее занять призовое место)

* Время ограничено очень жестко. От выкладывания датасета до финального сабмита всего 2 месяца. Это очень мало для файнтюна немаленькой модели (в челлендже было ограничение не более 32 миллиардов параметров).

В общем с ограниченными ресурсами и в топовом качестве лучше других, все, как заказывали 😁 Это просто отличная тренировка. 💪

Продолжаем прокачку! 😁

#our_successes@vgcourse
@vgcourse


Господа!

Я иногда захожу на layoffs.fyi, посмотреть, кто сколько увольняет в хайтехе и с какими формулировками. Чтоб вы знали: первая половина 2026 — самая жесткая в плане увольнений за последние 3 года. На сегодня отрапортовано 122 368 уволенных (оценка снизу, если кто изучит их таблицу и связанные новости), при том, что за ВЕСЬ 2025 год было 124 636 (почти догнали). А за ВЕСЬ 2024 152 922 (догоним к концу лета).

На первом месте (в разовых увольнениях) Oracle, потом Amazon, Dell, запрещенная и далее по списку (см картинку).

При этом есть "скрытые" увольнения. Microsoft объявила программу добровольного ухода для 8000 сотрудников (7% штата) мотивируя повышенными компенсациями для сотрудников с большим возрастом и стажем. Т.е. те, кто устал, уволятся сами и их не будет в этой статистике.

В целом в США в мае было уволено 97 000 человек — рекорд с 2020 года (с ковида!), при этом хайтех впереди планеты всей, что порождает новости вида: Технологический сектор США возглавил волну увольнений в мае: сокращено более 38 000 рабочих мест

Oracle пишут в годовом отчете: «интеграция и применение ИИ-технологий привели и, вероятно, продолжат приводить к сокращению персонала».

Запрещенная рассекает: 20 мая 2026 года компания одновременно провела два процесса: уволила ~8 000 сотрудников и насильно перевела ~7 000 других на новые позиции, связанные с ИИ (это 20% штата!)

Новые структуры:
* Applied AI (AAI) — подразделение с целью передать ИИ-агентам «основную часть задач по созданию, тестированию и выпуску продуктов», тогда как инженеры будут лишь мониторить их работу
* Agent Transformation Accelerator (ATA) — команда по автоматизации внутренних бизнес-процессов
* Hatch — внутренний ИИ-агент (аналог OpenAI's OpenClaw), тестирование которого должно завершиться к концу июня 2026 года (сейчас!), с последующей интеграцией в Instagram для 3+ млрд пользователей (шо будет!)
* Agent Data and Optimization — команда по данным для обучения агентов (фактически разметка данных для агентов, куда неожиданно для себя улетело 30-50% инженеров продуктовых команд)

Причем они потребовали в командах креативных продуктов в первой половине 2026 чтобы 65% инженеров писали более 75% кода с помощью ИИ. Ох, вангую, много проблем с кодом, особенно когда таких вещей требуют директивно. 🤷‍♂️😁

В общем еще вчера студенты хвастались друг другу, кто сколько миллисекунд потратил на написание диплома (и хрен с ними, с ИИ-косяками!) 🙈😉

А уже сегодня компании массово увольняют одних инженеров, а других насильно переводят на ИИ (и хрен с ними, с ИИ-косяками!) 🙈😉

Причем умные люди говорят, что мир только начал сходить с ума по этому поводу и будет намного веселее. Знаете, чем пессимист отличается от оптимиста? Пессимист говорит "Хуже быть не может!", а оптимист отвечает "Может-может!" 😂 Я оптимист, как вы понимаете. 😁

В общем продолжаю широко открытыми глазами смотреть, как студенты дружными рядами срезают углы (и не только углы) на экзаменах, в курсовых, в дипломах, и всем традиционно желаю как никогда важного сегодня — реальной конкурентоспособности. Умения достигать сложных результатов с использованием ограниченных ресурсов и с топовым качеством, лучше, чем это делают другие.

Это важно сегодня!

@vgcourse


Господа!

В последнее время было мало постов не потому, что мало новостей, а потому, что событий было слишком много) Делюсь частью свежего интересного. 😁

Я уже 25 лет сижу на дипломах на ВМК и 5 лет на дипломах в Сколтехе + последние 2 года председатель комиссии дипломов в ИТМО.

Какие наблюдения:

1. Этот ваш ИИ рулит. Людей, которые пишут дипломы сами остается, похоже, совсем мало. Дипломы нынче генерируют.

2. Студенты дипломы не только не пишут, но и не читают. Текст сейчас вообще никто не читает, ни "автор" диплома, ни его научный, ни рецензенты. По крайней мере судя по косякам, которые легко находятся при беглом листании. А зачем? )

3. Придуманные названия статей, сгаллюцинированные авторы, сгаллюцинированные места публикации ловились везде. При этом понятно, что галлюцинации в источниках проще ловить, чем галлюцинации в тексте. В тексте они, конечно, есть, просто пока их массово отлавливать сложнее.

В картинках к посту приведены прикольные примеры забытых TODO агенту в ссылках))) Забавно было, когда у студентки в первой ссылке в работе был выкинут из авторов ее собственный научный руководитель (!) и еще 4 автора))) и вместо них поставлено 2 автора, включая руководителя другой лаборатории. 😂 Или в авторы добавлен LeCun))) Или, например, культовую статью "Attention is all you need" опубликовала Шеньженьская медицинская академия. Очень известная медицинская статья, кстати! Про внимание к текстам) 😂

Характерно, что в последнее время на А* конференциях ужесточили требования и за найденные галлюцинации статья автоматически получает Desk Reject, причем на самых жестких конференциях дополнительно еще и все авторы получают бан на 5 лет на публикации на этой конференции. Не любят А* конференции нейрослоп! Не любят!

А вот посмотрите ролик месячной давности как бедная и несчастная студентка Вышки плачет в камеру, поскольку ее отчислили за "перепутанные ссылки" в дипломе. И допускают к защите только через год! А ведь она уже переписала диплом! Еще бы! Это два промпта! Походу Вышка тоже очень не любит нейрослоп!

Старшее поколение справедливо замечает — но это же всегда в том или ином виде было! Они в чем-то правы. Вот только если раньше заказать диплом стоило 20-30 тысяч и занимало 2 недели, то сейчас это стоит 5 тысяч и занимает 2 дня. ИИ gamechanger на марше! Это кардинально сказывается на количестве студентов читавших свой диплом.

Но даже эти деньги студенты экономят, делая диплом за те же два дня с ИИ. И тоже не читают)

Как деликатно пишет коллега по комиссии в ИТМО из Физтеха Дмитрий Юдин:
У меня такой вывод, что защищавшимся ребятам, работающим в ведущих российских IT-компаниях, совсем не хватило времени написать нормальные дипломные работы!

А зачем? Они ведь уже работают!))) В чате к прошлому посту был шикарный скриншот вакансии Software Engeneer на $570K в год от Антропиков с милой припиской "Через 12 месяцев этой профессии может уже не быть". Но зачем учиться, когда сегодня вполне платят? Что может пойти не так? 😉 Я это разбираю в леммингах (часть "Трагедия профессии программист"). Но не все верят, что история повторяется)

Из забавного — я в качестве развлечения прогоняю дипломы через детектор AI Gen текстов. У Физтеха 13% (причем много около 0% и если один полностью сгенерированный диплом убрать, будет 9% в среднем), у Сколтеха 18%, а у ИТМО 38% (ВМК еще прогоню, там процент сильно от кафедры зависит))). В общем студенты, которые дипломы пишут сами еще есть. Это радует!

Глобально можно констатировать, что написание дипломов сильно упростилось и подешевело с ИИ. Как следствие, быстро падает процент студентов, способных формулировать длинные сложные связные тексты. А этот навык связан с умением читать длинные сложные связные тексты. Ну и плавно растет процент студентов, не способных ответить на простые вопросы по своему диплому.

Это обалденная новость для тех, кто прокачивается! Конкуренция для со стороны молодого поколения будет падать!

Работаем над прокачкой! 😁💪

Больше по тегу #education_now@vgcourse (тег недавно ввел, еще не все посты в него разметил, но там есть прекрасное)))

@vgcourse


Господа!

Пришло время переосмыслить канал и его название!

Когда я общаюсь частая история (особенно со студентами) — люди понимают, что прокачиваться надо, но не могут себя мотивировать на это. А ведь ровно этому, если вдуматься, канал во многом посвящен.

Ключевые тейки:

* На железе NVIDIA: Затраты на тренировку модели уровня GPT-4 на P100 в 2016 vs B100 в 2024 снизились в 525 раз за 8 лет (2,18 раза в год)

* На железе Google: цена за терафлоп FP16 у TPU v4 (2021) по сравнению с TPU v7 (2025) упала с $227 до $21. Это 1.9 раза в год.

Т.е. только за счет прогресса железа себестоимость инференса и тренировки очень быстро падает.

*
Уверенно вангуется увеличение энергоэффективности в 100 раз в ближайшие 5 лет (т.е. себестоимость электричества в 100 раз) и в 1000 раз за 10 лет.

* Также при быстром росте сложности LLM было накоплено много неэффективности, что привело к падению стоимости токенов в 2024 году до 900 раз, причем наибольшее снижение стоимости было для наиболее сложных запросов.

* При этом сложность успешно решаемых задач также быстро растет — примерно в 2 раза за полгода (тык, тык, тык). Напомню, было ИЗМЕРЕНО УВЕЛИЧЕНИЕ ВРЕМЕНИ УСПЕШНО РЕШАЕМЫХ ЗАДАЧ БОЛЬШЕ, ЧЕМ В 16 РАЗ ЗА ГОД последние два года!

Как следствие, я ванговал год назад:
если тренды сохранятся, то условно через 6 лет в 1000 может вырасти сложность успешно решаемых задач, при этом одновременно в 200 раз упадет стоимость решения аналогичной задачи [...] Звучит, как фантастика, но основания для сохранения тренда есть. ✌️


🤩 ➡️ Больше на тему по тегу #speed_of_progress@vgcourse

* Как следствие, все больше людей платит за модели. Доходы Антропик росли с $100 млн в 2023, $1 млрд в 2024 и $10 млрд в 2025 🤩

* А зарплаты в области улетели в космос. 🚀 Отдельно я разбирал состав Superintelligence team, где на 30 Research Scientist 29 с PhD и двое выпускников МГУ (с ВМК и Мехмата) + разбирал число А* статей у них.

* При этом все больший процент студентов меньше учится. Мой пост про ноотропы, микронаушники, домашки с LLM и прочие достижения прогресса причины не учиться стал вторым по прочтениям среди всех постов прошлого года 🤷‍♂️

* Одновременно соотношение вакансий с резюме в IT быстро падает на HH и на рынке труда холодает 🤷‍♂️

🤩 ➡️ Больше по тегу #winter_is_coming@vgcourse

* При этом, я наблюдаю серьезный всплеск желания прокачиваться у старшего поколения (которые ближе к "за 30"), но их поджидает страшный зверь нейропластичность — с возрастом способность изучать более сложные вещи падает, и даже в интервале 5 лет это хорошо заметно, а уж 10... (25, 35, 45, 55 — огромная разница)

🤩 ➡️ больше по тегу #neuroplasticity@vgcourse

* Ну и последний аргумент наши успехи, когда я пишу про очередного нашего третьекурсника, затащившего А* первым автором

🤩 ➡️ Больше по тегу #our_successes@vgcourse))) Надеюсь это тоже кого-то мотивирует!

* И полезная (или интересная) информация с конференций, например, когда у нас 2 рецензии совпали (самый популярный пост прошлого года), или когда ответ рецензентам превысил длину статьи (и статья зашла в итоге)! Как вообще выглядят топовые конференции сейчас, какие они проблемы испытывают и как меняются.

🤩 ➡️ Больше по тегу #pro_conferences@vgcourse

В общем — меняем название канала на VG: VideoLab & Self-Motivated Learning и дальше агитируем людей прокачиваться, пока другие агитируют расслабиться (ибо завтра чтобы работать будет достаточно скомандовать свою задачу агенту, да-да! 😁)))

А через некоторое время посмотрим на результат!

Продолжаем движение! 😁

@vgcourse


Господа!

Интересное развитие старой истории.

Я несколько лет делаю доклады на крупнейшей индустриальной конференции по вещанию видео в России VideoTech, где обычно рассказываю про наши новые результаты в области метрик качества видео. У нас крупнейший в мире датасет и бенчмарк метрик качества сжатого видео и там таки есть, о чем рассказать.

Осенью 2024 года на вечерней дискуссии, когда я в очередной раз к слову толкнул про важность измерения качества в контексте обсуждавшейся проблемы, сотрудник одного российского онлайн-кинотеатра поднялся и в ответ толкнул спич о том, что измерение качества лишняя операция в пайплайне. Российские сервисы — это бизнес. В бизнесе главная метрика — это деньги. Если пользователи не отписываются — значит качество нормальное. Шах и мат этим всяким вашим метрикам!

Нет, в принципе я и до этого знал, что российским компаниям это не очень актуально. Ибо Netflix качают наши датасеты и предлагают дружить по частным вопросам, YouTube Media Algorithms Team не только качает, но и просит закрытой частью делиться, китайские компании не только качают, просят, но и контракты предлагают (надеюсь проблему с некрупными бизнес-платежами с Китаем в ближайшее время порешают). И только российским сервисам оно не нужно (уже не всем, кстати). Но менеджмент в стиле АвтоВАЗа ("Можно, а зачем?") прям вот невольно постоянно вспоминается.

Короче! В мае 2025 года мы выпустили сравнение видеохостингов, где показали что в рамках одного стандарта (H.264) RuTube проигрывает YouTube примерно в 2 раза по потоку при том же качестве (разница с AV1 больше!) + показали несколько существенных проблем кодирования, которые будут приводить к фризам у пользователя при деградации канала связи. Понятно, что исправить это можно. Но зачем? 😉

Дальше 1 октября было выпущено сравнение онлайн кинотеатров, где было показано, что максимальная разница между Netflix и российскими кинотеатрами В СРЕДНЕМ достигает 11 раз (по размеру при том же качестве). Т.е. в Netflix вы можете посмотреть сериал, когда при том же качестве в российском кинотеатре вы посмотрите только одну серию. Особенно это актуально при просмотре с мобильного интернета (в метро, на даче), когда вы платите за траффик. Впрочем, если вы не отписываетесь, значит вам все ок, не так ли? 😉

По итогам этих двух сравнений и резюме ежегодного сравнения кодеков мне дали слот единственно пленарного доклада VideoTech 2025 (единственный, который читался без параллельных потоков) и я прочитал злой доклад. 😉

А потом написал злой пост на хабр, который набрал +225 хабролайков (оч много) и вошел на 1 место в топе дня, недели и 4 место в топе месяца на #Habr. 😁💪

Короче!

Сегодня ночером
этот пост взял Технотекст (премию за лучшую статью Хабра) в номинации "Информатика и алгоритмы". Йееее! 🥳

Пока я 3 раза участвовал в конкурсе и все 3 раза брал Технотекст. Надо продолжать! 😁

Параллельно мы продолжаем (и даже расширяем!) работу в этом направлении! И в этом году планируем опубликовать обновленное сравнение видеохостингов (с добавлением китайских сервисов, которые выступили вы прямо не поверите насколько шикарно), сравнение онлайн-кинотеатров (с добавлением топовых американских) и сравнение систем видеоконференций (как они работают с парковки в сравнении с западными, ну вы поняли). 😉

Также этот год будет тестовым в плане того, насколько эта работа нужна российским сервисам. Я наблюдаю очень хорошее понимание со стороны технарей, но вы себе не представляете, как много вышестоящих менеджеров рассуждают в стиле "можно, но зачем?", которым точно проще договориться с РКН, чем выделить больше денег технарям. 🤷‍♂️ А платить за это будете вы своим мобильным траффиком как минимум (вы заплатите больше, бизнес потратит на технарей меньше — это двойной профит). Готовьте ваши денежки на годовой бонус менеджерам за эффективное повышение маржи!) 🤑

В общем — продолжение этой увлекательной истории следует!

Stay tuned! 😉

#our_successes@vgcourse
@vgcourse


Господа!

Наш бакалавр Сергей Муравлев съездил в солнечную Барселону на IEEE International Conference on Acoustics, Speech and Signal Processing 🙂! Это Core B, но в обработке сигналов она в гугловом рейтинге аж на 3 месте (и первая среди конференций, целятся в А))) Да, у нас есть бакалавры первые авторы А* (уже трое, список растим), но так тоже неплохо.

Слово герою нашего репортажа:
Конференция ICASSP 2026 происходит в международном крутом конфенц зале CCIB на берегу моря, так что вообще ощущается как курорт)).

Барселона! Это ж курорт! 🤷‍♂️😁

Сразу скажу, что конференция (по моим меркам) большая, но большая часть статей не по нашим темам. По кодекам, суперрезу, image restoration, saliency вообще почти ничего не видел. Но зато достаточно много по атакам, так как у конференции есть фокус в security, поэтому в основном общался об устойчивости.

Так и надо! 🙂

Китайцы продолжают захватывать конференции! Теперь переходят даже на малюток типа icassp, иногда доходит до абсурда. Кажется, что их было процентов 80 от участников. Даже бывает, что толпа просто говорит на китайском, а европейцы и индусы в недоумении)). Но вот тут очень помогает о чем я писал с wechat-ом, они сразу начинают улыбаться и разговаривать по-другому (один товарищ вообще, когда услышал, что у меня есть wechat и что я из России, спросил играю ли в counter strike и за кого болею)))). В итоге получилось добавить с десяток разных ребят, и паре потом ещё писал.

Они живут в вичате) У них даже для компании иметь страницу в вичате намного важнее, чем сайт))) Ну и что "китайцы захватят мир" (как минимум научный), это уже точно 🤷‍♂️😁

Заметил очень интересную тенденцию, которая меня сильно огорчила. Есть два варианта диалога с презентующими постеры: автор разбирается, но объясняет, что статья старая/плохая/чисто чтобы подать, и его сердце в другой работе, которая идёт на A* (ну как у нас по сути); или презентующий на самом деле второй автор с конца, который ничего о статье не знает, но его отправили, как козла отпущения, чтобы статью опубликовали. Второе очень популярно в китайских лабах, где 50% бедолаг, с которыми я хотел завести диалог, мне прямо говорили, что о статье особо не знают 🫩.

На А* с этим получше, но такая проблема тоже есть, да.

Моя основная обязанность – презентация доклада длиной 20 минут. Времени мало, учитывая вопросы аудитории, но с учётом скоупа статьей – нормально. У меня была сессия, связанная с цветом, я выступал первым. В целом, преза у меня была готова до вылета, и текст я прогонял перед семьёй и гпт с режимом голоса (только он любит говорить, когда ты делаешь паузу в диалоге, поэтому нужно рассказывать без остановки, но с какими-то вещами помогает), потом ещё посвятил один вечер и утро подготовке. В день перелета обнаружил что, у меня не осталось ни одной нормальной рубашки для презентации)))), поэтому в первый день там я купил хорошую белую рубашку, теперь будет, как сувенир.

Зачет по всем пунктам! 👍)))

Тут стоит наверное упомянуть, что мне орги ни разу не ответили на мои письма за последние пол года, и организация была не очень. Поэтому я не очень удивился, когда пришло время нашей сессии, а chair of presentation session не пришел😃.

Же-е-есть! 😲 Вообще до такой степени — это редкость)

Никто не знал, кто он (даже предыдущий chair и технический помощник). А там все презентующие кроме меня – китайцы, которые вообще ничего не понимают. В итоге прошло 10 мин с начала, и я решил что никто так и придет, и организовал процесс сам.

😂🤣😂 Огнище! ) 🔥🔥🔥 Так и надо! Забрать микрофон и провести! Класс! 💪🙂👏

Сама презентация прошла нормально. Мне кажется, что у меня уровень английского нормальный (особенно в сравнении с китайцами, которые все читают с заметок), и во время уложился даже с парой вопросов. Но честно, лучше бы мне поставили постерную сессию, потому что аудитория в основном из выступающих. Но в качестве опыта презентации полезно.

Желать себе poster вместо oral — забавно) Это же отличный опыт, особенно организация сессии! 😂

Продолжаем прокачку молодежи! 😉

Stay tuned! 😁

Больше про конференции:
#pro_conferences@vgcourse

@vgcourse

Показано 20 последних публикаций.