DLStories


Гео и язык канала: Россия, Русский
Категория: Технологии


Что-то про AI Research и AI образование от Танечки
Сотрудничество/предложения: @atmyre

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


В июне, перед тем как уехать на ICML, а потом на подготовку к IOAI, я была учеником на школе ARENA (Alignment Research Engineer Accelerator). Это что-то вроде технической программы по AI Safety. Как я писала выше, я занимаюсь AI interpretability, что довольно сильно связано с AI Safety. Поэтому я пошла на ARENA, чтобы получше понять, что там происходит внутри AI Safety коммьюнити, познакомиться с людьми, которые делают рисерч по теме interpretability, и, возможно, найти себе fellowship или работу.

В итоге у меня сложилось довольно неоднозначное впечатление про коммьюнити AI Safety, но об этом как-нибудь потом. Пока что хотела написать вот о чем: ARENA длилась 5 недель, и в последнюю неделю мы в парах делали небольшие рисерч проекты. В итоге у меня и моего коллеги проект получился достаточно хорошим, с явными результатами, и поэтому мы решили немного его доделать и написать статью на воркшоп.

Ниже кратко опишу, о чем статья, а еще дам ссылку на HF daily papers, куда я ее сегодня выложила и теперь хочу лайки 🙂

Итак, статья: When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

Activation Oracles (AO) — это языковые модели, обученные отвечать на вопросы о внутренних активациях другой модели на естественном языке. То есть, это один из подходов анализа активаций моделей, который выдает инфу в виде текста на естественном языке. У модели AO по сути спрашивают "о чём это скрытое состояние?", и AO генерирует ответ. Теперь: пусть у вас есть LLM, в которой есть какая-то скрытая информация — например, backdoor, скрытая цель или знание. Тогда естественно было бы предположить, что если обучить AO на активациях именно этой модели, то он хорошо научится считывать ее внутренние состояния и сможет легко найти эту скрытую информацию.

Так вот, в нашей статье мы показываем, что в реальности может получиться ровно наоборот. Мы взяли пять разных концептов и дообучили LLM скрывать эти концепты. Потом обучили AO на активациях этих моделей. Оказалось, что AO, обученный на активациях модели X, начинает хуже "видеть" именно тот концепт, который скрывала модель X. При этом если этому же AO скормить активации другой модели Y, то он хорошо распознает концепт, который скрывает Y.

Короче, вывод: в некоторых случаях обучение инструмента интерпретации (например, AO) на данных той самой модели, которую он должен интерпретировать, может сделать его систематически слепым именно к той информации, которая содержится в этой модели.

Ссылки:
Статья
HF daily papers (вот тут можно поставить лайк!)


7 золота, 1 бронза и абсолютное 1 место у Артема Горохова 🎉

Новость: https://cu.ru/tpost/4ib9ed5o01-shkolnaya-sbornaya-rossii-tretii-god-pod

7.1k 1 48 14 274

В последнее время количество хороших новых статей растет огромными темпами, и уследить за всем интересным даже в пределах одной области становится супер сложно.

Я уже перестала пытаться, честно. Даже на ICLR/ICML, где я недавно была, количество потенциально интересных мне статей было слишком большим, чтобы нормально все просмотреть и со всеми пообщаться (и еще успеть у своих постеров постоять). Из-за этого еще более полезными становятся мероприятия, где умные люди выделяют из нового ресерча главное, структурируют и подают в доступной форме.

13 августа Яндекс проводит ML Global Recap H1 2026 — мероприятие, где эксперты разберут несколько важных тем из мирового ML за первую половину года. Акцент будет на идеи, которые уже начинают менять индустрию.

В программе — нетворкинг, дискуссии и доклады руководителей разных команд Яндекса:
• Tabular DL — про это расскажет Артём Бабенко, руководитель Yandex Research;
• Тренды и вызовы в ризонинге — разберёт Дмитрий Мокеев, руководитель группы качества претрейна Alice AI в Яндекс Поиске;
• Новые подходы и стандарты в оценке качества моделей — представит Иван Дёгтев, руководитель аналитики Alice AI LLM в Яндекс R&D;
• Оптимизация LLM-инференса — расскажет Андрей Бежин, руководитель службы ML-инфраструктуры в Яндекс R&D.

Встреча пройдет 13 августа — можно присоединиться очно в Москве или онлайн.

🔗Регистрация — по ссылке. Регистрация закроется завтра, 7 августа в 18:00
#промо


Репост из: Жизнь и датка
Паблик ЛБ. Ждём приват!

https://ioai.artix.tech/ioai_2026_estimations.html


Опа
(Мы уже сказали детям, что с них налог)

6.6k 0 13 15 56

Репост из: Дайте шуму
AGI


Последние три недели я провела в Москве на сборах перед межнаром IOAI, а сегодня мы прилетели в Астану на сам межнар. Основные индивидуальные туры будут 4 и 6 августа, а пока что, как видите, фоткаемся и бегаем от комаров (они тут очень жёсткие)


В итоге рекорд из 10 попыток — 9.6 секунд на сборку. Среднее значение — что-то вроде 78-80 поворотов/10 секунд на сборку. Для каждой попытки из зала вызывался человек, который либо кнопками вручную, либо с помощью случайного генератора (либо и так, и так) запутывал мегаминкс, затем полученный стейт подавался на вход алгоритму, который искал решение, и затем это решение реализовывалось роботом.

На видео:
1) Как человек собирает мегаминкс (тут сборка за минуту 40 секунд)
2) Как работает пайплайн
3) Одна из 10 попыток сборки: запутывает мегаминкс тут Леша Колегов — один из членов сборной этого года на IOAI (собственно, мы приехали смотреть на мегаминксы с ребятами из команды, с которыми у нас сейчас сборы перед IOAI в Москве)


Приехала на Физтех, где сегодня собираются ставить рекорд по сборке мегаминкса роботом. Правда, выяснилось, что рекорд будет только в 19:00 (а всех звали к 17:30), поэтому пока что сижу работаю. Что ж, посмотрим, поставят ли)

На фотке, как я понимаю, магаминкс в самом роботе, который будет его собирать, и сами разрабы, которые его к рекорду готовят


- я и постер (забыла попросить кого-то сфоткать)
- я, постер и мой бывший коллега из российского Huawei
- афтепати с коллегами после

7.3k 0 23 9 152

Я на ICML в Сеуле, и тут на main conference аж две мои статьи, чем я очень горжусь! Но и это еще не все, еще две статьи — на MechInterp воркшопе, который будет 10 числа. И сегодня уже через пару часов буду стоять у постера одной из статей (если мне его таки распечатали))), поэтому приходите в HALL A #2606 в первую постерную сессию посмотреть на меня и помочь толпой сделать вид что статья популярна, хах

Статья: MidSteer: Optimal Affine Framework for Steering Generative Models (arxiv link)
Это — вторая моя статья по теме representation engineering, и первая попытка уйти от чисто эмпирического рукомахательного рисерча и сделать что-то более математически/теоретически обоснованное.
История такая: как я писала раньше, первой моей статьей по этой теме была CASteer — steering-метод для удаления концептов из активаций диффузионной модели. В CASteer стиринг для удаления применяется довольно наивно, без нормального теоретического обоснования, только что-то вроде "ну вот у нас есть linear representation hypothesis, поэтому логично двигать активацию в сторону анти-стиринг-вектора, и давайте подвинем именно на такой коэффициент потому что такая трансформация сохраняет норму". После того, как я доделала CASteer, мне захотелось понять, как делать стиринг для удаления более фундаментально, т.е. можно ли вывести в некотором смысле лучшее преобразование для удаления концепта из активации.

Оказалось, что для задачи удаления такое уже существует. Это статья LEACE: Perfect linear concept erasure in closed form. В ней выводится в некотором смысле лучшее линейное преобразование для удаления концепта из векторов-активаций моделей. Но применяется это в статье только для активаций, которые были получены из модели типа BERT и потом применяются для решения какой-нибудь downstream задачи классификации. То есть, метод не применяли на активациях LLM/диффузий, чтобы влиять на их генерацию.

Разобравшись с LEACE, оказалось, что обычный activation steering для удаления концептов из активаций, который делается оргононализацией активации к стиринг вектору — это просто частный случай LEACE. То есть, обычный стиринг == LEACE в предположении о том, что матрица ковариаций активаций слоя единична, и среднее активаций равно нулю. Тут у меня возник вопрос, а почему тогда в статьях по стирингу не используется LEACE. Тут два предположения: 1) для LEACE надо считать матрицу ковариации слоя, что долго и дорого 2) как писала выше, статья LEACE не тестирует метод на генеративных моделях, и, возможно, поэтому о LEACE просто мало знают те, кто стирят LLMки

Хорошо, стиринг для удаления — частный случай LEACE. Давайте теперь попробуем сделать что-то новое. Например, попробуем решить чуть другую задачу — не удаления концепта из активации, а перевода одного концепта c_1 в другой c_2 (concept switching). Например, c_1=котик, c_2=песик, и тогда цель — чтобы LLM/диффузия генерили текст/картинки с песиками вместо котиков, если в промпте при этом просят котиков. И, как и в LEACE, скажем, что преобразование должно быть линейным и в некотором смысле "оптимальным". Оптимальность в данном случае задается как "минимальное изменение вектора активации при условии изменения концепта c_1 -> c_2".

Оказывается, такое "оптимальное" линейное преобразование для concept switching можно вывести. Более того, есть даже два варианта. Первое очень просто получается из LEACE изменением коэффициента, но у него есть недостаток — при применении оно меняет c_1 c_2 в обе стороны, т.е. вместо котиков вы получите песиков, и наоборот. А второе — новое, которое меняет c_1 -> c_2, но не наоборот. Вот это новое преобразование для concept switch (теорема и результаты экспериментов) и есть главное novelty статьи.

В итоге главные моменты статьи:
• Cтиринг для удаления концептов — частный случай LEACE
• Оптимальное линейное преобразование для concept switch (случай c_1 c_2) — следствие LEACE
• Новая теорема и эксперименты: оптимальное линейное преобразование для concept switch (случай c_1 -> c_2) — MidSteer

Ссылки:
Статья на arxiv
Alpharxiv (тут можно поставить лайк)
GitHub (а тут звёздочку 🥺)


В феврале, прямо перед поездкой в Словению на межнар, приходила к Виктору Кантору на подкаст. И вот пару дней назад он наконец вышел — ссылки на посмотреть тут

Поговорили немного про рисерч, про DLS, олимпиады, и мотивацию этим всем заниматься. Возможно, говорили про что-то еще, но я этого уже не помню)


У нас с Егором вышла новая статья про стиринг, а ну ставьте лайк на HF daily papers 😠

Вообще за последнее время у меня приняли несколько статей, и вышли ещё несколько новых статей, но никак не могу про это все написать 🫠 (отчасти потому, что работаю над этими статьями, хех)


Репост из: Aparin
Чаще всего стиринг активаций LLM реализуют как параллельный перенос активаций вдоль предпосчитанного вектора концепта (стиринг вектора). Такой дизайн исходит из гипотезы о локальной линейности множества активаций LLM. Но недавно вышли работы, которые критикуют такой подход, заявляя, что при линейном стиринге сильно меняется норма активации, а это выводит активацию в out-of-distribution, что ломает модель. Предлагаемая альтернатива — сферический стиринг, который сохраняет нормы активации, только поворачивая их в сторону вектора концепта на некоторый угол

Но сами гипотезы, на которых строится этот подход (что активации лежат на сфере, а норма для концепта не важна), эмпирически не проверялись. Мы с Таней решили закрыть этот пробел: построили фреймворк, объединяющий сферический и линейный стиринг в один общий класс методов, и выделили норму и угол вектора как два интерпретируемых параметра (вместо одного, неинтерпретируемого, в линейном стиринге)

Оказалось, что активации не лежат строго на сфере, а норма всё-таки важна для стабильности генерации, и опираясь на это мы предложили новый метод, совмещающий сильные стороны обоих подходов

Полный обзор написал в [телеграфе]

Если вам понравилась статья, поддержите её классом на huggingface daily papers, чтобы больше людей её увидело :)

[arxiv]


В этом году позвали в программный комитет Practical ML Conf. Мы вместе с авторами @lovedeathtransformers, @boris_again, @tech_priestess и другими людьми будем отбирать доклады и делать так, чтобы программа конфы получилась интересной и качественной. Говорят, в этом году подали больше докладов, чем в прошлом, и доклады в среднем тоже круче.

Конференция будет 19 сентября 2026. А пока еще можно подать на нее доклад — дедлайн подачи уже 1 июня (включительно). Тематика такая:

Мы ждём глубокие технические доклады об ML-технологиях, которые уже сейчас приносят пользу для бизнеса.
Мы отбираем доклады, исходя из четырёх основных критериев: польза и новизна для сообщества, применимость на практике и хардовый уровень сложности.


Более подробно про подачу докладов — тут. Подавайте доклады, рассказывайте о своем рисерче/работе! (а мы ее рассмотрим 😃)

Подать доклад тут


Нина подаётся на Yandex ML Prize как руководитель DLS. Там для заявки нужны несколько отзывов студентов, которые проходили курс. Если вы проходили DLS, вам понравилось, и вы хотите поддержать DLS, Нину и всех нас, напишите мне, пожалуйста

P.S. Вроде набрали 10 человек, спасибо вам большое 🥰


Так вышло, что теперь у нас не три, а четыре дня NeoAI, и сегодня тоже есть тур

Он начнется вот-вот, вот ссылка на трансляцию.
А ещё у нас есть живой лидерборд!

Туры сегодня и завтра уже не международные, поэтому на лидерборде по новым задачам будут только кандидаты в сборную

Приходите смотреть трансляцию, там будет про задачи в том числе)


А я тем временем уже снова в Москве (точнее, в подмосковье), где завтра (3 мая) стартует NeoAI — Northern Eurasian Olympiad on Artificial Intelligence. Это AI олимпиада, которую мы проводим как основной отбор в сборную на межнар IOAI, но в этом году в ней удаленно также могут участвовать и другие страны.

Всего будет три дня контестов по три задачи (3, 4 и 6 мая). Сережа (один из тренеров) решил взять у ICPC идею и сделать трансляцию олимпиады. И будет не просто трансляция из зала, а еще разговоры с разными людьми вокруг AI соревнований: как было раньше, как есть сейчас, и куда все это катится как это все будет выглядеть в будущем

В посте Саши — спикеры на все три дня и подробные темы. А вот ссылки на прямые трансляции всех дней:
Первый тур (3 мая 10:00 - 16:00)
Второй тур (4 мая 10:00 - 16:00)
Третий тур (6 мая 10:00 - 16:00)

7k 0 17 4 56

В DLS делают очень интересную штуку — летнюю смену по AI для школьников 8-10 классов. Это типа летний лагерь, как по олимпиадной математике/проге, но только по ИИ!

Смена пройдет 3-13 июля в экопарке «Бобровый мыс». Учеба будет довольно плотной: 4 пары в день и работа над проектом. Программа начинается с математики для ML, основ ML, CV, NLP. Участники смены будут разделены по уровню подготовки, поэтому смена подойдет как новичкам в AI, так и студентам с обширным опытом.

Организация и программа делается людьми, которые хорошо понимают в програмах и образовании по олимпиадной математике и AI. Руководитель смены — Валерия Набатова, тренер сборной Москвы по ИИ и один из менеджеров DLS.

Для участия в смене необходимо зарегистрироваться на сайте и пройти отборочный контест до 9 мая (контест доступен в течение пяти дней после регистрации, но не позже 9 мая 23:59 Мск).

Участие в смене платное, для олимпиадников предусмотрена скидка. Больше информации о смене и программе читайте на сайте:
📎 Сайт
📎 Регистрация (открыта до 9 мая 23:59 Мск)
Если остались вопросы, спрашивайте под постом DLS о смене тут

Показано 19 последних публикаций.