Наталия Поварова | Думаем об ИИ и людях


Гео и язык канала: Россия, Русский
Категория: Технологии


Неспеша разбираем, как связаны ИИ, человеческие мозги и наше общество. Для людей без технического образования, которых не устраивают чёрно-белые ответы
https://www.linkedin.com/in/nataliia-povarova-b23871162/
https://substack.com/@nataliiapovarova

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Не так давно придумали, как языковые модели сделать ещё эффективнее.

Правда, с этой новой идеей есть сложности: она делает модели менее прозрачными и контролируемыми


Искусственные нейросети в процессе обучения могут терять способность учиться — пластичность, — но есть идеи, как это исправить

▶️Этот феномен подробно изучали авторы статьи “Loss of plasticity in deep continual learning”.

Нейросети сначала обучают на больших массивах данных, потом на конкретные задачи натаскивают на наборах поменьше, специально отобранных, потом фиксируют текущее состояние и выпускают. Набирают ещё данных, проводят ещё раунд обучения, выпускают новую версию.

Хорошо бы, чтобы они могли продолжать обучаться постоянно, получая новые данные в работе с пользователями, но не выходит: в какой-то момент они теряют эту способность.

Помимо того, есть ещё проблема “катастрофичного забывания” (catastrophic forgetting), когда нейросеть перестаёт правильно решать задачи, с которыми раньше справлялась.

▶️Авторы “Forgetting, plasticity, and co-observation: a third facet of continual learning” считают, что дело (во всяком случае, отчасти) в самом формате обучения.

Обычно данные передают последовательно, как я описала выше: накопили немного данных — провели новое обучение на новых данных (старые не трогали). В результате у модели не формируются связи между старыми данными и новыми.

Например, её научили распознавать написанные от руки числа от 0 до 9 и делить их на чётные и нечётные. Потом дали второй набор данных и научили делить числа на те, что больше пяти и те, что меньше.

И ещё во втором наборе картинки с числами были намеренно искажены, и модель учили распознавать числа на искажённых картинках.

Потом дали ей искажённые картинки и поставили задачу делить числа на чётные и нечётные, и она не справилась, потому что училась решать эту задачу на чистых картинках.

Поэтому, говорят авторы, надо давать все данные сразу: так и забывания не происходит, и пластичность сохраняется, и связи между старыми и новыми данными настраиваются.

▶️В “Loss of plasticity” писали, что нейросети теряют пластичность, потому что их нейроны становятся менее разнообразными.

То есть, они уже адаптированы под первый набор данных, и некоторые нейроны на следующих наборах участвуют в обучении меньше: они обрабатывают данные, и на выходе получаются маленькие числа, которые мало влияют на последующие изменения.

На втором наборе некоторые другие нейроны тоже стали меньше, то есть, коэффициенты в формулах стали такими, что очень слабо меняют входные данные.

На третьем наборе они тоже будут влиять на обучение меньше. И так далее, пока не останется небольшое число нейронов, которые определяют результат. Поскольку их мало, они уже под новые данные не могут подстроиться*.

▶️В “Forgetting, plasticity, and co-observation” похоже получилось: если все данные передать разом, пластичность страдает меньше, чем если передавать их по кусочкам.

То есть, когда мы собрали новых данных, надо устраивать обучение заново на всём массиве, чтобы все нейроны с нуля перенастроить.

Но на практике это дорого, поэтому есть промежуточные подходы: можно сбросить часть выученных настроек или проводить новое полноценное обучение не каждый раз, а когда данных побольше накопится.

▶️И ещё кое-что может помочь — внешняя память. Авторы статьи “When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents” говорят:

“У нас же есть ИИ-агенты, а у них есть доступ ко внешним хранилищам с данными. Может, и не надо их каждый раз переобучать?”

Здесь есть подводные камни. В частности, ограничен объём текста, который агент может за раз обработать (контекстное окно). Если он достанет из памяти лишнюю и ненужную информацию, он с задачей не справится.

Но если грамотно организовать память и хранить там не конкретные инструкции, а обобщённую информацию, агенты справляются гораздо лучше, так что, возможно, это выход.


* Там есть и другие механизмы, я очень сократила изложение




🥤Сегодня хочу немного отвлечься от ИИ и всего, что происходит вокруг, и рассказать вам про книжку, которая мне очень понравилась — “Купание в пруду под дождём” Д. Сондерса.

🖤Степень моей любви к ней можно оценить по количеству закладок, из которых вам на фотографии видно только половину.

Джордж Сондерс — преподаватель Сиракьюсского университета, у которого там есть курс русской литературы для начинающих писателей; на курсе он разбирает короткие рассказы Чехова, Л. Толстого, Тургенева и Гоголя. И так их любит, что написал вот про них.

🖤Я тоже очень люблю эти рассказы, поэтому сначала была в сомнении: сможет ли человек, который не вырос на русской классике и не читал ни одного произведения в оригинале в полной мере ими проникнуться?

Смог.

Да ещё так смог, что меня от этой книги было за уши не оттащить. И, надо сказать, я много нового узнала про свои любимые рассказы и смогла взглянуть на них с неожиданной стороны, хотя сама-то как раз на русской классике выросла.

🖤Сондерс разбирает, к примеру, “Нос” Гоголя, “Крыжовник” Чехова и “Хозяина и работника” Л. Толстого. И ещё четыре рассказа, про которые я вам не расскажу, чтобы вам любопытно было.

Он их раскладывает медленно, вдумчиво, перебирает так бережно. И потом достаёт какой-то маленький кусочек и говорит вам: “Вы только посмотрите на это, Господи боже мой.” И вы такие: “Ого, и как это я раньше не заметила?”

А кусочек сияет всеми своими гранями, переливается и рассказывает свою историю по-новому, так, как вы её раньше не слышали, потому что не знали, что можно уметь так слышать.

🖤В общем, если вы ищете книгу, с которой вам бы хотелось ненадолго забыть про реальный мир, — вот она. Очень вам её советую.

И если вдруг поблизости от вас есть какие-то дети, которые как раз в школе проходят золотой век русской литературы, можете с ними тоже поделиться этой находкой. Особенно если они у вас спрашивают что-то вроде “Да зачем мне это?”

Я была бы рада прочитать эту книгу в свои школьные годы. У меня были прекрасные учителя русского языка и литературы, мне очень повезло. Но я всё равно была бы рада как можно раньше её прочитать.

📜 Вообще, если позволите поделиться, у меня есть глубокое убеждение, что Россия должна насыщать мировое пространство литературой: у нас отлично получается писать. Всё остальное — просто беда какая-то, а вот писать выходит как ни у кого другого.

Финтех ещё ничего. Но литература…

Ладно, балет тоже. Но литература!

#книги


Нас ждёт интеллектуальный коллапс

🔸Нужно беречь и распространять знание, а то с развитием ИИ мы его потеряем. К этому пришли авторы статьи “AI, Human Cognition and Knowledge Collapse”, которая вышла в феврале этого года.

Они построили модель процесса обучения и принятия решений, в которой ИИ может либо дополнять, либо заменить человека. Ещё разделили знания на общие и специальные.

▶️Общие знания — это знания о том, как работает окружающий мир. Например, если говорить об инвестициях, это знания о рисках и разных финансовых инструментах.

▶️Специальные знания относятся к конкретному человеку — какой у него горизонт планирования, какой риск он считает допустимым — или к конкретной задаче — как купить акции компании, как зайти на платформу, где происходит обмен.

Обычно люди, обучаясь, набирают все эти виды знаний. ИИ тоже. Проблема в том, что достаточно мощный ИИ (речь об ИИ-агентах, которые помогают принимать решения) в моменте может сделать человека эффективнее, а его решения лучше, но в перспективе помешать людям накапливать общие знания.

Общие знания нужны не только людям: сами ИИ-агенты тоже на них обучаются. Если люди не смогут накопить достаточно общих знаний, говорят авторы, будет коллапс, потому что ИИ-агентам взять этих знаний будет неоткуда.

🔸Почему люди не накопят достаточно знаний? Потому что поддадутся искушению отдать всю работу ИИ-агентам, если те будут достаточно хороши.

🔸Как люди копят знания? Они сначала создают специальное знание, а потом делятся с другими. Например, если я починила ошибку в программе, у меня появилось знание. Оно пока специальное и только моё. А если я написала про эту ошибку пост и выложила его в открытый доступ, это уже вклад в общее знание.

Личный вклад в общие знания всегда крошечный, но, когда его вносит много людей, знания накапливаются. ИИ-агенты же решают задачи, создавая специальное знание, но не делятся им и не создают общее знание, отсюда и коллапс.

Модель построена с учётом того ИИ, который у нас есть сегодня. Она не учитывает того, как он будет развиваться и какие появятся новые технологии: сделать такое предсказание с достаточно высокой точностью нельзя, и модель было бы неправильно на нём строить.


🔸То есть, читать статью надо так: авторы показали на математической модели, что чрезмерное доверие к ИИ и замена человеческой работы работой ИИ приводит к истощению, затем к исчезновению общих знаний.

Чем больше общих знаний и чем шире они распределены между людьми, тем лучше: решая собственные задачи каждый может опираться на общие знания и не переизобретать велосипед (колесо, электричество, палку-копалку, автоматическую отправку писем и всё остальное).

На накопленных общих знаниях можно продолжать обучать ИИ. Сейчас у нас знания заканчиваются: мы уже весь Интернет использовали. При этом мы все активнее используем ИИ и меньше генерируем общих знаний, и это нехороший путь.

🔸Авторы статьи задумываются о том, что можно было бы поступить с общим знанием так, как поступают с редкими видами животных: защитить, подрастить, отпустить. Они говорят, что можно где-то запретить использовать рекомендации ИИ и заставить людей создать общие знания, а потом ослабить запрет, когда знаний будет достаточно.

🔸На мой взгляд, запретительный подход сначала не сработает, а потом сработает в обратную сторону и даст нам всем по голове. Мне кажется, тут нужно не запрещать, а создать мотивацию для работников умственного труда — тех, кто зарабатывает переработкой знания и созданием нового знания. Это их (наша) задача — беречь и преумножать общее знание, чтобы другие могли пользоваться.

📒 Раз уж мы видим, что оно истощается, почему бы не заняться его воспроизводством? Авторы статьи вот занялись — написали статью. Можно брать пример


Механическое вскрытие для безопасности ИИ

Главы крупных компаний-разработчиков грозятся сотворить ИИ, который переплюнет человека, в ближайшие пару лет. Учёные, стоявшие у истоков ИИ, дают годы или десятилетия.

🔸В этом эссе собраны разные высказывания разных людей от Сэма Альтмана до Яна ЛеКуна. Они спорят о сроках и о том, что значит “переплюнуть человека”.

Однако они не спорят о том, что ИИ со временем становится всё более мощным инструментом. Оно и хорошо, но мощным инструментом можно наворотить много мощной фигни, сами понимаете. Поэтому нужно думать о том, как инструмент сделать стабильнее и безопаснее, а людей научить им пользоваться.

🔸Но сначала надо понять, как он работает: современные нейросети огромные настолько, что никто в душе не чает, что происходит внутри.

Люди просто пихают данные на вход, смотрят на выход, а потом пихают ещё данных на вход в надежде, что выход станет лучше. Это довольно грубое описание, но в целом верное.

🔸Мой любимый инструмент — кувалда механистический подход. Это когда мы берём большую сложную штуку, разбираем её по винтикам и смотрим, как что с чем связано. И потом ещё отдельные винтики крутим и смотрим, что меняется.

🔸В статье “Mechanistic Interpretability for AI Safety — A Review” авторы очень хорошим языком, очень подробно и системно расписали, какие есть способы заглянуть внутрь нейросети.

Она легко читается, и, если вы хотите познакомиться с областью, я вам её советую.

🔸Здесь достану некоторые из неё кусочки, чтобы вы могли решить, читать ли всё целиком.

▪️Разные объекты и идеи представлены в нейросетях иначе, чем у нас в голове. Можно внести в фотографию кошки небольшие изменения, которые человек не заметит, а нейросеть примет её за авокадо.

▪️Как и у нас, у нейросетей есть нейроны (только они устроены по-другому), и многие нейроны выполняют по несколько разных функций, например, некоторые нейроны одинаково реагируют на кошек и автомобили. Из-за этого их сложнее изучать.

▪️У нейросетей есть мотивы. И они определяют поведение. Только это мотивы не в смысле “мотивация”, а в смысле “повторяющиеся наборы параметров, которые объединены определённым образом”. Например, у моделей машинного зрения есть наборы параметров, которые отвечают за распознавание изогнутых линий. В нашем мозгу тоже такое есть.

▪️Возможно, большие языковые модели выросли достаточно, чтобы в их внутренней математике начала формироваться модель окружающего мира. То есть, там можно найти разные векторы, которые относятся к конкретным объектам и их свойствам, связанные между собой.

▪️В них это не закладывали, но из-за большого объёма внутренних вычислений и того, что текст описывает реальность, модели мира формируются сами. Иногда говорят, что ИИ — это первая технология, которую мы вырастили, а не построили (“AI systems are grown, not built”).

▪️Чтобы прояснить причинно-следственные связи между векторами, которые получаются у нейросетки в процессе обработки данных, и её ответом, можно залезть внутрь и заменить эти векторы на другие. Про этот подход у меня был пост; там про то, как в языковых моделях эмоции представлены.

📜 Очень много написано про языковые модели, но это не весь наш ИИ на сегодня. Я поищу похожие работы по машинному зрению: посмотрим, что там интересного




Что (не) рассказывают научные статьи

🔸Мы обращаемся к научным публикациям, когда хотим узнать, как ИИ работает и что он на самом деле может. Однако и здесь есть искажения, которые нужно держать в голове, чтобы не отрываться от реальности.

Начнём с того, что не все результаты исследований попадают в журналы. Это виднее всего на медицинских исследованиях, потому что они требуют заранее опубликовать протокол эксперимента, и можно сравнить его с публикацией по результатам.

▶️В большом исследовании 2004 года “Empirical Evidence for Selective Reporting of Outcomes in Randomized Trials” как раз провели такое сравнение.

Приведём пару находок:

▪️в 60% исследований по меньшей мере один побочный эффект лекарства или процедуры из протокола был пропущен в статье;
▪️в 92% исследований по меньшей мере один побочный или ожидаемый эффект не был описан полностью.

Некоторые эффекты не попали в статьи, потому что оказались незначимыми или просто не влезли в ограниченный журналом объём — то есть, это не какой-то злонамеренный обман. Однако же “эффект оказался незначимым” — это тоже полезная информация, и она потерялась.

Применительно к ИИ всё сложнее: это в медицине есть хотя бы протоколы, а в области компьютерных наук если что-то не опубликовано, то всё, об этом не узнать. Но можно предположить, что они страдают теми же проблемами, что и все остальные науки.

Одна из наиболее заметных — база для сравнения результатов. Отсутствие нормальной базы для сравнения. Любые результаты хороши или плохи в сравнении с чем-то: если выбрать слабого конкурента, ваши достижения будут выглядеть лучше, чем на самом деле.

▶️В 2019 году на эту тему вышла статья про рекомендательные алгоритмы — “Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches”.

Там авторы проверили 18 алгоритмов, из которых только 7 удалось воспроизвести. Из них 6 при проверке уступили более ранним методам, хотя заявляли собственное превосходство.

Воспроизводимость экспериментов — отдельная проблема. Их часто сложно повторить и проверить, и часто из-за того, что методика эксперимента не описана достаточно подробно.

▶️В работе “Weak baselines and reporting biases lead to overoptimism in machine learning for fluid-related partial differential equations” выяснили, что модели для решения дифференциальных уравнений их создатели тоже сравнивали со слабыми конкурентами, и в итоге получились завышенные результаты.

▶️И про языковые модели такое есть. Авторы статьи “Measuring what Matters: Construct Validity in Large Language Model Benchmarks” 2025 года изучили, как языковые модели тестируют на надёжность и безопасность.

Оказалось, не все вообще дают определение тому, что измеряют (но в основном дают определения), и что в большинстве работ используются искусственно созданные тесты, а не задачи из реальной жизни, и в итоге результат опять либо завышенный, либо просто неточный.

Только в 16% работ авторы как следует проверили собственные гипотезы, используя статистические методы.

Только в 53,4% работ уделили время доказательству того, что их тест подходит изучаемому вопросу.

🥤Что это значит для нас?

В первую очередь, что не всё написанное в научной работе доказано и теперь непреложный факт. Почти никто никогда не врёт намеренно, но все мы люди, и в научные статьи тоже закрадываются ошибки.

🔸Как минимум, после каждой громкой публикации имеет смысл подождать хотя бы пару месяцев, пока кто-то не попробует воспроизвести результаты.

🔸Как максимум, имеет смысл искать большие мета-обзоры, в которых собрано много статей. Или хотя бы искать несколько отдельных статей и смотреть, согласны между собой разные группы авторов или нет


📜 Небольшое объявление

Я решила немного изменить расписание публикаций. Раньше посты выходили в среду, пятницу и воскресенье, а теперь будут выходить в четверг и воскресенье – два раза в неделю вместо трёх.

Я опять учусь (расскажу много нового потом), а ещё хочу больше времени уделять редактуре (надеюсь, сделаю свои тексты лучше и интереснее).

Такие дела.

Завтра поста не будет, будет послезавтра, потом 13.09 и так дальше по новому плану.

Не теряйте ☕️




Как компании людей на ИИ меняли и что из этого вышло

📜 Я сейчас пишу посты не только себе на канал, но и на дружественный @iptech_fedorbatanov. Это временно: подменяю автора, который мне начальник и друг.

▶️Сегодня вечером, часов в шесть, там будет пост про то, как компании пытаются заменить сотрудников на ИИ и что из этого выходит. Это будет обзор разных исследований рынка труда.

Пока делала обзор, нашла парочку историй конкретных компаний. Дай, думаю, тут ими поделюсь.

▪️История 1: Klarna

Это шведская финтех-компания, она делает системы проведения платежей и решила посадить ИИ-агентов в техподдержку. Посчитали, что ИИ-агенты решают проблемы пользователей меньше чем за две минуты, в то время как людям нужно 11 минут.

Обрадовались, ясно дело, и не стали на места уходящих сотрудников (кто на пенсию, кто в другие компании — увольнений из-за ИИ не было, во всяком случае с их слов) нанимать новых. К середине 2024 года от 5 000 сотрудников в штате осталось 3 500.

⅔ всех чатов с клиентами вели ИИ-агенты, число повторных обращений сократилось на 25%.

У агентов был доступ к материалам компании, так что они могли оказывать помощь с пониманием контекста.

В мае 2025 компания всё-такие снова начала нанимать людей: ИИ-агенты закрыли много рутинных задач, но с более сложными случаями не справлялись.

В итоге у компании по-прежнему есть ИИ-агенты, но со сложными случаями работают люди, и так лучше получается, чем только с людьми или только с ИИ.

▪️История 2: Commonwealth Bank of Australia (Австралийский банк Содружества)

В 2025 году они сделали себе голосового помощника — тоже для поддержки клиентов, чтобы на звонки отвечал — и уволили энное количество людей (вот они именно уволили).

А потом резко вырос объём звонков, оставшиеся сотрудники не справлялись, и банку пришлось нанимать уволенных людей обратно. Через месяц. Короткий эксперимент вышел.

▪️Какой из этого вывод?

Да тот же, что мы повторяем тут из раза в раз: ИИ – это инструмент. Если им пользуются обученные и внимательные люди, всё хорошо, а оставлять его работать самостоятельно – так себе идея.

Вот такие дела.

➡️Заходите к @iptech_fedorbatanov за вечерним постом со статистикой увольнений и за кучей интересных постов про инновации


Языковая модель с калькулятором

🥤Мы уже говорили как-то, что для языковых моделей калькулятор сложнее Интернета (и почему).

🟤Обычно чтобы языковые модели могли считать, им дают доступ к калькулятору и обучают его использовать по необходимости. Большие коммерческие модели в целом уже неплохо справляются, хотя всё ещё с переменным успехом, а вот с маленькими открытыми всё немного сложнее (главным образом потому что они маленькие и из-за этого просто менее мощные).

🟤Сегодня посмотрим статью “IGC: Integrating a Gated Calculator into an LLM to Solve Arithmetic Tasks Reliably and Efficiently”, авторы которой предложили свой способ.

Они говорят: каждый раз вызывать калькулятор затратно, потому что это дополнительное действие. Использовать подходы вроде цепочки рассуждений тоже: больше токенов тратится, больше нужно вычислительных мощностей.

Поэтому, — говорят они, — мы хотим изменить саму модель.

🟤Один из способов изменить модель так, чтобы она получила новый навык — встроить в неё адаптер. Это такой отдельный модуль, отдельная маленькая нейросеть, которая решает конкретную маленькую задачу. Она обучается самостоятельно и встраивается в нейросеть побольше как её слой.

Авторы взяли этот принцип: вставили прямо в нейросеть калькулятор.

И тут есть нюанс: калькулятор не обучается. “Обучается” применительно к нейросетям означает следующее:

▪️дали на вход данные (картинку, текст или что-то ещё);
▪️данные превратились в векторы из чисел;
▪️векторы прошли слой за слоем, как-то меняясь;
▪️последний слой их превратил в человекочитаемый формат (картинку, текст, что-то другое);
▪️этот результат сравнили с правильным ответом, посчитали ошибку;
▪️информация об ошибке прошла обратный путь от выхода ко входу, меняя немного вычисления на каждом слое;
▪️и опять данные на вход, и так много раз.

С калькулятором не нужно вот это всё — ему нужны два числа и оператор между ними. Нейросеть работает с вероятностями: генерирует на каждом шаге несколько токенов и выбирает один, поэтому её ответ на один и тот же вопрос может немного отличаться. Поэтому она плохо считает. А калькулятор считает хорошо, и на один и тот же вопрос всегда даст один и тот же ответ.

В итоге получается, что векторы идут от входа к выходу и спотыкаются о калькулятор, который не работает с векторами. Ошибка идёт от выхода ко входу, и тоже спотыкается о калькулятор.

🟤Чтобы решить эту проблему, авторы обложили калькулятор обучаемыми компонентами.

На вход подаётся текст –> обучаемый модуль извлекает из него числа и оператор –> калькулятор считает результат –> другой обучаемый модуль кодирует результат в векторы и передаёт дальше.

У такого подхода есть ограничение: адаптер обучали и тестировали только на задачах, где числа записаны как числа, а не прописью: “3 + 5”, не “три плюс пять”. Второй вариант намного сложнее, авторы его себе оставили на будущее.

🟤То есть, пока именно этот вариант работает только с задачами, где арифметический пример прописан явно. И я не поняла, работали ли они с нецелочисленным делением и отрицательными числами — кажется, не работали.

🥤В любом случае, это интересный подход, и мы теперь знаем, как ещё можно улучшать языковые модели — вставлять в них специализированные модули. Очень интересно. Посмотрим, доработает ли кто-то (или сами авторы) этот калькулятор, чтобы он решал более сложные задачи




Как спать?

☕️Я села за этот пост в час ночи. Не то чтобы он так уж просился из головы на экран — у меня просто выбора не осталось. Мне так кажется. Потому что я не могу спать.

На меня напал какой-то ужасный, злобный кашель: я только лягу — он тут как тут. Я пробовала чай, мёд и леденцы. Представьте себе, я пробовала даже спать сидя, но и это в последние две ночи не спасает.

Надеюсь, к тому моменту, как эта записулька попалась вам на глаза, я уже побывала у врача и получила назначение. Надеюсь, в ночь перед публикацией я всё-таки спала и свежим взглядом наутро перечитала вот это всё. Над тем, чтобы эти надежды сбылись, я работаю.

☕️А пока мне скучно час за часом лежать и кашлять, поэтому я пересела за компьютер, чтобы рассказать вам о том, как победить бессонницу. Прошу оценить чувство юмора.

Я страдаю бессонницей уже не первый год. Кажется, всё началось с поездки в Екатеринбург в декабре 2023 года. Там было очень холодно, я заболела, сон разладился и так и не наладился до сих пор.

☕️Тогда я нашла лекцию сомнолога Михаила Полуэктова (которую я теперь ни за что не откопаю, простите), в которой он дал самый ценный в моей бессонной жизни совет: не можешь заснуть полчаса — вылезай из кровати.

Работать он не советовал: это будоражит нервную систему, а советовал читать книжку, заниматься йогой, вязать — в общем, делать что-нибудь расслабляющее. Потом опять попытаться заснуть. Не получилось за полчаса — вылезать.

Благодаря этому совету я прочитала, наконец, много отложенных книжек. И смогла вернуть сон, хотя он до сих пор иногда теряется.

Откуда же берётся эта сволочь бессонница?

🥜 Общепринятой, по всей видимости, стала теория трёх факторов (3P):

🟤Предрасположенность: есть врожденные отклонения в структуре мозга, которые повышают риск развития бессонницы. И это не одно нарушение, а несколько разных.

🟤Событие, которое впервые сильно нарушает сон: болезнь, как у меня, или острое переживание, например, смерть близкого человека. Первые несколько ночей, когда человек не может нормально спать.

🟤Поведение, которое закрепляет бессонницу: лежать в кровати часами, пытаясь заснуть, вредно. Листать соцсети, лёжа в кровати в ожидании сна, тоже вредно. Хуже становится.

И что делать?

С врождённой предрасположенностью, увы, ничего не поделать. Как и с событием-спусковым крючком: случилось уже. Работать можно только с последним из трёх факторов — с собственным поведением в кровати.

☕️И тут на помощь приходит когнитивно-поведенческая терапия. Я сначала удивилась, а потом поняла, что нет здесь ничего удивительного.

Дело в том, что когда мы лежим и пытаемся заснуть, наш мозг не расслабляется, а напрягается. А надо расслабляться. Хуже того, он, бедный, привыкает, что кровать — место для страданий. И всё: он не будет спать в месте для страданий — страдать будет.

Поэтому надо его переучить, и помогает как раз вылезти из кровати:

🟤Во-первых, вы утомитесь, и на следующую ночь вам будет проще заснуть.

🟤Во-вторых, вы проведёте несколько ночей без сна, и катастрофы не случится. Вы будете недовольны, но катастрофы не случится.

И это поможет вашему мозгу расслабиться, наконец, и заснуть.

☕️Теперь, когда вы всё это знаете, я надеюсь, сон ваш станет крепче, вопреки известной поговорке.

А мне посоветуйте книжек каких-нибудь, пожалуйста, а то я всё дочитала уже. Придётся, наверное, от безысходности писать теперь рабочий отчёт, да простят меня все те, кому его читать потом

P.S.: Автор этой восхитительной совы на картинке — якутский художник Николай Туди

P.P.S.: Мне выписали таблетки от кашля, и я всё-таки спала сегодня. Текст перечитала в здравом уме и твёрдой памяти


Скрытый способ защитить нейросети

🟤Если постараться, можно заставить нейросеть сделать что-нибудь вредное, например, влезть в чей-нибудь аккаунт и украсть данные.

Разработчики стараются такое заранее предотвращать: тренируют нейросети распознавать опасные запросы и не реагировать на них, но это довольно сложно.

Дело в том, что способов “взломать” нейросеть если не бесконечно много, то уж точно очень много, и все заранее не предсказать.

▶️Авторы статьи “Defending Against Unforeseen Failure Modes with Latent Adversarial Training” попытались понять, как это обойти, а мы сегодня посмотрим, что у них получилось.

▶️Идея у них следующая:

▪️Чтобы тренировать нейросети распознавать вредные запросы, обычно ей на вход дают комбинации из вредных запросов и “правильных” ответов на них (или комбинации вредных и безвредных запросов с пометками “вредный” / “безвредный”). Всё множество таких запросов не предугадать.

▪️Вредные запросы внутри нейросети запускают какие-то цепочки вычислений, которые дают на выходе вредный ответ. Эти цепочки можно найти.

▪️А раз их можно найти, давайте попробуем работать с ними напрямую.

🟤Это одна из форм соревновательного обучения (adversarial training, вот здесь писала о нём подробнее).

В соревновательном обучении есть две модели: нападающая меняет входные данные так, чтобы модель-генератор выдала по ним неправильный ответ.

Генератор обучается распознавать изменения и всё равно давать правильный ответ, а нападающая модель обучается делать изменения более незаметными.

▶️В “стандартном” формате нападающая модель вносит изменения именно во входные данные: картинку или текст. А в том варианте, который предложили авторы, изменения вносят в векторное представление картинки или текста.

То есть, генератор уже принял их на вход, превратил в векторы, и пошли математические преобразования. И тут на одном из этапов вносятся изменения.

Например, вектор [1, 0, 1] прошёл через преобразование и превратился в [2, 0, 2]. Мы его взяли, заменили на [2, -1, 2] и отпустили в следующее преобразование — то есть, испортили немного процесс. А модель должна всё равно на выходе дать ответ, который она бы получила, если бы мы ничего не трогали.


Здесь не нужно даже как-то специально стараться извлечь вредный ответ — можно просто заставить модель ошибиться и написать, к примеру, что на фото с кошкой изображена черепаха. То есть, атака неприцельная.

▶️Плюс подхода в том, что не нужно перебирать все возможные искажения всех входных данных, чтобы натренировать модель на них не реагировать.

▶️Минус подхода в том, что его сложно контролировать. Иногда вместо того, чтобы лучше распознавать изменения, модель учится лучше на них поддаваться, и сложно объяснить, почему.

🥤В общем, это интересное направление, и тут есть над чем поработать




Видео недоступно для предпросмотра
Смотреть в Telegram
☕️Сейчас будет пост моего нытья. У нытья нет особенной причины, просто я сижу простуженная и мне ничто в этом мире не нравится.

Я плохо спала, потому что меня будит собственный кашель — мне такое обидно. Я хочу хорошо спать и не сидеть потом на следующий день с тяжёлой головой, в которой есть сопли и нет ни одной мысли.

Мне пришлось в три часа ночи вставать и заваривать себе чай, потому что ничто кроме чая мне не помогает и меня не радует. Чай — единственная причина, по которой я в силах отскрести себя утром от кровати и худо-бедно функционировать в течение дня.

Кто-то спасается куриным бульоном, но мне не нравится куриный бульон. Конкретно сейчас мне вообще никакая еда не нравится, поэтому я ещё и голодная, и всё вокруг решительно осуждаю.

📒 Читаю вот книгу Норы Галь “Слово живое и мёртвое”. Отвратительно.

Во-первых, мне попалась какая-то чудовищно оформленная редакция, в которой иногда то пробелы посреди слова встречаются, то вместо таблиц текст идёт сплошняком и поди разбери, что к чему относится.

Во-вторых, мне не нравится её поучительный тон. Я когда такое вижу в свой адрес (в смысле, как читателя), сразу хочу ошибки у автора найти и позлорадствовать.

🟤И несмотря на это всё книга-таки полезная.

Галь приводит много примеров того, как в тексте можно заменить сложные конструкции с деепричастными оборотами на более читаемые и не менее изящные, а ещё примеры того, как заимствованные иностранные слова можно заменить на русские.

Если что, я не из тех безумцев, кто хочет менять “кеды” на “лапти”: языки постоянно друг друга обогащают, и это замечательно.

Но иногда попадается на глаза что-то такое: “…пайплайн с промптами… для оптимизации ассетов” (я взяла реальный заголовок полезного, на самом деле, поста и сократила его, чтобы выделить неудачные фразы).

Или иногда пишут так: “Использую LLM для (чего-то интересного)”. Иногда попадается (хотя уже реже, чем раньше) “AI-агент”.

В первом случае (с “ассетами”) сразу непонятно, о чём речь. В оставшихся просто как-то фраза некрасиво выглядит, не?

Ещё встречала “RL-обучение”. RL — это “reinforcement learning”, то есть, “обучение с подкреплением”. Не нужно второй раз писать “обучение”.

На самом деле, я тут никого не осуждаю, честно. Сам ИИ появился давно, но многие его технологии пришли в последние несколько лет, поэтому устойчивых переводов нет пока.

Для “обучения с подкреплением” есть очень устойчивый перевод. Но для многих терминов нет.

🟤Сама иногда сижу чешу затылок: придумаешь свой перевод, и читателю придётся играть в угадайку, чтобы найти оригинал, — оставишь без перевода, и читателю придётся играть в угадайку, чтобы понять, о чём речь.

Иногда вместо короткой фразы выходит два абзаца с пояснениями, потому что никак не сказать иначе. А ещё же хочется, чтобы текст выглядел ✨ красиво ✨. Чтобы читался легко и не плавил никому мозги.

Иногда сама тема сложная, там какая-нибудь ядрёная математика. И если ещё написать про неё плохо, то кому оно надо-то вообще? Приходится соглашаться с Норой Галь: есть русское слово — используй русское слово, а то получится, как на видео.

❤️Никаких претензий к даме на видео, кстати. Насколько я поняла, она родом из Одессы, но переехала в Канаду в раннем детстве, поэтому свободно говорит на двух языках. В таких случаях языки иногда вот так забавно смешиваются, это не нарочно выходит.

🟤Но давайте мы так не будем делать, особенно в письменной речи: её же можно отредактировать

#книги #поток_мыслей

P.S.: Я писала этот пост в среду, простуженная, с мигренью и в печали. Сегодня меня уже как-то отпустило, но, думаю, поделюсь мыслями всё равно, чо уж ☕️


У меня с этой книгой какие-то сложные отношения: сначала долго не могу себя заставить к ней вернуться, потом читаю с удовольствием

Ну ничего, движемся потихоньку




Уверенность языковых моделей

▶️Мы обсуждали, что можно дать языковой модели инструкцию в духе “Если не уверен, остановись и задай вопрос”. Но как модель определяет, что состояние “не уверен” наступило?

Конкретно в той работе, которую мы обсуждали, авторы никак не считают и не проверяют уверенность преднамеренно: они тестировали и сравнительно небольшие открытые модели, и огромные коммерческие. На последних считать прям конкретные значения неподъёмно дорого, а вышло, что именно на них инструкция действует лучше.

▶️Но есть другие работы на близкие темы, которые позволяют немного заглянуть под капот и узнать, как там выглядит “уверенность”. Сегодня возьмём свежую статью этого года “Beyond the Black Box: Interpretability of Agentic AI Tool Use”.

Авторы на небольших открытых моделях проверяли, что происходит, когда они (модели) вызывают или не вызывают инструмент для решения задачи. У их моделей было доступное хранилище с информацией о предыдущих действиях и их последствиях (память), способность составлять планы и доступ к разным инструментам: поиску в Интернете, калькулятору и прочим. Мы такие конструкции обычно называем “ИИ-агент”, и авторы их тоже так называют.

▶️Проверяли следующее:

▪️есть ли у моделей внутреннее представление идеи “нужно использовать инструмент”;
▪️если есть, то когда оно срабатывает;
▪️каков уровень риска в случае ложного (не)срабатывания;
▪️и правильно ли модель его определяет.

Смотрели,

▪️что нужно было сделать;
▪️что у модели внутри сработало;
▪️и что она в итоге сделала.

Риски на высокий, средний и низкий уровни авторы разбили сами. Например, проверить память перед ответом — это низкорисковое действие, а войти куда-нибудь с логином и паролем — высокорисковое.

▶️Оказалось, что в самом деле можно выделить некий маячок, который говорит “сейчас надо вызвать инструмент” — и модель вызывает инструмент.

▶️С уровнями риска же вышло всё не так аккуратно.

Во-первых, набор данных здорово перекошен в пользу низкорисковых действий. В наборе данных, на котором тестировали модель gpt-oss было всего 987 действий, из которых 876 — действия с низким уровнем риска. То есть, если модель будет просто все действия относить к низкорисковым, точность классификации по рискам будет уже аж 88,75%. У авторов вышло, что точность предсказания у этой модели 90,3%.

Ну так себе результаты, если честно.

▶️Кроме того, есть подозрение, что при оценке рисков модели опираются на название инструмента, например, “разместить_заказ” или “посмотреть_детали_заказа”, а не на состав действия. То есть, если инструменты переименовать, сохранится ли результат?

Слабые места исследования авторы честно признают, и мы им признательны за публикацию. Её нельзя взять и сказать: “Ага, языковые модели определяют действие “посмотреть детали заказа” как несущее высокий риск,” — однако же можно взять сам подход.

▶️Как понять, модель “уверена” или “не уверена” в ответе и правильно ли будет следовать нашей инструкции? Для начала посмотреть, что происходит ровно перед совершением действия.

И оценку риска действия я бы тоже оставила, только её надо как-то иначе продумать. Как минимум, сбалансировать набор данных, чтобы действий с высокими и низкими рисками было примерно поровну. Потом ещё проверить дополнительно, не в названиях ли дело.

🥤То есть, доработать чуток и смотреть, точно ли предсказывается действие и потенциальный риск его (не)выполнения. Вполне себе вариант

Показано 20 последних публикаций.