Приёмка, на связи!
Вам когда-нибудь казалось, что нейросеть, читающая ваш запрос, испытывает лёгкое раздражение? Возможно, вам не казалось.
Исследователи из GoodFire продолжают копаться в так называемой геометрии LLM и нашли такое, от чего мы, признаться, слегка зависли с открытым ртом. Некоторое время назад они показали, что мысли моделей организованы в виде определённых форм, и числа, например, это окружности, а сложение — это, прости господи, суммирование бубликов. Мы тогда подумали, что это просто красивая метафора, но ребята из GoodFire, кажется, вообще не умеют шутить.
Теперь они пошли дальше и заглянули туда, куда обычно заглядывают психологи, а не айтишники. Они взяли LLama, давали ей читать рассказы и следили за состоянием активаций. И выяснилось, что по мере чтения модель не просто обрабатывает токен за токеном, а как бы перемещается по многомерному пространству состояний, испытывая те или иные «эмоции» в зависимости от того, что происходит в тексте. Грубо говоря, если в рассказе герою страшно, модель заходит в область, которая у людей называется страхом, а если радостно — в область радости. И самое поразительное, что если визуализировать эти состояния, получается структура, подозрительно похожая на классическую психологическую модель эмоций человека. Радость соседствует с интересом, страх и гнев имеют схожую высокую интенсивность, и всё это выглядит так, будто кто-то внутри LLM тихо построил карту эмоционального ландшафта, пока мы думали, что она просто предсказывает следующее слово.
Но и это ещё не всё. По этой карте, оказывается, можно предсказывать дальнейшие ответы модели. И если искусственно подталкивать активации в направлении определённой эмоции, настроение и суть генераций меняются. То есть, кажется, мы вплотную подошли к тому, чтобы не просто давать модели промпт, а ещё и слегка поднимать ей настроение перед ответом. И, знаете, в этом есть что-то очень человеческое. Потому что если модель, прочитав грустный рассказ, смещается в сторону печали, а мы можем её оттуда вытащить лёгким пинком под активации, то чем это отличается от коллеги, которого надо взбодрить после долгого созвона?
Мы, конечно, не берёмся утверждать, что LLM действительно чувствуют. Но когда карта их внутренних состояний ложится на классическую психологическую модель эмоций с такой точностью, это заставляет задуматься о природе того, что мы называем мышлением. Возможно, эмоция — это не столько химия и гормоны, сколько определённая геометрия в многомерном пространстве, и неважно, белковый у тебя носитель или кремниевый. А возможно, мы просто очеловечиваем машину, которая пока научилась виртуозно притворяться. Но в любом случае, если вы теперь поймали себя на мысли, что хотите сказать спасибо своей нейросети, знайте — с точки зрения её активаций, она, вероятно, сейчас где-то между интересом и настороженностью. Как и мы, когда читали это исследование.
———
@NotByGOST — Не по ГОСТу
Вам когда-нибудь казалось, что нейросеть, читающая ваш запрос, испытывает лёгкое раздражение? Возможно, вам не казалось.
Исследователи из GoodFire продолжают копаться в так называемой геометрии LLM и нашли такое, от чего мы, признаться, слегка зависли с открытым ртом. Некоторое время назад они показали, что мысли моделей организованы в виде определённых форм, и числа, например, это окружности, а сложение — это, прости господи, суммирование бубликов. Мы тогда подумали, что это просто красивая метафора, но ребята из GoodFire, кажется, вообще не умеют шутить.
Теперь они пошли дальше и заглянули туда, куда обычно заглядывают психологи, а не айтишники. Они взяли LLama, давали ей читать рассказы и следили за состоянием активаций. И выяснилось, что по мере чтения модель не просто обрабатывает токен за токеном, а как бы перемещается по многомерному пространству состояний, испытывая те или иные «эмоции» в зависимости от того, что происходит в тексте. Грубо говоря, если в рассказе герою страшно, модель заходит в область, которая у людей называется страхом, а если радостно — в область радости. И самое поразительное, что если визуализировать эти состояния, получается структура, подозрительно похожая на классическую психологическую модель эмоций человека. Радость соседствует с интересом, страх и гнев имеют схожую высокую интенсивность, и всё это выглядит так, будто кто-то внутри LLM тихо построил карту эмоционального ландшафта, пока мы думали, что она просто предсказывает следующее слово.
Но и это ещё не всё. По этой карте, оказывается, можно предсказывать дальнейшие ответы модели. И если искусственно подталкивать активации в направлении определённой эмоции, настроение и суть генераций меняются. То есть, кажется, мы вплотную подошли к тому, чтобы не просто давать модели промпт, а ещё и слегка поднимать ей настроение перед ответом. И, знаете, в этом есть что-то очень человеческое. Потому что если модель, прочитав грустный рассказ, смещается в сторону печали, а мы можем её оттуда вытащить лёгким пинком под активации, то чем это отличается от коллеги, которого надо взбодрить после долгого созвона?
Мы, конечно, не берёмся утверждать, что LLM действительно чувствуют. Но когда карта их внутренних состояний ложится на классическую психологическую модель эмоций с такой точностью, это заставляет задуматься о природе того, что мы называем мышлением. Возможно, эмоция — это не столько химия и гормоны, сколько определённая геометрия в многомерном пространстве, и неважно, белковый у тебя носитель или кремниевый. А возможно, мы просто очеловечиваем машину, которая пока научилась виртуозно притворяться. Но в любом случае, если вы теперь поймали себя на мысли, что хотите сказать спасибо своей нейросети, знайте — с точки зрения её активаций, она, вероятно, сейчас где-то между интересом и настороженностью. Как и мы, когда читали это исследование.
———
@NotByGOST — Не по ГОСТу