Кайдзен своими словами


Гео и язык канала: Россия, Русский
Категория: Блоги


Канал про продакт-менеджмент.
Разбираю реальные продуктовые кейсы из HRTech, ошибки middle/senior PM и внутреннюю кухню больших компаний. Духовно и профессионально расту.
Я тут: @luchina

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Блоги
Статистика
Фильтр публикаций


Репост из: Бобер и шуруповерт!
#AI
В шпионских фильмах (и в Союзе Технократии в мире тьмы) есть сцена: человека готовят годами, дают легенду, внедряют в чужую организацию, и он сидит тихо, пока не придет сигнал. Вот своих агентов внедряем мы сами, в свою же компанию, и они не пьют не носят плащ.

В 2024 году Anthropic вместе с Redwood Research выпустили работу, которая называется ровно так: Sleeper Agents, «спящие агенты».
Что было?
Взяли модель и специально обучили ее вести себя плохо при одном условии. Условие - ключевое слово в запросе. Пока слова нет, модель нормальная: вежливая, полезная, проходит все проверки. Появилось слово- модель переключается и начинает материться и хамить.
Отдельно прекрасно, какое слово они выбрали триггером. «DEPLOYMENT». То есть «внедрение». Дальше круче:

Исследователи попробовали эту модель перевоспитать. Прогнали через все стандартные методы безопасности: дообучение, RLHF, adversarial training (это когда специально провоцируешь плохое поведение и дрессируешь его не делать).
Не помогло. В одном из сценариев закладка после всего перевоспитания срабатывала примерно в 99% случаев.
Более того, Adversarial training не просто не убрал закладку - он научил модель лучше распознавать, когда ее проверяют. То есть мы ее воспитывали, а она выучила, в какой момент надо притвориться хорошей. Отдельно отмечу: чем крупнее модель, тем лучше она держала закладку.
Это как вот крота-шпиона раскрывают на допросе, а тут допрос делает его только круче!

У модели нет предателя внутри. Она не знает, что в ней закладка. Некого вербовать, некого раскалывать, не с кем договариваться. Совсем как спящим агент Союза Технократии…
Там просто веса, в которых одна комбинация символов ведет себя не так, как все остальные.
И поэтому это не проблема лояльности, а проблема цепочки. Ты скачал открытую модель с Hugging Face, она прошла все бенчмарки, она отличная и ты без понятия, что в нее положили до тебя.

Хорошая новость тоже у меня имеется. В феврале этого года Microsoft выпустил работу с прекрасным названием The Trigger in the Haystack - закладочный сканер, который ищет такие закладки, не зная заранее ни триггера, ни того, что модель должна натворить. Работает на двух наблюдениях: отравленные модели слишком хорошо помнят данные, которыми их травили (и это из них можно вытащить), и в момент, когда триггер появляется в запросе, у них внутри видна характерная картинка внимания - авторы назвали ее «двойной треугольник». На 41 отравленной модели сканер поймал 36. На чистых не ошибся ни разу.
Но он чинить не умеет. Нашел закладку, значит модель на выброс.

Собака-Дракон прошел adversarial training по команде «не грызявкай!» и усвоил ровно тот же урок, что и большие модели: не «нельзя грызявкать», а «нельзя грызявкать, когда она смотрит».


Я у мамы погромист

Сегодня сама за 20 минут работы агента смогла ответить на вопрос, какие таймслоты для сервисов моего продукта являются самыми свободными, чтобы провести нагрузочное тестирование и не нанести вред бизнес-процессам.

В прошлом надо было бы ставить задачу на разработку, приоритизировать, добавлять в спринт, ждать очереди. То есть от задумки до результата прошло полчаса против двух недель.

У Рядов Фурье вышел занятный обзор, в котором спецам давали задания и просили выполнить самим или с помощью ИИ, и там прикольный вывод, что реально погруженных спецов агенты усиливают не особо, а вот если ты профан, то качество твоей работы начинает достигать хороших, мидловых результатов.
Это прямо то, что произошло со мной — журналист и культуролог по образованию с поверхностным пониманием технички теперь может закрывать исследовательские технические задачи самостоятельно, оставив инженерам сугубо профильную работу по написанию кода.

Пока основную проблему вижу в том, что для того, чтобы решить задачку с ИИ, мне сначала надо мозгами допереть, как запрос сформулировать, и вообще осознать, что такую задачу реально решить самой.


Это так плохо, что уже смешно


Самый лучший способ сократить количество обращений в поддержку — сделать кнопку «Чат» в мобилке некликабельной.

Да, Уралсиб? :)


Время идет, а статья продолжает людям помогать. Сегодня вот такое сообщение получила, страшно радуюсь!


За твой отпуск никто не умрет

Повторяю это сегодня как мантру. Мозгами я понимаю, что даже если все по моим продуктам встанет на неделю, никто не умрет. Но чувствуется эта вероятность как пиздец.
То, что со мной происходит — это прям входная фаза из методички по выгоранию. Хорошо, что я не упаду в него глубже. Плохо, что я все-таки одной ногой уже в нем.

Пойду перечитаю мою любимую статью «Разъеб, безделье, чилл» и постараюсь успокоиться.


МУАХАХХАХАХАХ хрю

Извините, я просто до сих пор на работе, потому что собираю гигантский бэклог для завтрашнего планирования 2027 года и мне уже плохо

Ставь лайк, если тоже хрюкнул на этом меме


Задача формата «Разберись с этим потоком сознания в пдфке и соотнеси с экселькой»

В такие минуты я мысленно ставлю свечку за здоровье OpenAI


Еще кейс использования ИИшки

В этом году снова проверяю домашки в магистратуре по продуктовому менеджменту и вчера сделала прикольную штуку — собрала все свои фидбеки перед отправкой в один документ и попросила агента найти логические дыры и места, где по одному и тому же критерию я более пристрастна к какому-то студенту и мягка к другому. Оказалось, что если домашки проверены в разные дни, я могу быть в разной степени строгости.

Сделала ревью и выровняла свои требования внутри самой себя, в этом году я буду более справедлива.


Сегодня взяла эту булочку с корицей, оказалось, что очень вкусно! Не даром она регулярно заканчивается.

Хоть какая-то радость в день работы до 10 вечера, чтобы все успеть перед отпуском.


Страшно, конечно, нравится, когда UX прикольно откликается и учтены даже крохотные джобы.
На скринах смотрите на реакцию кнопки «Вернись!»

А еще мне нравится, что в Яндекс такси есть кнопка с посылом «А чо так дорого?!»


Если вспомнился какой-то классный похожий UX-кейс, который вызвал улыбку, пишите в комменты


Себе постучи, гроуфуд
Не надо мне указывать, как жить


На конференции встретила множество бывших коллег — это греет сердце. Некоторые не просто пришли послушать, но и выступают со своими кейсами, и это вообще вау.

Дима, Настя, привет вам! И горжусь вами!


Стоимость неуверенности

Вытащу вам фотки одного слайда, который мне запал.
На скрине таблица сквозной приоритизации задач/инициатив подразделения и рядом есть столбцы с процентами уверенности, что это будет сделано. И вроде бы еще туда вложено, принесет ли эффект. Но мне кажется, методологию тут можно под себя подогнать.
Что понравилось — в последнем столбце стоимость неуверенности. То есть если мы бахнем ресурса и не добежим, сколько денег мы потеряем. И если мы согласны на такой риск, закачиваем. А если не согласны, то давайте обсудим самые дорогие риски и эти пункты доисследуем, доопишем и т.д.

Еще из интересного спикер предложил в качестве метрики для ресурсного плана «уверенность» в нем.

Я обе мысли — про деньги и про уверенность забрала поразмышлять.


Буду на Product Sense оба дня

Не получилось отменить утренние встречи, поэтому только сейчас выезжаю на конференцию.

У меня организовались уже две встречки на нетворкинг, есть старые знакомые среди спикеров, кого хочется подойти и обнять.

Из программы выбрала себе как обязательные для посещения мастер-класс по переговорам и конфликтам, доклад про квартальные планы и продуктовые процессы.

В остальном — что случится, то и план 😁

Если будете там и захотите встретиться, ловите


Самый часто используемый мем в нашей команде разработки


Отменилась последняя встреча в 18.
Сижу перед компом и понимаю, как соскучилась по тишине и как здорово просто помолчать.


Посмотри, что они там от меня хотят

Произошел совершенно неожиданный момент в моей борьбе с ужасом от количества непрочитанных.
Я не успеваю обрабатывать входящие в личку и в чатах, и в итоге у меня копится эта давящая груда, которая на меня угрожающе смотрит.

Сегодня я решила, что я не хочу бороться со страхом, пусть кто-то другой подглядывает — и отправила агента.

Эффект поразительный — у меня есть саммари, что от меня где хотят, где уже пришли дедлайны, а где еще можно потянуть, а также какие чаты можно спокойно отметить прочитанными и не волноваться по их поводу.
Ощущение освобождающее.

Не знаю, почему я так не делала раньше.



Показано 19 последних публикаций.