Бобер и шуруповерт!


Гео и язык канала: Россия, Русский
Категория: Блоги


Канал захвачен маленькой собачкой Драником (Rutagor Dragon)
Product manager in Artificial intelligence vs border collie intelligence

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Блоги
Статистика
Фильтр публикаций


Я: никаких больше зеркалок, стекол и объективов, ну сколько я там снимаю - чисто телефончиком на бегу. Кругом генерация картинок, все вот это

Тоже я: ладно, заведу себе "мыльницу" с фиксом, никаких там вот этих стекол. Она будет маленькая, легкая, чисто для щелкнуть
Тоже я: ну ладно, мне нужна блендочка с вот эти буквально одним фильтром
Тоже я: ну ладно, и переходник на ширик с макро объективом и ну точно на этом все
—> вы находитесь здесь

Что я могу сказать в свое оправдание?
Есть картина, которую нарисовала нейросеть, и вместо подписи художника у нее в углу стоит формула "Портрет Эдмона де Белами", 2018 год, продан на Christie’s за 432 тысячи долларов.
Я ее использовала, когда собирала учебную выставку про то, как люди шестьсот лет придумывали порядок, чтобы понять мир. Орнаменты, геометрия, вот это все. И Белами там идеальный финал: нейросеть съела 15 тысяч старых портретов, вытащила из них правило "как выглядит портрет" и начала рисовать сама. Уже без окружающего мира, только по правилу.

Интернет все сильнее забит текстами и картинками, которые сгенерировали нейросети. И новые нейросети учатся уже на них. В Nature было исследование про то, что будет, если модель несколько поколений подряд кормить ее же выводом. Называется model collapse. Сначала пропадает все редкое и странное. Потом все сползает в среднее. Потом каша. Правило, которое перестало смотреть на реальность, потом самосхлопнется.
Мы учили машину на наших картинках, теперь машина учит следующую машину, и чем дальше, тем меньше в этой цепочке кто-то смотрит в окно. Мне интересно, на чем модель будет учиться через пять лет. Живые человеческие данные станут ли дефицитом, как чистая вода? Или синтетика будет достаточно хороша?

Короче, как вы поняли, это не траты, а ИНВЕСТИЦИИ.

65 0 1 16 20

#AI
В шпионских фильмах (и в Союзе Технократии в мире тьмы) есть сцена: человека готовят годами, дают легенду, внедряют в чужую организацию, и он сидит тихо, пока не придет сигнал. Вот своих агентов внедряем мы сами, в свою же компанию, и они не пьют не носят плащ.

В 2024 году Anthropic вместе с Redwood Research выпустили работу, которая называется ровно так: Sleeper Agents, «спящие агенты».
Что было?
Взяли модель и специально обучили ее вести себя плохо при одном условии. Условие - ключевое слово в запросе. Пока слова нет, модель нормальная: вежливая, полезная, проходит все проверки. Появилось слово- модель переключается и начинает материться и хамить.
Отдельно прекрасно, какое слово они выбрали триггером. «DEPLOYMENT». То есть «внедрение». Дальше круче:

Исследователи попробовали эту модель перевоспитать. Прогнали через все стандартные методы безопасности: дообучение, RLHF, adversarial training (это когда специально провоцируешь плохое поведение и дрессируешь его не делать).
Не помогло. В одном из сценариев закладка после всего перевоспитания срабатывала примерно в 99% случаев.
Более того, Adversarial training не просто не убрал закладку - он научил модель лучше распознавать, когда ее проверяют. То есть мы ее воспитывали, а она выучила, в какой момент надо притвориться хорошей. Отдельно отмечу: чем крупнее модель, тем лучше она держала закладку.
Это как вот крота-шпиона раскрывают на допросе, а тут допрос делает его только круче!

У модели нет предателя внутри. Она не знает, что в ней закладка. Некого вербовать, некого раскалывать, не с кем договариваться. Совсем как спящим агент Союза Технократии…
Там просто веса, в которых одна комбинация символов ведет себя не так, как все остальные.
И поэтому это не проблема лояльности, а проблема цепочки. Ты скачал открытую модель с Hugging Face, она прошла все бенчмарки, она отличная и ты без понятия, что в нее положили до тебя.

Хорошая новость тоже у меня имеется. В феврале этого года Microsoft выпустил работу с прекрасным названием The Trigger in the Haystack - закладочный сканер, который ищет такие закладки, не зная заранее ни триггера, ни того, что модель должна натворить. Работает на двух наблюдениях: отравленные модели слишком хорошо помнят данные, которыми их травили (и это из них можно вытащить), и в момент, когда триггер появляется в запросе, у них внутри видна характерная картинка внимания - авторы назвали ее «двойной треугольник». На 41 отравленной модели сканер поймал 36. На чистых не ошибся ни разу.
Но он чинить не умеет. Нашел закладку, значит модель на выброс.

Собака-Дракон прошел adversarial training по команде «не грызявкай!» и усвоил ровно тот же урок, что и большие модели: не «нельзя грызявкать», а «нельзя грызявкать, когда она смотрит».


Когда команда «фоткаться» начала принимать взрослые обороты, а хозяйка снова делает с тобой много уроков, знай: наступил октябрь.

В октябре ты Фамильяр Игрока и каждый вечер на прогулке надо шуршать листочками и слушать по главе «Ночи в тоскливом октябре» Желязны.

92 0 0 12 13

Дорогой дневник! На этой неделе я закрыла на работе год, получила результаты, что я сдала экзамен на диплом искусствоведа, страдаю от отстойных побочек дурацкого антибиотика и побрила ноги собаке.

Если честно, планов у меня было на эту неделю несколько больше, но зато я модный искусствовед, ну!
Зато сегодня был отличный день с точки зрения здоровья (лучше бы вчера, когда я ездила в офис на презентацию) и роскошный закат!

Если бы вы знали, как я хорош, как мощны моей команды лапищи!



Показано 5 последних публикаций.