Механическое вскрытие для безопасности ИИ
Главы крупных компаний-разработчиков грозятся сотворить ИИ, который переплюнет человека, в ближайшие пару лет. Учёные, стоявшие у истоков ИИ, дают годы или десятилетия.
🔸В этом эссе собраны разные высказывания разных людей от Сэма Альтмана до Яна ЛеКуна. Они спорят о сроках и о том, что значит “переплюнуть человека”.
Однако они не спорят о том, что ИИ со временем становится всё более мощным инструментом. Оно и хорошо, но мощным инструментом можно наворотить много мощной фигни, сами понимаете. Поэтому нужно думать о том, как инструмент сделать стабильнее и безопаснее, а людей научить им пользоваться.
🔸Но сначала надо понять, как он работает: современные нейросети огромные настолько, что никто в душе не чает, что происходит внутри.
Люди просто пихают данные на вход, смотрят на выход, а потом пихают ещё данных на вход в надежде, что выход станет лучше. Это довольно грубое описание, но в целом верное.
🔸Мой любимый инструмент — кувалда механистический подход. Это когда мы берём большую сложную штуку, разбираем её по винтикам и смотрим, как что с чем связано. И потом ещё отдельные винтики крутим и смотрим, что меняется.
🔸В статье “Mechanistic Interpretability for AI Safety — A Review” авторы очень хорошим языком, очень подробно и системно расписали, какие есть способы заглянуть внутрь нейросети.
Она легко читается, и, если вы хотите познакомиться с областью, я вам её советую.
🔸Здесь достану некоторые из неё кусочки, чтобы вы могли решить, читать ли всё целиком.
▪️Разные объекты и идеи представлены в нейросетях иначе, чем у нас в голове. Можно внести в фотографию кошки небольшие изменения, которые человек не заметит, а нейросеть примет её за авокадо.
▪️Как и у нас, у нейросетей есть нейроны (только они устроены по-другому), и многие нейроны выполняют по несколько разных функций, например, некоторые нейроны одинаково реагируют на кошек и автомобили. Из-за этого их сложнее изучать.
▪️У нейросетей есть мотивы. И они определяют поведение. Только это мотивы не в смысле “мотивация”, а в смысле “повторяющиеся наборы параметров, которые объединены определённым образом”. Например, у моделей машинного зрения есть наборы параметров, которые отвечают за распознавание изогнутых линий. В нашем мозгу тоже такое есть.
▪️Возможно, большие языковые модели выросли достаточно, чтобы в их внутренней математике начала формироваться модель окружающего мира. То есть, там можно найти разные векторы, которые относятся к конкретным объектам и их свойствам, связанные между собой.
▪️В них это не закладывали, но из-за большого объёма внутренних вычислений и того, что текст описывает реальность, модели мира формируются сами. Иногда говорят, что ИИ — это первая технология, которую мы вырастили, а не построили (“AI systems are grown, not built”).
▪️Чтобы прояснить причинно-следственные связи между векторами, которые получаются у нейросетки в процессе обработки данных, и её ответом, можно залезть внутрь и заменить эти векторы на другие. Про этот подход у меня был пост; там про то, как в языковых моделях эмоции представлены.
📜 Очень много написано про языковые модели, но это не весь наш ИИ на сегодня. Я поищу похожие работы по машинному зрению: посмотрим, что там интересного
Главы крупных компаний-разработчиков грозятся сотворить ИИ, который переплюнет человека, в ближайшие пару лет. Учёные, стоявшие у истоков ИИ, дают годы или десятилетия.
🔸В этом эссе собраны разные высказывания разных людей от Сэма Альтмана до Яна ЛеКуна. Они спорят о сроках и о том, что значит “переплюнуть человека”.
Однако они не спорят о том, что ИИ со временем становится всё более мощным инструментом. Оно и хорошо, но мощным инструментом можно наворотить много мощной фигни, сами понимаете. Поэтому нужно думать о том, как инструмент сделать стабильнее и безопаснее, а людей научить им пользоваться.
🔸Но сначала надо понять, как он работает: современные нейросети огромные настолько, что никто в душе не чает, что происходит внутри.
Люди просто пихают данные на вход, смотрят на выход, а потом пихают ещё данных на вход в надежде, что выход станет лучше. Это довольно грубое описание, но в целом верное.
🔸Мой любимый инструмент — кувалда механистический подход. Это когда мы берём большую сложную штуку, разбираем её по винтикам и смотрим, как что с чем связано. И потом ещё отдельные винтики крутим и смотрим, что меняется.
🔸В статье “Mechanistic Interpretability for AI Safety — A Review” авторы очень хорошим языком, очень подробно и системно расписали, какие есть способы заглянуть внутрь нейросети.
Она легко читается, и, если вы хотите познакомиться с областью, я вам её советую.
🔸Здесь достану некоторые из неё кусочки, чтобы вы могли решить, читать ли всё целиком.
▪️Разные объекты и идеи представлены в нейросетях иначе, чем у нас в голове. Можно внести в фотографию кошки небольшие изменения, которые человек не заметит, а нейросеть примет её за авокадо.
▪️Как и у нас, у нейросетей есть нейроны (только они устроены по-другому), и многие нейроны выполняют по несколько разных функций, например, некоторые нейроны одинаково реагируют на кошек и автомобили. Из-за этого их сложнее изучать.
▪️У нейросетей есть мотивы. И они определяют поведение. Только это мотивы не в смысле “мотивация”, а в смысле “повторяющиеся наборы параметров, которые объединены определённым образом”. Например, у моделей машинного зрения есть наборы параметров, которые отвечают за распознавание изогнутых линий. В нашем мозгу тоже такое есть.
▪️Возможно, большие языковые модели выросли достаточно, чтобы в их внутренней математике начала формироваться модель окружающего мира. То есть, там можно найти разные векторы, которые относятся к конкретным объектам и их свойствам, связанные между собой.
▪️В них это не закладывали, но из-за большого объёма внутренних вычислений и того, что текст описывает реальность, модели мира формируются сами. Иногда говорят, что ИИ — это первая технология, которую мы вырастили, а не построили (“AI systems are grown, not built”).
▪️Чтобы прояснить причинно-следственные связи между векторами, которые получаются у нейросетки в процессе обработки данных, и её ответом, можно залезть внутрь и заменить эти векторы на другие. Про этот подход у меня был пост; там про то, как в языковых моделях эмоции представлены.
📜 Очень много написано про языковые модели, но это не весь наш ИИ на сегодня. Я поищу похожие работы по машинному зрению: посмотрим, что там интересного