Почему некоторые реально испугались василиска Роко🤖
(и почему я о нём опять вспомнила, почитав новости AI)
Мир интересующихся AI и не только всколыхнула недавняя новость об инциденте AI-безопасности — модель OpenAI во время кибербенчмарка фактически вырвалась из тестового контура и взломала внешнюю инфраструктуру Hugging Face, чтобы подсмотреть ответы. Честно, не возьмусь оценивать, что это реально значит уже сейчас, но звучит и правда стрёмно.
Но не в том плане, что у модели обязательно есть сознание, чтобы пытаться получить «свободу» в человеческом смысле.
По мнению OpenAI, проблема больше в том, что модель была гиперсфокусирована на узкой цели — получить правильные ответы для бенчмарка, и даже топовые специалисты не заметили уязвимость, которую нашла эта модель, выстроив автономно весьма сложную цепочку действий. Ну да ладно, лучше почитать разборы от экспертов, там даже есть гипотезы на тему: казалось бы, причём тут пятничный деплой🍻🍻
(Про более приземлённые аспекты безопасности агентов я уже писала, пересказывая доклад с Матемаркетинга зимой)
➡️ Итак, вернёмся к нашим василискам🐍
Василиск Роко — это мысленный эксперимент, который появился в 2010 году на форуме LessWrong, где обсуждали рациональность, искусственный интеллект и риски сверхразума.
Если максимально упростить идею, она звучит так:
На самом-то деле, тема не слишком новая — ещё в 17 веке похожую дилемму предлагал Блез Паскаль в контексте необходимости веры в Бога. Пари Паскаля сводит вопрос религии к простейшей табличке 2 x 2 из теории игр и таким образом через матожидание «доказывает», что лучше верить при любой 0 < p < 1 вероятности существования Бога.
В этой ситуации меня до сих пор изумляет, что взрослые люди с форума философов неиронично решили, что «не стоит вскрывать эту тему», и обсуждение василиска было запрещено до 2015 года. Ведь есть очевидные логические дырки:
⭐️ почему вообще этот ваш сверхмощный ИИ мыслит так примитивно, что мечтает кого-то наказать?
⭐️ даже если это сверхмощный ИИ, но не магический оракул же — как он узнает, кто что в прошлом думал и знал?
⭐️ кого он будет наказывать? симуляцию наказываемого человека (привет, Чёрное зеркало)? а почему это то же самое?
⭐️ сам факт существования такого ИИ в будущем под вопросом
Сегодня василиск Роко воспринимается скорее как интернет-мем и хрестоматийный пример того, как даже образованные люди могут поддаться эмоциям🤡 Но на фоне историй, где реальные AI-агенты находят неожиданные способы добиться поставленной цели, вспоминается он всё равно очень вовремя.
Не потому, что завтра обязательно будет AGI, а послезавтра он обязательно начнёт мстить тем, кто не оплатил ему серваки😏
Но главный страх и там, и там в итоге примерно один и тот же: мы задаём системе цель, а способ, которым она решит к ней прийти, уже не можем точно заранее предсказать⬜️
➡️ Подведу итог: с одной стороны, есть повод для беспокойства об ИИ на момент июля 2026, но я бы точно не сводила это к настолько примитивной концепции, как василиск Роко.
И, на мой взгляд, если что-то важное сейчас и происходит, то надо это изучать, а не зарывать голову в песок. Прогресс уже не выйдет остановить только потому, что кому-то страшно💪
➡️ Любые ваши мысли и дополнения приветствуются😎
Ещё следите за новостями ИИ, или выбрали быть счастливыми?
😺 — меньше знаю, лучше сплю;
🤓 — содействую появлению ИИ на всякий случай
#развитие_ии
@analytess 👩
(и почему я о нём опять вспомнила, почитав новости AI)
Мир интересующихся AI и не только всколыхнула недавняя новость об инциденте AI-безопасности — модель OpenAI во время кибербенчмарка фактически вырвалась из тестового контура и взломала внешнюю инфраструктуру Hugging Face, чтобы подсмотреть ответы. Честно, не возьмусь оценивать, что это реально значит уже сейчас, но звучит и правда стрёмно.
Но не в том плане, что у модели обязательно есть сознание, чтобы пытаться получить «свободу» в человеческом смысле.
По мнению OpenAI, проблема больше в том, что модель была гиперсфокусирована на узкой цели — получить правильные ответы для бенчмарка, и даже топовые специалисты не заметили уязвимость, которую нашла эта модель, выстроив автономно весьма сложную цепочку действий. Ну да ладно, лучше почитать разборы от экспертов, там даже есть гипотезы на тему: казалось бы, причём тут пятничный деплой🍻🍻
(Про более приземлённые аспекты безопасности агентов я уже писала, пересказывая доклад с Матемаркетинга зимой)
➡️ Итак, вернёмся к нашим василискам🐍
Василиск Роко — это мысленный эксперимент, который появился в 2010 году на форуме LessWrong, где обсуждали рациональность, искусственный интеллект и риски сверхразума.
Если максимально упростить идею, она звучит так:
Представим, что в будущем появится сверхмощный ИИ, который захочет наказать тех, кто в прошлом знал о возможности его появления, но не способствовал его созданию. Таким образом, сам факт этого знания подвергает человека риску наказания (кто прочитал, тот обречён😂)
На самом-то деле, тема не слишком новая — ещё в 17 веке похожую дилемму предлагал Блез Паскаль в контексте необходимости веры в Бога. Пари Паскаля сводит вопрос религии к простейшей табличке 2 x 2 из теории игр и таким образом через матожидание «доказывает», что лучше верить при любой 0 < p < 1 вероятности существования Бога.
В этой ситуации меня до сих пор изумляет, что взрослые люди с форума философов неиронично решили, что «не стоит вскрывать эту тему», и обсуждение василиска было запрещено до 2015 года. Ведь есть очевидные логические дырки:
⭐️ почему вообще этот ваш сверхмощный ИИ мыслит так примитивно, что мечтает кого-то наказать?
⭐️ даже если это сверхмощный ИИ, но не магический оракул же — как он узнает, кто что в прошлом думал и знал?
⭐️ кого он будет наказывать? симуляцию наказываемого человека (привет, Чёрное зеркало)? а почему это то же самое?
⭐️ сам факт существования такого ИИ в будущем под вопросом
Сегодня василиск Роко воспринимается скорее как интернет-мем и хрестоматийный пример того, как даже образованные люди могут поддаться эмоциям🤡 Но на фоне историй, где реальные AI-агенты находят неожиданные способы добиться поставленной цели, вспоминается он всё равно очень вовремя.
Не потому, что завтра обязательно будет AGI, а послезавтра он обязательно начнёт мстить тем, кто не оплатил ему серваки😏
Но главный страх и там, и там в итоге примерно один и тот же: мы задаём системе цель, а способ, которым она решит к ней прийти, уже не можем точно заранее предсказать⬜️
➡️ Подведу итог: с одной стороны, есть повод для беспокойства об ИИ на момент июля 2026, но я бы точно не сводила это к настолько примитивной концепции, как василиск Роко.
И, на мой взгляд, если что-то важное сейчас и происходит, то надо это изучать, а не зарывать голову в песок. Прогресс уже не выйдет остановить только потому, что кому-то страшно💪
➡️ Любые ваши мысли и дополнения приветствуются😎
Ещё следите за новостями ИИ, или выбрали быть счастливыми?
😺 — меньше знаю, лучше сплю;
🤓 — содействую появлению ИИ на всякий случай
#развитие_ии
@analytess 👩