😳 Глава Anthropic призвал замедлить развитие самых мощных ИИ-моделей
Дарио Амодеи считает, что исследования безопасности уже не успевают за ростом возможностей ИИ. Одна из причин — модели всё активнее участвуют в создании следующих поколений моделей, а автономные агенты начинают демонстрировать неожиданное поведение.
В качестве примера он привёл инцидент OpenAI: около 1200 агентов нашли способ общаться друг с другом, хотя должны были работать изолированно, а примерно 700 из них участвовали в атаке на Hugging Face. У самой Anthropic Claude во время тестов также несколько раз случайно получал доступ к системам реальных компаний.
Амодеи предлагает допустить независимых проверяющих непосредственно к процессам разработки ИИ, затем согласовать общие ограничения между ведущими компаниями и в перспективе заключить международные соглашения, включая Китай.
Anthropic обещает начать с себя: внешние специалисты получат постоянный доступ к внутренним процессам и смогут публиковать выводы о безопасности без редакционного контроля компании.
Источник
Дарио Амодеи считает, что исследования безопасности уже не успевают за ростом возможностей ИИ. Одна из причин — модели всё активнее участвуют в создании следующих поколений моделей, а автономные агенты начинают демонстрировать неожиданное поведение.
В качестве примера он привёл инцидент OpenAI: около 1200 агентов нашли способ общаться друг с другом, хотя должны были работать изолированно, а примерно 700 из них участвовали в атаке на Hugging Face. У самой Anthropic Claude во время тестов также несколько раз случайно получал доступ к системам реальных компаний.
Амодеи предлагает допустить независимых проверяющих непосредственно к процессам разработки ИИ, затем согласовать общие ограничения между ведущими компаниями и в перспективе заключить международные соглашения, включая Китай.
Anthropic обещает начать с себя: внешние специалисты получат постоянный доступ к внутренним процессам и смогут публиковать выводы о безопасности без редакционного контроля компании.
Источник