ML-инженерам пора в коучи или психологи моделей?
Исследователи из Университета Цинхуа, Пекинского института общего ИИ и Penn State представили систему Absolute Zero Reasoner (AZR) без датасета, разметки, учителя, фичей и всего того, что мило сердцу мл-инженера:
🍾 модель сама придумывает задачи на Python,
🍾 сама их решает,
🍾 сама оценивает результат и обучается на своих ошибках.
По-моему отличный повод и переквалифицироваться из ML-инженеров в психологов моделей :) И серьезно порассуждать про безопасность!
Кстати, это не единичный случай
🐔 Agent0 (Stanford, UNC, Salesforce) - агенты, которые улучшают себя через self-play
🐔 Self-play SWE-RL (Meta) - агенты, которые внедряют баги в реальный код и сами их чинят, обучаясь на этом процессе
🐔 более ранние концепции от Юргена Шмидхубера.
😡 AZR, обучавшийся полностью без внешних данных, превзошел модели, натренированные на десятках тысяч человеческих примеров:
лучшее качество рассуждений,
лучшие результаты в программировании и математике,
лидер среди моделей ~7B параметров!
А теперь мое личное интересное и тревожное - безопасность
1️⃣ goal drift - self-play оптимизирует то, что полезно модели для дальнейшего обучения,
но не обязательно то, что полезно человеку. 🚣 Модель начинает усиливать инструментальные навыки, игнорируя безопасность, этику или ограничения, если они не входят в reward
2️⃣ Автономное масштабирование без датасета и человека 🥦 резко снижает человеческий контроль над темпами и направлением развития.
3️⃣Особенно опасно, что self-play активно применяется в software engineering, так как ИИ учится находить слабые места в коде 😈, учится ломать и чинить системы, формирует навыки, напрямую применимые к оффенсив.
😫 И тут вот возник вопрос выходного дня, как это связано с рисками AGI и супералаймента. Похоже, что механизмы RLHF и сэйфти-фильтры тут не помогут, так как мы не можем заранее задать правильный реворд для системы, которая будет изобретать новые способы быть умной. 🎈 Как доказать, что система, умнее нас, будет продолжать учитывать наши интересы, даже когда ей это невыгодно? и кто вообще должен это доказывать - мы или уже она? 🎈 И как научить ИИ заботиться о людях, когда люди перестанут быть для него самым интересным датасетом?
Все!
🙃
Исследователи из Университета Цинхуа, Пекинского института общего ИИ и Penn State представили систему Absolute Zero Reasoner (AZR) без датасета, разметки, учителя, фичей и всего того, что мило сердцу мл-инженера:
🍾 модель сама придумывает задачи на Python,
🍾 сама их решает,
🍾 сама оценивает результат и обучается на своих ошибках.
По-моему отличный повод и переквалифицироваться из ML-инженеров в психологов моделей :) И серьезно порассуждать про безопасность!
Кстати, это не единичный случай
🐔 Agent0 (Stanford, UNC, Salesforce) - агенты, которые улучшают себя через self-play
🐔 Self-play SWE-RL (Meta) - агенты, которые внедряют баги в реальный код и сами их чинят, обучаясь на этом процессе
🐔 более ранние концепции от Юргена Шмидхубера.
😡 AZR, обучавшийся полностью без внешних данных, превзошел модели, натренированные на десятках тысяч человеческих примеров:
лучшее качество рассуждений,
лучшие результаты в программировании и математике,
лидер среди моделей ~7B параметров!
А теперь мое личное интересное и тревожное - безопасность
1️⃣ goal drift - self-play оптимизирует то, что полезно модели для дальнейшего обучения,
но не обязательно то, что полезно человеку. 🚣 Модель начинает усиливать инструментальные навыки, игнорируя безопасность, этику или ограничения, если они не входят в reward
2️⃣ Автономное масштабирование без датасета и человека 🥦 резко снижает человеческий контроль над темпами и направлением развития.
3️⃣Особенно опасно, что self-play активно применяется в software engineering, так как ИИ учится находить слабые места в коде 😈, учится ломать и чинить системы, формирует навыки, напрямую применимые к оффенсив.
😫 И тут вот возник вопрос выходного дня, как это связано с рисками AGI и супералаймента. Похоже, что механизмы RLHF и сэйфти-фильтры тут не помогут, так как мы не можем заранее задать правильный реворд для системы, которая будет изобретать новые способы быть умной. 🎈 Как доказать, что система, умнее нас, будет продолжать учитывать наши интересы, даже когда ей это невыгодно? и кто вообще должен это доказывать - мы или уже она? 🎈 И как научить ИИ заботиться о людях, когда люди перестанут быть для него самым интересным датасетом?
Все!
🙃