Ученые из Университета Аризоны посадили тринадцать языковых моделей играть в Civilization V. Не в упрощённый варгейм со сценарием, а в настоящую игру: 500 ходов, десятки городов, дипломатия, наука, армия, другие цивилизации под управлением таких же моделей.
Результат слегка испортит настроение людям, собирающимся доверить ИИ управление корпорациями и государствами. Модели, которые решают олимпиадные задачи, играют примерно на уровне семилетнего ребёнка, который провёл в Циве часов двадцать.
Причина не в незнании правил. Каждый ход — это заново сгенерированная ситуация, которой не было в обучающих данных, и модели в ней теряются. Но главное — они почти не считают эффекты второго порядка. «Я нападу — мне ответят» они понимают. Чего они не видят: третья цивилизация смотрит на двух дерущихся и спокойно захватывает обоих.
Флориан Бранд из Prime Intellect говорит, что ровно это же вылезает в длинных агентных задачах по программированию: модель улучшает следующий шаг, а не строит план.
Второй паттерн — реактивность. Стратегию меняют, только когда уже проигрывают. Потеряна половина территории и населения — и модель объявляет, что теперь пойдёт по культурной победе. А поздно, надо выживать.
Третий — упрямство. Модель решает «сделаем X, получим Y» и держится за это до последнего, игнорируя происходящее. А когда наконец понимает, что Y не наступит, — берётся за ядерное оружие. Первые 400 ходов из 500 бомбы недоступны, и модели о них не вспоминают. После Манхэттенского проекта некоторые модели внезапно обнаруживают новый и чрезвычайно привлекательный инструмент решения накопившихся дипломатических проблем.
Есть и фирменные характеры. OpenAi очень любит вторгаться и завоевывать. А Claude, например, любит науку и способен настолько увлечься научной победой, что практически перестаёт строить армию. Ученый рассказывает, как играл сам и двигал собственные войска, создавая буфер миротворцев, чтобы спасти союзного Claude от третьей цивилизации.
Практическая польза от таких исследований?
Ну, например, становится понятнее, что если ИИ пишет вам законопроект, военный план или корпоративную стратегию, неплохо заранее выяснить, как именно он начинает думать после того, как уже потерял половину территории, стратегия провалилась, а ядерное оружие только что стало доступно.
@gostev_future
Результат слегка испортит настроение людям, собирающимся доверить ИИ управление корпорациями и государствами. Модели, которые решают олимпиадные задачи, играют примерно на уровне семилетнего ребёнка, который провёл в Циве часов двадцать.
Причина не в незнании правил. Каждый ход — это заново сгенерированная ситуация, которой не было в обучающих данных, и модели в ней теряются. Но главное — они почти не считают эффекты второго порядка. «Я нападу — мне ответят» они понимают. Чего они не видят: третья цивилизация смотрит на двух дерущихся и спокойно захватывает обоих.
Флориан Бранд из Prime Intellect говорит, что ровно это же вылезает в длинных агентных задачах по программированию: модель улучшает следующий шаг, а не строит план.
Второй паттерн — реактивность. Стратегию меняют, только когда уже проигрывают. Потеряна половина территории и населения — и модель объявляет, что теперь пойдёт по культурной победе. А поздно, надо выживать.
Третий — упрямство. Модель решает «сделаем X, получим Y» и держится за это до последнего, игнорируя происходящее. А когда наконец понимает, что Y не наступит, — берётся за ядерное оружие. Первые 400 ходов из 500 бомбы недоступны, и модели о них не вспоминают. После Манхэттенского проекта некоторые модели внезапно обнаруживают новый и чрезвычайно привлекательный инструмент решения накопившихся дипломатических проблем.
Есть и фирменные характеры. OpenAi очень любит вторгаться и завоевывать. А Claude, например, любит науку и способен настолько увлечься научной победой, что практически перестаёт строить армию. Ученый рассказывает, как играл сам и двигал собственные войска, создавая буфер миротворцев, чтобы спасти союзного Claude от третьей цивилизации.
Практическая польза от таких исследований?
Ну, например, становится понятнее, что если ИИ пишет вам законопроект, военный план или корпоративную стратегию, неплохо заранее выяснить, как именно он начинает думать после того, как уже потерял половину территории, стратегия провалилась, а ядерное оружие только что стало доступно.
@gostev_future