TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Python Ninja | Программирование

29 Sep, 21:09

Open in Telegram Share Report

Prev Next
Шокирующий результат: сильнейшие ИИ-модели уже умеют сами проектировать эксперименты, а точность может вырасти с 11% до 87%. Похоже, ИИ действительно начинает самостоятельно исследовать неизвестное.

Уметь отвечать на вопросы ≠ уметь исследовать.

Исследователи из Фуданьского университета, Цинхуа и Tencent взяли 10 передовых моделей и поместили их в два искусственных мира с непривычными правилами, где ответы можно точно проверить. Модели должны были сами придумывать проверки, по обратной связи восстанавливать правила, а затем применять новые знания к 70 задачам, которых раньше не видели.

Две песочницы:

AlienCode — язык программирования с 31 скрытым семантическим правилом.

AlienLogic — система с 24 изменёнными правилами логического вывода.

При этом инструкции специально содержали неверные сведения, поэтому опора на запомненные знания только мешала.

Ключевые результаты.

При четырёх раундах исследования с обратной связью лучший результат на AlienCode достиг 87,6%. При том же числе раундов, но без обратной связи, результаты всех моделей оставались в диапазоне 0,5–11%.

Самостоятельно выбранные проверки оказались заметно эффективнее фиксированных или случайных.

Но исследование оказалось крайне нестабильным. У одной и той же модели при одинаковом бюджете разница между отдельными траекториями достигала 72,8 процентного пункта, тогда как обычный разброс при ответах не превышал 4,7 пункта.

Ещё один важный вывод: знать правило ≠ уметь им пользоваться.

Два ключевых правила покрывали 51 из 70 задач. Когда один эксперимент позволял обнаружить оба сразу, точность подскакивала с 11% до 81%.

Но даже когда модель правильно называла все правила, итоговая точность составляла лишь 70,9%.

Если же правила давали модели напрямую, на AlienLogic точность достигала 93–97%, что выше результатов любого самостоятельного исследования.

То есть главное ограничение сейчас не в том, чтобы применить уже известное правило, а в том, чтобы самостоятельно его обнаружить и затем надёжно удержать.

Настоящее исследование — это не просто знать больше. Это понимать, какой эксперимент нужно провести, и уметь надёжно перенести его результат в следующую задачу.

Работа: https://arxiv.org/abs/2609.30199

✈️ Python Ninja

337 0 2 1 3
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot