Йошуа Бенжио предложил новую рекурсивную ИИ-модель с параллельным мышлением
ИИ-модель GRAM (Generative Recursive Reasoning) с 10 млн параметров обошла детерминированных конкурентов почти втрое большего размера за счёт того, чего обычные рекурсивные модели не умеют: исследовать несколько траекторий рассуждения одновременно.
Проблема существующих рекурсивных моделей в том, что они полностью детерминированы: при одном и том же входе всегда идут одной и той же траекторией рассуждения.
GRAM решает это, вводя обученную случайность на каждом шаге уточнения.
Модель не фиксирует одно следующее состояние, а сэмплирует слегка отличающееся направление, так возникает веер разнообразных траекторий.
Надо отметить, что случайность не произвольная, а выученная со своими значениями и вариантами для каждого состояния.
На инференсе модель запускает множество таких путей параллельно и выбирает лучший через небольшой reward-предиктор, обученный вместе с основной моделью.
На сложных судоку GRAM с 10M параметров достигает 97% точности против 87.4% у лучшей предыдущей рекурсивной модели. Уже с 20 параллельными сэмплами при 16 итерациях она обходит все детерминированные базовые модели даже при 320 итерациях рекурсии.
На задачах со множественными решениями N-Queens и Graph Coloring детерминированные модели деградируют по мере роста числа валидных ответов. GRAM сохраняет стабильную точность.
ИИ-модель GRAM (Generative Recursive Reasoning) с 10 млн параметров обошла детерминированных конкурентов почти втрое большего размера за счёт того, чего обычные рекурсивные модели не умеют: исследовать несколько траекторий рассуждения одновременно.
Проблема существующих рекурсивных моделей в том, что они полностью детерминированы: при одном и том же входе всегда идут одной и той же траекторией рассуждения.
GRAM решает это, вводя обученную случайность на каждом шаге уточнения.
Модель не фиксирует одно следующее состояние, а сэмплирует слегка отличающееся направление, так возникает веер разнообразных траекторий.
Надо отметить, что случайность не произвольная, а выученная со своими значениями и вариантами для каждого состояния.
На инференсе модель запускает множество таких путей параллельно и выбирает лучший через небольшой reward-предиктор, обученный вместе с основной моделью.
На сложных судоку GRAM с 10M параметров достигает 97% точности против 87.4% у лучшей предыдущей рекурсивной модели. Уже с 20 параллельными сэмплами при 16 итерациях она обходит все детерминированные базовые модели даже при 320 итерациях рекурсии.
На задачах со множественными решениями N-Queens и Graph Coloring детерминированные модели деградируют по мере роста числа валидных ответов. GRAM сохраняет стабильную точность.