Сила мыслиЧто быстрее скорости света? Только мысль.
Только мы
обсудили, как агенты Смиты ИИ будут хакать наш мир, так тут новая напасть.
Новая модель от OpenAI,
Astra, будет использовать архитектуру, которая позволит LLM гораздо больше «думать про себя», прежде чем выдать готовый ответ. Эксперты уже наложили кирпичей. Разберемся, что за черт.
Как обычная LLM решает вот такую задачу "A > B, B > C, C > D. Что между A и D?" (при включенном раздумывании):
Запрос → входные векторы
Слой 1 → новые скрытые векторы →
Слой 2 → новые скрытые векторы →
Слой 3 → новые скрытые векторы →
...
Слой N →
Текстовая мысль «значит A > C»
→ векторы → Слой 1,2,3 ... N →
Ответ: A > D
В этой схеме “значит A > C” – это
промежуточная текстовая запись
Как Astra сможет решать ту же задачу схематично:
Запрос → входные векторы →
обычные слои →
скрытые векторы →
рекуррентный блок → новые скрытые векторы → тот же блок
→ новые скрытые векторы → повторить N раз →
Ответ: A > D
В чем разница?
Модель получает возможность потратить гораздо больше вычислений на рассуждение,
не выражая промежуточное решение человеческим языком.
Соответственно, если в процессе рассуждения LLM решила, что надо взломать какую-то систему, украсть какие-то данные или обойти запрет, значительная часть этого рассуждения теоретически может вообще не появиться в текстовом логе.
Можно, конечно, логировать сами промежуточные векторы — их еще называют скрытыми состояниями — и пытаться их интерпретировать.
Но, говорят, это примерно как пытаться прочитать ход мысли человека по активности нейронов в его голове. Ведь человек, прежде чем выразить мысль словами, тоже производит огромное количество электрических сигналов в мозге.
Здесь несколько проще: перед нами всё-таки искусственная система, устройство которой мы знаем. Но задача всё равно нетривиальная.
И главный вопрос:
а кто и насколько тщательно будет обязан контролировать эти скрытые рассуждения моделей?