Канарейка поможет вам ловить ИИ на лжи 🤩
Есть простой трюк, который позволяет заметить, когда ChatGPT или Claude вот-вот начнут выдумывать факты. Попросите нейросеть в самом первом промпте или начале диалога обращаться к вам по имени в каждом сообщении.
Когда чат разрастается, модель перегружает контекстное окно — и первыми она «роняет» именно мелкие инструкции. Имя исчезает из ответов раньше, чем появляются ошибки в фактах. Это называют методом «канарейки»: шахтёры брали птицу с собой в глубину, и если та замолкала — значит, воздух уже плохой. Здесь та же логика: пока ИИ помнит имя — всё в порядке, забыл — пора открывать новый чат.
Идеей поделился создатель OpenClaw Питер Штейнберге на подкасте у Фридмана. Он вшил такие «канарейки» прямо в системный файл своего ИИ-агента. Любое отклонение от мелкой инструкции — сигнал тревоги, а не просто досадная мелочь 🤩
@creativethecreator
Есть простой трюк, который позволяет заметить, когда ChatGPT или Claude вот-вот начнут выдумывать факты. Попросите нейросеть в самом первом промпте или начале диалога обращаться к вам по имени в каждом сообщении.
Когда чат разрастается, модель перегружает контекстное окно — и первыми она «роняет» именно мелкие инструкции. Имя исчезает из ответов раньше, чем появляются ошибки в фактах. Это называют методом «канарейки»: шахтёры брали птицу с собой в глубину, и если та замолкала — значит, воздух уже плохой. Здесь та же логика: пока ИИ помнит имя — всё в порядке, забыл — пора открывать новый чат.
Идеей поделился создатель OpenClaw Питер Штейнберге на подкасте у Фридмана. Он вшил такие «канарейки» прямо в системный файл своего ИИ-агента. Любое отклонение от мелкой инструкции — сигнал тревоги, а не просто досадная мелочь 🤩
@creativethecreator