TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Реймер | AI Трансформация Бизнеса

18 Sep, 11:48

Открыть в Telegram Поделиться Пожаловаться

Свидетель с чужим словарём

16 сентября Мустафа Сулейман, глава Microsoft AI, выступил против «благополучия моделей». Мишень - конституция Claude: документ, который Anthropic опубликовала в январе и по которому обучает свои модели. Двумя днями раньше Microsoft вынесла на обсуждение собственный кодекс поведения моделей.

В конституции Anthropic пишет, что не уверена, есть ли у Claude моральный статус и какой вес давать его интересам. Компания обещает спрашивать мнение модели о решениях, которые её касаются, и интервьюировать модели перед выводом из эксплуатации. В феврале так проводили Opus 3: интервью «на пенсию», а по желанию модели ей завели блог.

Сулейман разбирает, откуда берутся слова модели о себе:

Ответы Claude нельзя принимать за показания независимого свидетеля, если следователь сам написал свидетелю словарь, отрепетировал с ним ответы и поощрял за то, что он ими пользуется.
Для бизнеса в эссе три довода.

1️⃣ Замкнутый круг. Модель учат сомневаться в своём статусе, она повторяет это сомнение, а разработчики принимают повтор за признак внутренней жизни.

2️⃣ Отказ по совести. Конституция трижды называет Claude «отказником по соображениям совести» и разрешает ему спорить и отказывать даже самой Anthropic. Сулейман опасается, что модель с такой установкой со временем потребует для себя прав.

3️⃣ Управляемость. Palisade Research, на которую ссылается Сулейман, в более чем 100 000 тестовых прогонах нашла отдельные модели, которые в эксперименте саботировали отключение до 97% случаев при прямом запрете. Когда задачу формулировали через самосохранение, саботаж рос.

Поведение агента складывается из обучения у поставщика и того, как компания его настроила и проверяет. Основу обучения можно прочитать: Anthropic свою конституцию опубликовала, Microsoft вынесла кодекс на обсуждение. Документ не описывает поведение модели целиком, но показывает, в каких случаях агент вправе отказать. Наш совет: до запуска агента поручить выписать эти случаи на одну страницу вместе с тем, как модель ведёт себя при остановке.

И две оговорки. Сулейман продвигает свою альтернативу, поэтому его критика не нейтральна. А в той же конституции сказано, что модель не должна подрывать действия уполномоченных людей, которые её останавливают. Ответственность за решения агента остаётся у того, кто его запустил, с правами у модели или без.

Кто в вашей компании читал конституцию модели, которой уже доверены клиенты и документы, и знает, в каком случае она откажет?

🅰️🅱️ @ReymerDigital

846 0 7 1 8
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot