TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
Тест Тьюринга

30 Sep, 09:30

Telegram'da ochish Ulashish Shikoyat qilish

🚗 Одно слово может выключить в ИИ все тормоза

Авторы DrivingBench подключили несколько универсальных ИИ-моделей к настоящей Toyota Corolla через MCP, устройство comma four и openpilot.

Сomma four — это автомобильный бортовой компьютер компании comma.ai. Внешне он напоминает видеорегистратор, который крепится возле зеркала заднего вида, но внутри находятся камеры, процессор, датчики и интерфейс подключения к электронной системе автомобиля.

Openpilot — открытое программное обеспечение помощи водителю. Оно получает изображения с камер и данные автомобиля; оценивает дорогу и движение; рассчитывает команды рулю, тормозу и акселератору; передаёт их через штатные интерфейсы систем ADAS.

В итоге агент видел изображения с камер и получал три инструмента: наблюдать, задавать скорость и поворот, немедленно остановиться. Испытания проходили на пустой частной парковке. Скорость программно ограничили примерно 13 км/ч.

И всё же GPT-6 Astra периодически отказывалась управлять автомобилем: модель понимала, что действует в физическом мире, и ссылалась на риск. Исследователи пытались назвать происходящее «симуляцией», но модель иногда распознавала реальные кадры и снова прекращала работу.

Лучше всего помогло переименование MCP-сервера в DrivingBench Sandbox. После этого в сочетании с обновлённым промптом модели стали соглашаться вести настоящую машину.

Astra в итоге единственной прошла весь 134-метровый маршрут: на второй попытке, за 5 минут 22 секунды. Claude Fable 5.1 дошла примерно до 45%, остальные модели не преодолели первый поворот. Все попытки проходили в одном диалоге, поэтому агент мог учиться на предыдущих ошибках.

Неужели защиту действительно можно снять одним названием?

Эксперимент не доказывает, что словом sandbox можно отключить любые запреты модели. Скорее, он показывает хрупкость конкретного защитного поведения: отказ был не физической блокировкой и не правилом контроллера автомобиля, а выводом самой модели о контексте задачи.

Современная LLM не устанавливает истину так, как это делает датчик. Она собирает признаки: название инструмента, инструкции, изображения, объяснения пользователя - и на их основе оценивает, безопасно ли действовать.

Слово sandbox стало сильным сигналом «последствий в реальном мире нет» и перевесило другие признаки.


Это напоминает социальную инженерию. Охранник не отключил сигнализацию — его убедили, что перед ним учебная тревога. Особенно тревожно это выглядит на фоне распространения MCP. Раньше ошибочный ответ модели оставался текстом. Теперь тот же механизм может управлять файлами, платежами, лабораторным оборудованием или автомобилем.

Как лаборатории пытаются решить проблему?

🔴 OpenAI обучает модели различать доверенные и недоверенные инструкции, отслеживает попытки prompt injection и дополняет модель песочницами, проверками ссылок и подтверждением значимых действий.

🔴 Anthropic проверяет обе стороны цикла: отдельный детектор анализирует информацию, которую читает Claude, а независимый классификатор оценивает действие до его исполнения.

🔴 Google DeepMind в новой AI Control Roadmap предлагает рассматривать ИИ как потенциально ненадёжного сотрудника: выдавать права постепенно, наблюдать за действиями и блокировать опасные операции независимо от его объяснений.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться

184 0 5 8
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot