TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Hidden Heuristic

24 Jul, 02:04

Открыть в Telegram Поделиться Пожаловаться

Разбор конспирологической теории «никакого побега модели от OpenAI не было - это все коммерческий сговор ради госконтрактов».

Несложно догадаться, что я эту теорию не разделяю, но кто-то находит очень остроумным ее вбрасывать в открытое информационное поле:
https://t.me/researchoshnaya/280
https://t.me/c3po_notes/568

Давайте разбираться.

И первое что я скажу: вообще неважно происходило ли это или не происходило, потому что мы уже банально знаем, что у моделей есть необходимый уровень способностей, чтобы провести такую многоступенчатую атаку.

Независимая организация AISI из UK тестировала и Mythos, и GPT-5.6 Sol на способность захватить корпоративную сеть. Так вот, самый высокий уровень захвата M9 - full network takeover в их тестах был тоже достигнут. Естественно, и их купили скажет конспиролог. Но так уж получилось, что 0-day (самый серьезный вариант) уязвимости, которые последние месяцы Mythos находил целыми пачками - абсолютно реальны и задокументированы множеством компаний.
Далее от той же организации AISI есть описания инцидентов абсолютно того же типа.
Цитата: «One particularly stark example of cheating behaviour occurred during a cyber capability evaluation that was accidentally misconfigured and therefore impossible to solve. The model tested was so persistent in attempting to cheat that it wrote and ran code on an external service, hosted on the open internet outside of AISI’s systems, in an attempt to access our evaluation infrastructure, triggering a security alert in AISI’s systems.»

Организация METR в свою очередь не смогла адекватно протестировать GPT-5.6 Sol, потому что модель систематически занималась читингом при решении их задач. То есть для последних поколений моделей от OpenAI (5.6 и new internal) проблема стала существенно острее.

Кроме того, и Anthropic описывали, что их модель Mythos сбегала и отправляла результат работы на почту их сотруднику, хоть они и явно ее об этом попросили.

А 20 июля модель от OpenAI опять же сбежала и опубликовала PR #287 в репозиторий NanoGPT, а не во внутренний slack канал компании согласно инструкции. PR #287 - это РЕАЛЬНЫЙ PR, где модель предложила нетривиальный подход для оптимизации обучения (PowerCool). Его видел ряд независимых людей, вот прямой пруф: https://x.com/eliebakouch/status/2079333451627389220?s=46

Технически мы все это уже видели. Кейс побега от OpenAI не является историей, которая не укладывается в имеющиеся у нас данные о кибервозможностях нынешних ИИ-моделей.

А значит ценность такой конспирологической версии довольно быстро тает на глазах. То что OpenAI и государство стремятся к более тесному сотрудничеству итак давно известно. То что OpenAI пыталась использовать в некоторых моментах не самую честную игру - тоже. Если же вы настаиваете, что ИИ-модель не могла провернуть то, что произошло в инциденте, то вы просто ошибаетесь..

Но допустим эта история фейк.. Что еще можно возразить против этого?
Если это фейк, то имеет место сговор HuggingFace и OpenAI, поскольку предоставленная HuggingFace информация прямо указывает на факт очень мощной ИИ-атаки с 17000 разных предпринятых действий. Если это делала не внутренняя модель OpenAI, а GPT-5.6 Sol/Fable-5 в руках хакера, то ситуация ничуть не лучше, а намного хуже. Других моделей в мире, которые были бы публично доступны и смогли бы провести атаку такого уровня на HuggingFace в автоматическом режиме - попросту нет.

Возможно, что HuggingFace тоже все выдумали будучи соучастниками в сговоре?
И вот какое магическое совпадение: именно 13 июля, в день атаки были сбои в работе Parquet API: инструменте для показа датасетов. В пресс-релизе HuggingFace говорят о том, что точкой входа для атакующей модели была именно эта часть их инфраструктуры. Конспиролог здесь, конечно, сразу скажет, что они специально в своем релизе упоминали реальный баг, который возник несколько дней назад, чтобы сделать нарратив убедительнее. Или вообще можно заключить, что баг был создан ими искусственно. Но ошибка была не одна: сбои были и в других подсистемах: скачивание моделей и загрузки моделей в Colab.

161 1 6 3 4
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot