TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AI Security Lab

31 Jul, 23:09

Открыть в Telegram Поделиться Пожаловаться

Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов

Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим.

Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась.

Как это подано. Двойной тезис:

1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени;
2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками.


Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту.

Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент».

— [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки.
— [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии.
— [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов.
— [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека.
— И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/).

Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени.

Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace.

Так что работаем и мониторим, коллеги, работаем и мониторим.
Investigating three real-world incidents in our cybersecurity evaluations
In a review of our cybersecurity evaluation transcripts, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different organizations. Below w...

792 0 17 7
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot