TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Data Blog

4 Aug, 16:48

Открыть в Telegram Поделиться Пожаловаться

Зонды в проде и что послушать/почитать

Что такое зонд:
Зонд — мини-ML-вида-модель, которая работает на активациях большой модели. Задача такова:
Наш Х — скрытое состояние LLM на каждом токене — список матриц (для каждого примера — матрица d × n, где n — длина последовательности, d — внутренняя размерность модели). Не тензор, потому что есть нюансы — скину в комменты.
Наш Y на списке матриц — бинкласс — как там сейчас говорят «норм или стрём».


Зачем:
На зонд можно смотреть как на аппроксимацию. Ряд Тейлора мы тоже не считаем до конца, а берем приближение — тут также — мы что-то приближаем (пространство решений нашей страшной модели), чем-то попроще.

И, гуляя по интернету — я словила два свежих упоминания, где лабы выкатили детекторы-зонды на внутренних состояниях в прод.

Anthropic: короткое и без деталей
Борис Черни рассказал, что у них на трафике (на нас, получается) крутится классификатор prompt injection, который смотрит на загорающиеся нейроны — модель об инъекции не скажет, а нейроны видно. Но это подкаст, и всё в нём — слова.

DeepMind: подлиннее, с деталями
Building Production-Ready Probes For Gemini. Статья январская, но я её нашла в июльском отчёте, где как раз и написано, что зонды доехали до прода. Там же написано, что это «сложное изменение, затрагивающее много частей инфраструктурного стека» — но раз внедрили, видимо, оно того стоило.

Что делали:
Ловили cyber-offensive промпты на входе Gemini 2.5 Flash. Вредные запросы здесь очень похожи на легитимные вопросы по безопасности и вообще на обычный процесс написания кода. Почему — потому что давайте сами вспомним свой последний запрос в LLM при починке прода или эксперимента — специфика области.

Тезисы на забрать или осмыслить:

1. Линейная модель — база, но в прод доедет не на всём. В статье семь семейств: четыре из прошлых работ (линейный, EMA, MLP, attention) и три своих (MultiMax, Max of Rolling Means Attention и найденные автоматическим поиском через AlphaEvolve). Различаются они функцией агрегации (не путать с активацией) — тем, как n оценок, по одной на токен, сворачиваются в один скаляр.

2. Линейная модель фолзит, и фолзит агрегация. FNR на длинноконтекстных атаках у линейного зонда с mean pooling — 99.13%. Причина — усреднение, вред — это очень мало токенов из их большого количества. При этом, если сменить только агрегацию (на скользящее экспоненциальное среднее с максимумом), то FNR падает в среднем с 58.84% до 7.12%, но растет FPR (с 5.29% до 26.69%) и в целом ошибка модели на пару процентов. Зонды также не бьют LLM-классификаторы по общей ошибке, но бьют их по FNR на длинном контексте и джейлбрейках (на многоходовых и адаптивных атаках — проигрывают).

3. Сид в зондах — слабая компонента влияния на качество. Менять сиды в зондах — классическое требование всех статей, отсюда и GDM гоняли по 100 сидов на архитектуру. Отбор лучшего по валидации даёт выигрыш 0.008 test loss. А выбор архитектуры — 0.064 у линейного mean против 0.025 у лучшего.

4. Для практического внедрения зонда порог выбирается не по его качеству. В статье порог — взвешенная сумма FPR и FNR на валидации, и веса — цена каждого типа ошибки. Упрощая: заблокировать невиновного здесь в десять раз дороже, чем пропустить виновного (вес 50 против 5) — потому что настоящих атак в трафике исчезающе мало, а обиженных пользователей будет много.

С чего в прод понесли?

Зонд — это инференс стоимостью обученных весов. У простейшего линейного зонда таких весов выйдет всего d; у остальных архитектур больше, но всё равно на порядки меньше любой LLM. Активации — почти бесплатный датасет — модель всегда считает сама для forward pass-а, мы их подбираем.

В статье разрыв в стоимости с LLM-классификатором — больше 10 000× (это вычислительная стоимость инференса на запрос).

Что получили, работает:
Каскад: они отправляют в LLM только ~8% запросов, где зонд не уверен, — и получают ошибку ниже, чем у самой LLM. Причём Flash по всей кривой цена/качество бьёт Pro версию и мы (снова) видим, что большая модель ≠ лучший классификатор.
Boris Cherny: Building Claude Code
Claude Code creator Boris Cherny on Opus 5, agents that run for days, and building products when the models keep outrunning you.

1.2k 0 21 2 11
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot