Зонды в проде и что послушать/почитать
Что такое зонд:
Зачем:
На зонд можно смотреть как на аппроксимацию. Ряд Тейлора мы тоже не считаем до конца, а берем приближение — тут также — мы что-то приближаем (пространство решений нашей страшной модели), чем-то попроще.
И, гуляя по интернету — я словила два свежих упоминания, где лабы выкатили детекторы-зонды на внутренних состояниях в прод.
Anthropic: короткое и без деталей
Борис Черни рассказал, что у них на трафике (на нас, получается) крутится классификатор prompt injection, который смотрит на загорающиеся нейроны — модель об инъекции не скажет, а нейроны видно. Но это подкаст, и всё в нём — слова.
DeepMind: подлиннее, с деталями
Building Production-Ready Probes For Gemini. Статья январская, но я её нашла в июльском отчёте, где как раз и написано, что зонды доехали до прода. Там же написано, что это «сложное изменение, затрагивающее много частей инфраструктурного стека» — но раз внедрили, видимо, оно того стоило.
Что делали:
Ловили cyber-offensive промпты на входе Gemini 2.5 Flash. Вредные запросы здесь очень похожи на легитимные вопросы по безопасности и вообще на обычный процесс написания кода. Почему — потому что давайте сами вспомним свой последний запрос в LLM при починке прода или эксперимента — специфика области.
Тезисы на забрать или осмыслить:
1. Линейная модель — база, но в прод доедет не на всём. В статье семь семейств: четыре из прошлых работ (линейный, EMA, MLP, attention) и три своих (MultiMax, Max of Rolling Means Attention и найденные автоматическим поиском через AlphaEvolve). Различаются они функцией агрегации (не путать с активацией) — тем, как n оценок, по одной на токен, сворачиваются в один скаляр.
2. Линейная модель фолзит, и фолзит агрегация. FNR на длинноконтекстных атаках у линейного зонда с mean pooling — 99.13%. Причина — усреднение, вред — это очень мало токенов из их большого количества. При этом, если сменить только агрегацию (на скользящее экспоненциальное среднее с максимумом), то FNR падает в среднем с 58.84% до 7.12%, но растет FPR (с 5.29% до 26.69%) и в целом ошибка модели на пару процентов. Зонды также не бьют LLM-классификаторы по общей ошибке, но бьют их по FNR на длинном контексте и джейлбрейках (на многоходовых и адаптивных атаках — проигрывают).
3. Сид в зондах — слабая компонента влияния на качество. Менять сиды в зондах — классическое требование всех статей, отсюда и GDM гоняли по 100 сидов на архитектуру. Отбор лучшего по валидации даёт выигрыш 0.008 test loss. А выбор архитектуры — 0.064 у линейного mean против 0.025 у лучшего.
4. Для практического внедрения зонда порог выбирается не по его качеству. В статье порог — взвешенная сумма FPR и FNR на валидации, и веса — цена каждого типа ошибки. Упрощая: заблокировать невиновного здесь в десять раз дороже, чем пропустить виновного (вес 50 против 5) — потому что настоящих атак в трафике исчезающе мало, а обиженных пользователей будет много.
С чего в прод понесли?
Зонд — это инференс стоимостью обученных весов. У простейшего линейного зонда таких весов выйдет всего d; у остальных архитектур больше, но всё равно на порядки меньше любой LLM. Активации — почти бесплатный датасет — модель всегда считает сама для forward pass-а, мы их подбираем.
В статье разрыв в стоимости с LLM-классификатором — больше 10 000× (это вычислительная стоимость инференса на запрос).
Что получили, работает:
Каскад: они отправляют в LLM только ~8% запросов, где зонд не уверен, — и получают ошибку ниже, чем у самой LLM. Причём Flash по всей кривой цена/качество бьёт Pro версию и мы (снова) видим, что большая модель ≠ лучший классификатор.
Что такое зонд:
Зонд — мини-ML-вида-модель, которая работает на активациях большой модели. Задача такова:
Наш Х — скрытое состояние LLM на каждом токене — список матриц (для каждого примера — матрица d × n, где n — длина последовательности, d — внутренняя размерность модели). Не тензор, потому что есть нюансы — скину в комменты.
Наш Y на списке матриц — бинкласс — как там сейчас говорят «норм или стрём».
Зачем:
На зонд можно смотреть как на аппроксимацию. Ряд Тейлора мы тоже не считаем до конца, а берем приближение — тут также — мы что-то приближаем (пространство решений нашей страшной модели), чем-то попроще.
И, гуляя по интернету — я словила два свежих упоминания, где лабы выкатили детекторы-зонды на внутренних состояниях в прод.
Anthropic: короткое и без деталей
Борис Черни рассказал, что у них на трафике (на нас, получается) крутится классификатор prompt injection, который смотрит на загорающиеся нейроны — модель об инъекции не скажет, а нейроны видно. Но это подкаст, и всё в нём — слова.
DeepMind: подлиннее, с деталями
Building Production-Ready Probes For Gemini. Статья январская, но я её нашла в июльском отчёте, где как раз и написано, что зонды доехали до прода. Там же написано, что это «сложное изменение, затрагивающее много частей инфраструктурного стека» — но раз внедрили, видимо, оно того стоило.
Что делали:
Ловили cyber-offensive промпты на входе Gemini 2.5 Flash. Вредные запросы здесь очень похожи на легитимные вопросы по безопасности и вообще на обычный процесс написания кода. Почему — потому что давайте сами вспомним свой последний запрос в LLM при починке прода или эксперимента — специфика области.
Тезисы на забрать или осмыслить:
1. Линейная модель — база, но в прод доедет не на всём. В статье семь семейств: четыре из прошлых работ (линейный, EMA, MLP, attention) и три своих (MultiMax, Max of Rolling Means Attention и найденные автоматическим поиском через AlphaEvolve). Различаются они функцией агрегации (не путать с активацией) — тем, как n оценок, по одной на токен, сворачиваются в один скаляр.
2. Линейная модель фолзит, и фолзит агрегация. FNR на длинноконтекстных атаках у линейного зонда с mean pooling — 99.13%. Причина — усреднение, вред — это очень мало токенов из их большого количества. При этом, если сменить только агрегацию (на скользящее экспоненциальное среднее с максимумом), то FNR падает в среднем с 58.84% до 7.12%, но растет FPR (с 5.29% до 26.69%) и в целом ошибка модели на пару процентов. Зонды также не бьют LLM-классификаторы по общей ошибке, но бьют их по FNR на длинном контексте и джейлбрейках (на многоходовых и адаптивных атаках — проигрывают).
3. Сид в зондах — слабая компонента влияния на качество. Менять сиды в зондах — классическое требование всех статей, отсюда и GDM гоняли по 100 сидов на архитектуру. Отбор лучшего по валидации даёт выигрыш 0.008 test loss. А выбор архитектуры — 0.064 у линейного mean против 0.025 у лучшего.
4. Для практического внедрения зонда порог выбирается не по его качеству. В статье порог — взвешенная сумма FPR и FNR на валидации, и веса — цена каждого типа ошибки. Упрощая: заблокировать невиновного здесь в десять раз дороже, чем пропустить виновного (вес 50 против 5) — потому что настоящих атак в трафике исчезающе мало, а обиженных пользователей будет много.
С чего в прод понесли?
Зонд — это инференс стоимостью обученных весов. У простейшего линейного зонда таких весов выйдет всего d; у остальных архитектур больше, но всё равно на порядки меньше любой LLM. Активации — почти бесплатный датасет — модель всегда считает сама для forward pass-а, мы их подбираем.
В статье разрыв в стоимости с LLM-классификатором — больше 10 000× (это вычислительная стоимость инференса на запрос).
Что получили, работает:
Каскад: они отправляют в LLM только ~8% запросов, где зонд не уверен, — и получают ошибку ниже, чем у самой LLM. Причём Flash по всей кривой цена/качество бьёт Pro версию и мы (снова) видим, что большая модель ≠ лучший классификатор.