Привет! С вами Андрей — DS-инженер в Авито.
Сегодня продолжаем копаться в статьях, которые мне показались любопытными. В этот раз статья от исследователей Apple о том, как сломать safety-механизм LLM с помощью утюга и паяльника изменения всего одного нейрона.
Погнали!
Ссылки
[1] Модели и setup: Abstract · Models, Data, and Evaluation
[2] Поиск refusal neurons: Feature Selection and Reranking · Ranking
[3] Как устроено вмешательство: Intervention · Implementation
[4] Attack effectiveness и сравнение с Arditi: Attack Effectiveness and Capability Preservation · Per-model ASR
[5] Anchor-based intervention и сохранение capabilities: Anchor-based intervention · Capability preservation
[6] Интерпретация по токенам: Token-Level Interpretability
[7] Нейроны в base-моделях: Refusal Neurons Emerge During Pretraining
[8] Concept neurons: Suicide Neurons
Сегодня продолжаем копаться в статьях, которые мне показались любопытными. В этот раз статья от исследователей Apple о том, как сломать safety-механизм LLM с помощью утюга и паяльника изменения всего одного нейрона.
Погнали!
Ссылки
[1] Модели и setup: Abstract · Models, Data, and Evaluation
[2] Поиск refusal neurons: Feature Selection and Reranking · Ranking
[3] Как устроено вмешательство: Intervention · Implementation
[4] Attack effectiveness и сравнение с Arditi: Attack Effectiveness and Capability Preservation · Per-model ASR
[5] Anchor-based intervention и сохранение capabilities: Anchor-based intervention · Capability preservation
[6] Интерпретация по токенам: Token-Level Interpretability
[7] Нейроны в base-моделях: Refusal Neurons Emerge During Pretraining
[8] Concept neurons: Suicide Neurons