Между строк
Увидел занятную публикацию "Subliminal Learning: Language models transmit behavioral traits via hidden signals in data" (arXiv:2507.14805) на канале Ряды Фурье.
Зацепила прежде всего мысль о том, что благодаря специально оформленному датасету можно в процессе дообучения привить модели нетипичное поведение, например заставить её полюбить что-то, либо же начать вести себя агрессивно, либо добиться какого-то иного эффекта (скажем "расцензурировать" модель).
При этом занятнее всего то, что сторонний наблюдатель, будь то человек или же другая нейросеть, заметить созданные скрытые смыслы в датасете не сможет, но есть и недостаток, атака работает только на моделях которые эти датасеты со скрытыми смыслами и создали.
Увидел занятную публикацию "Subliminal Learning: Language models transmit behavioral traits via hidden signals in data" (arXiv:2507.14805) на канале Ряды Фурье.
Зацепила прежде всего мысль о том, что благодаря специально оформленному датасету можно в процессе дообучения привить модели нетипичное поведение, например заставить её полюбить что-то, либо же начать вести себя агрессивно, либо добиться какого-то иного эффекта (скажем "расцензурировать" модель).
При этом занятнее всего то, что сторонний наблюдатель, будь то человек или же другая нейросеть, заметить созданные скрытые смыслы в датасете не сможет, но есть и недостаток, атака работает только на моделях которые эти датасеты со скрытыми смыслами и создали.