Ну и раз пошла такая пьянка вот еще статья, которая использует 2 перспективных подхода сразу - https://arxiv.org/pdf/2606.00324
Пейпер от пинтереста
В чем суть?
Также хотим LLM научить понимать сиды . Один из челленжей, что [5, 1] и [6, 1] - префиксы семантиков имеют разный смысл для 1 , которая на 2-ом месте.
Что делают?
Применяют префикс-хеш трюк из метовской статьи - https://arxiv.org/abs/2504.02137 . То есть берем hash([5, 1])/ T - где T размер хэш таблицы. Таким образом можно менять количество эмбедингов, которые кодируют семантики - больше параметров в саму модельку, и помочь начать различать префиксы на уровне обучения.
И вторая идея наследуют вайб прошлого поста: учат дополнительный энкодер по семантикам предсказывать тексты. Это позволяет сразу в модельку зашить информацию про токены семантиков.
Саму модельку учат на последовательностях (text, sisds, text1, sids1) предсказывать NTP. (ниже картинка какие еще есть).
Результат
Пробовали дополнительный энкодер предобучать перед тем как подавать в основную задачу и это вырастило метрику. Также префикс хешинг дал аплифт. В качестве бейзлайна взяли ванила LLM на NTP шечку.
В Итоге притрейн дал качество как и хешинг причем кратный
Пейпер от пинтереста
В чем суть?
Также хотим LLM научить понимать сиды . Один из челленжей, что [5, 1] и [6, 1] - префиксы семантиков имеют разный смысл для 1 , которая на 2-ом месте.
Что делают?
Применяют префикс-хеш трюк из метовской статьи - https://arxiv.org/abs/2504.02137 . То есть берем hash([5, 1])/ T - где T размер хэш таблицы. Таким образом можно менять количество эмбедингов, которые кодируют семантики - больше параметров в саму модельку, и помочь начать различать префиксы на уровне обучения.
И вторая идея наследуют вайб прошлого поста: учат дополнительный энкодер по семантикам предсказывать тексты. Это позволяет сразу в модельку зашить информацию про токены семантиков.
Саму модельку учат на последовательностях (text, sisds, text1, sids1) предсказывать NTP. (ниже картинка какие еще есть).
Результат
Пробовали дополнительный энкодер предобучать перед тем как подавать в основную задачу и это вырастило метрику. Также префикс хешинг дал аплифт. В качестве бейзлайна взяли ванила LLM на NTP шечку.
В Итоге притрейн дал качество как и хешинг причем кратный