TabFM - придумали foundation-модель для табличных данных (что? 😅), и она SOTA на TabArena
В отличие от привычных LightGBM, CatBoost или TabM, она работает в zero-shot режиме: для нового датасета не требуется обучение или подбор гиперпараметров, достаточно передать обучающие строки в качестве контекста. TabFM рассматривает задачу табличного ML как in-context learning. Вместо обучения под конкретный датасет обучающие строки передаются модели как контекст. Веса модели не обновляются - достаточно одного forward pass. Архитектура сочетает идеи TabPFN и TabICL: row/column attention, компрессию строк и transformer для in-context learning. Модель обучали на сотнях миллионов синтетических таблиц, ибо открытых данных мало. Из минусов - лицензия только для некоммерческого использования
Удивительно, но это действительно работает. Во всех моих экспериментах TabFM показал качество выше, чем бустинги, даже без какого-либо обучения под датасет. Причем на самом большом датасете контекст пришлось сократить из-за нехватки памяти, но TabFM все равно показала лучший результат.
Ниже - сравнение качества и времени работы. Время указано для GPU, без которого TabFM работал бы еще на пару порядков медленнее
В отличие от привычных LightGBM, CatBoost или TabM, она работает в zero-shot режиме: для нового датасета не требуется обучение или подбор гиперпараметров, достаточно передать обучающие строки в качестве контекста. TabFM рассматривает задачу табличного ML как in-context learning. Вместо обучения под конкретный датасет обучающие строки передаются модели как контекст. Веса модели не обновляются - достаточно одного forward pass. Архитектура сочетает идеи TabPFN и TabICL: row/column attention, компрессию строк и transformer для in-context learning. Модель обучали на сотнях миллионов синтетических таблиц, ибо открытых данных мало. Из минусов - лицензия только для некоммерческого использования
Удивительно, но это действительно работает. Во всех моих экспериментах TabFM показал качество выше, чем бустинги, даже без какого-либо обучения под датасет. Причем на самом большом датасете контекст пришлось сократить из-за нехватки памяти, но TabFM все равно показала лучший результат.
Ниже - сравнение качества и времени работы. Время указано для GPU, без которого TabFM работал бы еще на пару порядков медленнее