Masked Autoencoders Learn Perception-Relevant Representations from Resting State Neural Data
link: https://arxiv.org/abs/2607.22615
tl;dr: предобучаем MAE на 14.6 часах спонтанной активности из V1 слепого пациента с Utah array и по нейронному отклику на стимуляцию декодируем, видит человек фосфен или нет. Реальные данные пациента.
Наконец-то дошли руки написать мини обзор моей статьи с AAAI 26. Постером я уже делился, а теперь она доехала и до архива.
Итак, мы работаем с сигналами Utah массива из V1 слепых людей: можем и стимулировать, и записывать. Было бы здорово не спрашивать человека каждый раз, видит он что-то или нет, а понимать это прямо по нейронному отклику на стимуляцию. Плюс у нас накопилась куча спонтанной активности: 252 сессии, 14.6 часа записи с 96 каналов. Вот и вопрос: можно ли предобучить модель на этих данных так, чтобы она помогала понять, видит человек или нет.
Модель
За основу взял MAE, кстати один из первых обзоров на этом канале был именно про эту модель, много лет назад. Натренировал и увидел в латентах кучу кластеров по сессиям, что совсем не ложится на задачу: мы хотим отличать, видит человек или нет, а не угадывать, в какой день была сделана запись. Поэтому добавил второй лосс, по сути sigmoid loss как в SigLIP, только наоборот: притягиваю фичи из разных сессий и отталкиваю фичи из одной. Плюс подаю в декодер эмбеддинг сессии отдельным токеном: вся сессионная информация уходит туда, и энкодеру просто незачем хранить её в латентах. Латентное пространство стало выглядеть сильно лучше, и метрики подтянулись.
Результаты
Поверх замороженного энкодера учим обычную логистическую регрессию. На психометрической задаче (человек отвечает видит или нет на стимуляции с разной силой тока и электродами) получаем 84.1% против 80.2% на сырой MUA и 82.4% на PCA. Забегая вперёд, в латентах ещё видно, каким электродом стимулировали и с каким током: соседние электроды кластеризуются вместе. Но самое интересное это пороговая задача: тот же электрод, ток зафиксирован на пороге 50%, человек то видит фосфен, то нет. И даже тут мы декодируем восприятие на 64% против 60% на сырых данных.
Так что наконец закрыл гештальт и поделился, а то собирался уже несколько недель и всё никак не мог дойти. Дальше думаю превратить это в полноценную статью: обучиться на нескольких людях и сделать нормальные абляции.
link: https://arxiv.org/abs/2607.22615
tl;dr: предобучаем MAE на 14.6 часах спонтанной активности из V1 слепого пациента с Utah array и по нейронному отклику на стимуляцию декодируем, видит человек фосфен или нет. Реальные данные пациента.
Наконец-то дошли руки написать мини обзор моей статьи с AAAI 26. Постером я уже делился, а теперь она доехала и до архива.
Итак, мы работаем с сигналами Utah массива из V1 слепых людей: можем и стимулировать, и записывать. Было бы здорово не спрашивать человека каждый раз, видит он что-то или нет, а понимать это прямо по нейронному отклику на стимуляцию. Плюс у нас накопилась куча спонтанной активности: 252 сессии, 14.6 часа записи с 96 каналов. Вот и вопрос: можно ли предобучить модель на этих данных так, чтобы она помогала понять, видит человек или нет.
Модель
За основу взял MAE, кстати один из первых обзоров на этом канале был именно про эту модель, много лет назад. Натренировал и увидел в латентах кучу кластеров по сессиям, что совсем не ложится на задачу: мы хотим отличать, видит человек или нет, а не угадывать, в какой день была сделана запись. Поэтому добавил второй лосс, по сути sigmoid loss как в SigLIP, только наоборот: притягиваю фичи из разных сессий и отталкиваю фичи из одной. Плюс подаю в декодер эмбеддинг сессии отдельным токеном: вся сессионная информация уходит туда, и энкодеру просто незачем хранить её в латентах. Латентное пространство стало выглядеть сильно лучше, и метрики подтянулись.
Результаты
Поверх замороженного энкодера учим обычную логистическую регрессию. На психометрической задаче (человек отвечает видит или нет на стимуляции с разной силой тока и электродами) получаем 84.1% против 80.2% на сырой MUA и 82.4% на PCA. Забегая вперёд, в латентах ещё видно, каким электродом стимулировали и с каким током: соседние электроды кластеризуются вместе. Но самое интересное это пороговая задача: тот же электрод, ток зафиксирован на пороге 50%, человек то видит фосфен, то нет. И даже тут мы декодируем восприятие на 64% против 60% на сырых данных.
Так что наконец закрыл гештальт и поделился, а то собирался уже несколько недель и всё никак не мог дойти. Дальше думаю превратить это в полноценную статью: обучиться на нескольких людях и сделать нормальные абляции.