Instance-level contrastive learning yields human brain-like representation without category-supervision
Текст: https://www.biorxiv.org/content/10.1101/2020.06.15.153247v1Неожиданный бенчмарк архитектур и способов их обучения. Авторы проверили, насколько представления картинок, выученные нейросетями, похожи на те, что формируются в зрительной коре человеческого мозга.
Сетки разных архитектур (Alexnet, Resnet, Cornet) учили на аугментированном картиночном датасете ImageNet в двух режимах. В
supervised режиме сетку учили правильно определять класс картинки, а в
unsupervised сетка должна была, не зная классов, выучить для картинок хорошие низкоразмерные представления — эмбеддинги. Хорошесть эмбеддингов определялась через
contrastive loss — требовалось, чтобы похожие изображения (размноженные варианты одной и той же исходной картинки) давали близкие эмбеддинги, а непохожие — далекие.
После обучения каждой сетке показывали 72 новые картинки разных неодушевленных предметов и сравнивали эмбеддинги сетки с активациями зрительной коры живых людей, которым в предыдущем исследовании показывали ровно те же самые 72 картинки.
Напрямую сопоставить нейроны искусственной сетки участкам мозга нельзя, поэтому для сравнения использовали следующий трюк. Смотрели, насколько похожи между собой представления всех возможных пар картинок — в сетке и в мозге. Например, если картинки A и В активируют зрительную кору похожим образом, а картинка C — каким-то совсем другим, то и от сетки, работающей по похожему на мозг принципу, разумно ожидать такого же соотношения между эмбеддингами этих картинок.
Оказалось, что по паттерну схожести представлений больше всего на зрительную кору похожи те сетки, которые учились методом
contrastive learning. Все эмбеддинги, получаемые
supervised методом, меньше похожи на мозг. Что, по мнению авторов, и не удивительно: мозгу не требуются миллионы размеченных картинок, чтобы научиться различать классы объектов, — а значит, он учится больше в
unsupervised режиме.
К разбору не предлагаем.