Что вообще делают слои в нейросетях?
Выделим минутку на #неискусственный_ликбез
Слой в нейросети — это этап обработки данных: через него проходит входной сигнал (текст, изображение, звук), и на выходе мы получаем новое, более «осмысленное» представление. Каждый слой извлекает признаки, усиливает важное, отбрасывает лишнее и передаёт дальше.
▪️ По мере прохождения слоёв признаки усложняются. Сначала — расшифровка токенов и базовая структура. Затем идут контекст, связи, темы. Самая полезная информация обычно рождается в серединных слоях. А в конце модель идёт угадывать следующий токен.
Во время обучения ей помогает функция loss — это показатель того, насколько модель ошиблась. Если она уверена, что следующее слово "черепаха" (70%), а правильный ответ "кот" (10%), то loss будет высоким. Она позволяет оценить масштаб проблемы и "подкрутить" веса — все те миллионы чисел, в которых закодированы знания модели.
▪️ В классических трансформерах (самой популярной архитектуре на сегодня) каждый слой состоит из одинаковых блоков: Self-Attention отвечает за связи между словами, Feedforward усиливает или подавляет признаки. Residual-соединения добавляют вход слоя к его выходу, сохраняя информацию, а LayerNorm стабилизирует значения. Эти операции повторяются десятки раз.
Поначалу эти "станки" работают с поверхностными признаками — позицией слов, пунктуацией, грамматикой. Но с каждым слоем представления становятся всё более обобщёнными и смысловыми. Именно они и называются эмбеддингами — как способ представить объект (например, слово или предложение) в виде набора чисел. Но не просто случайных, а таких, где похожие объекты ближе друг к другу.
Эмбеддинги не хранятся в модели, а создаются на лету, при прохождении данных через слои. И именно в серединных слоях они приходят в лучшую форму: стабильную, информативную и пригодную для задач вроде поиска, кластеризации или смыслового анализа.
@anti_agi
Выделим минутку на #неискусственный_ликбез
Слой в нейросети — это этап обработки данных: через него проходит входной сигнал (текст, изображение, звук), и на выходе мы получаем новое, более «осмысленное» представление. Каждый слой извлекает признаки, усиливает важное, отбрасывает лишнее и передаёт дальше.
▪️ По мере прохождения слоёв признаки усложняются. Сначала — расшифровка токенов и базовая структура. Затем идут контекст, связи, темы. Самая полезная информация обычно рождается в серединных слоях. А в конце модель идёт угадывать следующий токен.
Во время обучения ей помогает функция loss — это показатель того, насколько модель ошиблась. Если она уверена, что следующее слово "черепаха" (70%), а правильный ответ "кот" (10%), то loss будет высоким. Она позволяет оценить масштаб проблемы и "подкрутить" веса — все те миллионы чисел, в которых закодированы знания модели.
Каждый раз, когда модель получает новый запрос, она прогоняет его через все слои — от простых признаков до смысловых абстракций. Именно в этом процессе рождается осмысленный ответ, только уже без измерений через loss.
▪️ В классических трансформерах (самой популярной архитектуре на сегодня) каждый слой состоит из одинаковых блоков: Self-Attention отвечает за связи между словами, Feedforward усиливает или подавляет признаки. Residual-соединения добавляют вход слоя к его выходу, сохраняя информацию, а LayerNorm стабилизирует значения. Эти операции повторяются десятки раз.
Поначалу эти "станки" работают с поверхностными признаками — позицией слов, пунктуацией, грамматикой. Но с каждым слоем представления становятся всё более обобщёнными и смысловыми. Именно они и называются эмбеддингами — как способ представить объект (например, слово или предложение) в виде набора чисел. Но не просто случайных, а таких, где похожие объекты ближе друг к другу.
Эмбеддинги не хранятся в модели, а создаются на лету, при прохождении данных через слои. И именно в серединных слоях они приходят в лучшую форму: стабильную, информативную и пригодную для задач вроде поиска, кластеризации или смыслового анализа.
@anti_agi