Хочу поделиться крутым образовательным ресурсом. А именно ссылкой на ютуб канал рисерчера и профессора из университета Мэриленда Jia-Bin Huang (он еще будет себе осенью набирать phd студентов – кому актуально)
Здесь можно найти множество интересных разборов из современного DL, а последние видео точечно рассказывают про концепции из архитектур и обучения свежих LLM-ок:
- Как устроен оптимизатор Muon
- Как дизайнить MoE и разные подводные камни
- Линейный аттеншн
- Что такое Engram и как он делает трансформеры эффективнее
Exclusive Self Attention, или почему стандартный механизм внимания может неэффективно представлять данные, который я разбирал чуть выше, тут тоже есть, да еще и с существенно большим количеством наглядности (и даже с объяснением всей линейной алгебры, которой нет в статье!)
Контента у него очень много, рекомендую. Особенно если ведете рисерч, читаете статьи и хочется получить хорошее первое представление о свежей идее (все-таки из самой статьи иногда это сделать довольно трудно – нужно смотреть на предыдущие работы и долго вникать) или сами практикуете обучение моделей, чтобы глубже разбираться как что работает и где можно улучшить.
Здесь можно найти множество интересных разборов из современного DL, а последние видео точечно рассказывают про концепции из архитектур и обучения свежих LLM-ок:
- Как устроен оптимизатор Muon
- Как дизайнить MoE и разные подводные камни
- Линейный аттеншн
- Что такое Engram и как он делает трансформеры эффективнее
Exclusive Self Attention, или почему стандартный механизм внимания может неэффективно представлять данные, который я разбирал чуть выше, тут тоже есть, да еще и с существенно большим количеством наглядности (и даже с объяснением всей линейной алгебры, которой нет в статье!)
Контента у него очень много, рекомендую. Особенно если ведете рисерч, читаете статьи и хочется получить хорошее первое представление о свежей идее (все-таки из самой статьи иногда это сделать довольно трудно – нужно смотреть на предыдущие работы и долго вникать) или сами практикуете обучение моделей, чтобы глубже разбираться как что работает и где можно улучшить.