Репост из: cydoroga
upd_shortened Turbo-ML RL methods.pptx
Всем привет!
Намедни меня позвали побыть говорящей головой на TurboML конференцию.
Доклад был о том, как мы завариваем online-RL для alignment'а LLMок, какие сейчас есть модные подходы.
Тайминг, к сожалению, не предполагал детального разбора всего вширь (благо разбирать есть чего), поэтому доклад скорее обзорный.
Возможно, кому-нибудь будет интересно \ полезно.
Запись с таймкодом:
https://www.youtube.com/live/Srt5gLQliRA?si=qsa2uT3rcDtgS9uI&t=14167
Презу прилагаю
Намедни меня позвали побыть говорящей головой на TurboML конференцию.
Доклад был о том, как мы завариваем online-RL для alignment'а LLMок, какие сейчас есть модные подходы.
Тайминг, к сожалению, не предполагал детального разбора всего вширь (благо разбирать есть чего), поэтому доклад скорее обзорный.
Возможно, кому-нибудь будет интересно \ полезно.
Запись с таймкодом:
https://www.youtube.com/live/Srt5gLQliRA?si=qsa2uT3rcDtgS9uI&t=14167
Презу прилагаю