Репост из: grokaem себя
ФЕВРАЛЬ 2024
NLP:
0. Пост про embeddings для поиска, можно брать в заметки для собеса.
1. Новый метод self-playing.
2. У Ильи Гусева появился канал, вот например клевый пост про утечку данных.
3. Вышла gemini на овердохера контекста (1млн), у нее много критики. Но сам вопрос длинных контекстов как никогда актуален. Рассуждения на эту тему.
4. Transformer United - пачка видео research orientated про NLP, клевое по RAG. Собрано давно, нашла сейчас.
5. Вышла DoRA - DoRA: Weight-Decomposed Low-Rank Adaptation, paper -> разделяем magnitude и direction, LORA на direction, источник.
Audio:
0. Вышла LLM ASR approach, источник, статья - почти все frozen, тренеруется только linear projection, звучит классно и похоже в теории на encodec, интересно, почему не юзают его.
1. Вышла Supervoice-GPT для перевода с текста на фонемы + duration.
2. Overview audio codec моделей, постоянный источник.
3. Вышла audio synthesis работа с NVIDIA: paper, источник. В HIFIGAN добавили Snake function для periodic inductive bias. Очень классные семплы.
4. CTC is still alive, paper СTC + prompt (ASR & ST), внутри self-conditioned CTC, быстрее 3,6 speed up. paper
5. Stability.AI выкатили StableAudio: CLAP + UNET + VAE (последний кстати тоже с snake function) paper, samples
others:
0. У моего знакомого, который учится в mbzuai был пост про вопросы к собесу
1. Вышла новая модель russian vibe для генерации грустных русских девятиэтажек - пейзажей
2. Я собрала еще один пазл, важная новость - я считаю
NLP:
0. Пост про embeddings для поиска, можно брать в заметки для собеса.
1. Новый метод self-playing.
2. У Ильи Гусева появился канал, вот например клевый пост про утечку данных.
3. Вышла gemini на овердохера контекста (1млн), у нее много критики. Но сам вопрос длинных контекстов как никогда актуален. Рассуждения на эту тему.
4. Transformer United - пачка видео research orientated про NLP, клевое по RAG. Собрано давно, нашла сейчас.
5. Вышла DoRA - DoRA: Weight-Decomposed Low-Rank Adaptation, paper -> разделяем magnitude и direction, LORA на direction, источник.
Audio:
0. Вышла LLM ASR approach, источник, статья - почти все frozen, тренеруется только linear projection, звучит классно и похоже в теории на encodec, интересно, почему не юзают его.
1. Вышла Supervoice-GPT для перевода с текста на фонемы + duration.
2. Overview audio codec моделей, постоянный источник.
3. Вышла audio synthesis работа с NVIDIA: paper, источник. В HIFIGAN добавили Snake function для periodic inductive bias. Очень классные семплы.
4. CTC is still alive, paper СTC + prompt (ASR & ST), внутри self-conditioned CTC, быстрее 3,6 speed up. paper
5. Stability.AI выкатили StableAudio: CLAP + UNET + VAE (последний кстати тоже с snake function) paper, samples
others:
0. У моего знакомого, который учится в mbzuai был пост про вопросы к собесу
1. Вышла новая модель russian vibe для генерации грустных русских девятиэтажек - пейзажей
2. Я собрала еще один пазл, важная новость - я считаю