Господа!
Я тут на днях писал, что у нас 2 статьи зашли на ICCV. Пора дать больше деталей, там таки есть о чем! 😉
Речь пойдет о статье "MEMFOF: High-Resolution Training for Memory-Efficient Multi-Frame Optical Flow Estimation". Оптический поток — это ключевой алгоритм в обработке (и частично анализе) видео, построение векторного поля сдвига каждого пикселя относительно предыдущего кадра.
В решении этой задачи много проблем, например:
* области открытия/закрытия, для которых корректного вектора просто нет,
* полупрозрачные области, которым могут корректно соответствовать два и более вектора,
* однородные области, для которых в принципе нетривиально построить корректное поле векторов,
* точное восстановление субпиксельных сдвигов...
а также изменение яркости, цвета, резкости между кадрами и т.д. по длинному списку! 🤕
Интересное современное развитие этого семейства алгоритмов — построение многокадрового оптического потока, когда за счет анализа информации большего числа кадров, и того, что обычно движение в видео сравнительно последовательно, удается значительно поднять точность работы.
Ключевая проблема такого подхода — существенная ресурсоемкость, в том числе по количеству требуемой памяти. Мы расширили двукадровый SOTA метод SEA-RAFT до трехкадрового и сократили потребление памяти на FullHD входах в 4 раза, с ~8 гигов видеопамяти до ~2 (см. графики выше). Такое снижение памяти позволило обучать метод в нативном FullHD, без прибегания к кропам и тайлингу, что позволило значительно улучшить качество на Spring, как zero-shot, так и finetune. Что привело к SOTA результатам на ключевых бенчмарках в области (список покоренных бенчмарков на второй картинке выше))) 🥇🥇🥇🥇🥇💪
Звучит, согласитесь, просто, и теперь готовый рецепт по написанию SOTA у вас в кармане! 🌿 😁 Главный риск, конечно, был в том, что статья не пройдет с первого раза, а SOTA в этой области быстро устаревают 🤷♂️ В общем это наша первая статья, зашедшая через SOTA (предыдущие 6 были через cool idea и через hard work в виде датасетов и бенчмарков). И первая статья, зашедшая с первого раза! Мы сделали это!!! 🎉💃🎉
Если пользуетесь Hugging Face, большая просьба проголосовать за статью тут:
https://huggingface.co/papers/2506.23151 🙏🤝🙏
Звездочки (по желанию))) можно ставить тут:
https://github.com/msu-video-group/memfof/
Страничка проекта с визуализациями и графиками тут:
https://msu-video-group.github.io/memfof/
Статья: PapersWithCode, Arxiv 📖
Продолжаем движение! 🧑💻 😉
#our_successes
Я тут на днях писал, что у нас 2 статьи зашли на ICCV. Пора дать больше деталей, там таки есть о чем! 😉
Речь пойдет о статье "MEMFOF: High-Resolution Training for Memory-Efficient Multi-Frame Optical Flow Estimation". Оптический поток — это ключевой алгоритм в обработке (и частично анализе) видео, построение векторного поля сдвига каждого пикселя относительно предыдущего кадра.
В решении этой задачи много проблем, например:
* области открытия/закрытия, для которых корректного вектора просто нет,
* полупрозрачные области, которым могут корректно соответствовать два и более вектора,
* однородные области, для которых в принципе нетривиально построить корректное поле векторов,
* точное восстановление субпиксельных сдвигов...
а также изменение яркости, цвета, резкости между кадрами и т.д. по длинному списку! 🤕
Интересное современное развитие этого семейства алгоритмов — построение многокадрового оптического потока, когда за счет анализа информации большего числа кадров, и того, что обычно движение в видео сравнительно последовательно, удается значительно поднять точность работы.
Ключевая проблема такого подхода — существенная ресурсоемкость, в том числе по количеству требуемой памяти. Мы расширили двукадровый SOTA метод SEA-RAFT до трехкадрового и сократили потребление памяти на FullHD входах в 4 раза, с ~8 гигов видеопамяти до ~2 (см. графики выше). Такое снижение памяти позволило обучать метод в нативном FullHD, без прибегания к кропам и тайлингу, что позволило значительно улучшить качество на Spring, как zero-shot, так и finetune. Что привело к SOTA результатам на ключевых бенчмарках в области (список покоренных бенчмарков на второй картинке выше))) 🥇🥇🥇🥇🥇💪
Звучит, согласитесь, просто, и теперь готовый рецепт по написанию SOTA у вас в кармане! 🌿 😁 Главный риск, конечно, был в том, что статья не пройдет с первого раза, а SOTA в этой области быстро устаревают 🤷♂️ В общем это наша первая статья, зашедшая через SOTA (предыдущие 6 были через cool idea и через hard work в виде датасетов и бенчмарков). И первая статья, зашедшая с первого раза! Мы сделали это!!! 🎉💃🎉
Если пользуетесь Hugging Face, большая просьба проголосовать за статью тут:
https://huggingface.co/papers/2506.23151 🙏🤝🙏
Звездочки (по желанию))) можно ставить тут:
https://github.com/msu-video-group/memfof/
Страничка проекта с визуализациями и графиками тут:
https://msu-video-group.github.io/memfof/
Статья: PapersWithCode, Arxiv 📖
Продолжаем движение! 🧑💻 😉
#our_successes