Коллеги!
В прошлый раз мы остановились на том, как важно научиться достигать сложные результаты с использованием ограниченных ресурсов и топовым качеством, лучше, чем это делают другие. 😉
Приведу свежий пример. В рамках А* конференции ACM Multimedia в конце весны прошел GenText-Forensics: Challenge on Explainable Forensics and Adversarial Generation for Text-Centric Images.
Основная его идея проста. Современные модели могут достаточно просто генерировать и (с недавних пор) довольно качественно редактировать документы. Причем если картинка целиком генерируется — это сегодня сравнительно надежно детектируется (с оговорками, про маскировку генерации разными методами, в первую очередь сжатием, новые генераторы и т.д.). Мы провели большой челлендж в рамках CVPR этой весной (подробнее тут, тут, тут, тут, тут и тут).
НО! Если картинка отредактирована (т.е. большая часть пикселов не тронуты) детектировать замену намного сложнее. Мы должны были проводить челлендж на эту тему на ECCV, но увы, весь воркшоп, в котором мы участвовали, не прошел, поэтому в следующий раз...
А пока пришлось участвовать в чужом челлендже (для разминки, чтобы кровь не застаивалась, а понимание темы росло) 😉
В общем мы поучаствовали в этом челлендже на детект отредактированных документов. Авторы заявляют, что это был первый AI-security челлендж, посвящённый редактированию текстов в изображениях. С одной стороны модели реально чуть хуже справляются со шрифтами (что дает шанс). С другой, можете оценить, как мало менялось на примерах из датасета выше (черное с белыми полосками — это маски изменений). Необходимо сдетектировать измененное место и сделать пояснение (Explainable Forensics в названии), почему именно это место сочтено подозрительным, что существенно усложняет задачу (заставить детектор объяснить причину объективно сложно).
Причем датасет RealText-V2 был подготовлен годный (это мы любим!): в нем большее 20К изображений на 6 языках (английский, китайский, арабский, тайский, малайский, индонезийский) в 6 сценариях (финансы, медицина, образование, стриминг, e-commerce и «дикая природа»). Причем для подготовки описаний фейков были оплачены профессионалы (следствие участия компании).
Организаторы — из Ant Group (первые 2 места нашего челленджа, замечу) и университетов Сингапура и Китая. Они же в 2024 году провели на кагле челлендж по дипфейкам на 706 команд. Они же авторы Real-Text V1 датасета (весна 2025) и учли опыт первой серии.
В общем сложная задача. Свежий датасет. 114 участников. 548 сабмитов...
И... (барабанная дробь)...
Мы заняли 3 место в финале челленджа!!! 🥳🥳🥳
Причем большую часть работ сделал третьекурсник Кирилл Кольцов под руководством нашего аспиранта Саши Гущина (5 А*, в том числе 3 первым авторов за последние 2 года). 🙂🎉🙂
Путь был сложным, в финале было 22 участника, соревноваться с китайцами ооочень тяжело и все равно пачка топовых китайских университетов оставлена позади! Йееее!
Почему это важно:
* В челленджах на А* очень часто компании в организаторах, благодаря чему датасеты довольно практичны, чем датасеты очень очень многих бенчмарков (большинство датасетов публичных бенчмарков, к сожалению, крошечны и не слишком качественны, но на безрыбье проходят). Поэтому решать задачу сложнее, но воспроизводимость решения выше.
* Попасть на А* желают многие, поэтому в А* челленджах довольно много участников (что облегчает задачу организаторов, но сложнее занять призовое место)
* Время ограничено очень жестко. От выкладывания датасета до финального сабмита всего 2 месяца. Это очень мало для файнтюна немаленькой модели (в челлендже было ограничение не более 32 миллиардов параметров).
В общем с ограниченными ресурсами и в топовом качестве лучше других, все, как заказывали 😁 Это просто отличная тренировка. 💪
Продолжаем прокачку! 😁
#our_successes@vgcourse
@vgcourse
В прошлый раз мы остановились на том, как важно научиться достигать сложные результаты с использованием ограниченных ресурсов и топовым качеством, лучше, чем это делают другие. 😉
Приведу свежий пример. В рамках А* конференции ACM Multimedia в конце весны прошел GenText-Forensics: Challenge on Explainable Forensics and Adversarial Generation for Text-Centric Images.
Основная его идея проста. Современные модели могут достаточно просто генерировать и (с недавних пор) довольно качественно редактировать документы. Причем если картинка целиком генерируется — это сегодня сравнительно надежно детектируется (с оговорками, про маскировку генерации разными методами, в первую очередь сжатием, новые генераторы и т.д.). Мы провели большой челлендж в рамках CVPR этой весной (подробнее тут, тут, тут, тут, тут и тут).
НО! Если картинка отредактирована (т.е. большая часть пикселов не тронуты) детектировать замену намного сложнее. Мы должны были проводить челлендж на эту тему на ECCV, но увы, весь воркшоп, в котором мы участвовали, не прошел, поэтому в следующий раз...
А пока пришлось участвовать в чужом челлендже (для разминки, чтобы кровь не застаивалась, а понимание темы росло) 😉
В общем мы поучаствовали в этом челлендже на детект отредактированных документов. Авторы заявляют, что это был первый AI-security челлендж, посвящённый редактированию текстов в изображениях. С одной стороны модели реально чуть хуже справляются со шрифтами (что дает шанс). С другой, можете оценить, как мало менялось на примерах из датасета выше (черное с белыми полосками — это маски изменений). Необходимо сдетектировать измененное место и сделать пояснение (Explainable Forensics в названии), почему именно это место сочтено подозрительным, что существенно усложняет задачу (заставить детектор объяснить причину объективно сложно).
Причем датасет RealText-V2 был подготовлен годный (это мы любим!): в нем большее 20К изображений на 6 языках (английский, китайский, арабский, тайский, малайский, индонезийский) в 6 сценариях (финансы, медицина, образование, стриминг, e-commerce и «дикая природа»). Причем для подготовки описаний фейков были оплачены профессионалы (следствие участия компании).
Организаторы — из Ant Group (первые 2 места нашего челленджа, замечу) и университетов Сингапура и Китая. Они же в 2024 году провели на кагле челлендж по дипфейкам на 706 команд. Они же авторы Real-Text V1 датасета (весна 2025) и учли опыт первой серии.
В общем сложная задача. Свежий датасет. 114 участников. 548 сабмитов...
И... (барабанная дробь)...
Мы заняли 3 место в финале челленджа!!! 🥳🥳🥳
Причем большую часть работ сделал третьекурсник Кирилл Кольцов под руководством нашего аспиранта Саши Гущина (5 А*, в том числе 3 первым авторов за последние 2 года). 🙂🎉🙂
Путь был сложным, в финале было 22 участника, соревноваться с китайцами ооочень тяжело и все равно пачка топовых китайских университетов оставлена позади! Йееее!
Почему это важно:
* В челленджах на А* очень часто компании в организаторах, благодаря чему датасеты довольно практичны, чем датасеты очень очень многих бенчмарков (большинство датасетов публичных бенчмарков, к сожалению, крошечны и не слишком качественны, но на безрыбье проходят). Поэтому решать задачу сложнее, но воспроизводимость решения выше.
* Попасть на А* желают многие, поэтому в А* челленджах довольно много участников (что облегчает задачу организаторов, но сложнее занять призовое место)
* Время ограничено очень жестко. От выкладывания датасета до финального сабмита всего 2 месяца. Это очень мало для файнтюна немаленькой модели (в челлендже было ограничение не более 32 миллиардов параметров).
В общем с ограниченными ресурсами и в топовом качестве лучше других, все, как заказывали 😁 Это просто отличная тренировка. 💪
Продолжаем прокачку! 😁
#our_successes@vgcourse
@vgcourse