Про краудсорсинг для сбора и разметки данных (часть 1)📊
Сегодня хочу вам рассказать о концепции, с которой я познакомилась в ШАДе и в процессе работы в Яндексе. Попробую раскрыть, почему этим вообще занимаются целые группы аналитиков-разработчиков, и почему Яндекс готов платить за фотки вывесок зданий в вашем городе.
Секретиков из-под NDA не будет, пост подготовлен по мотивам моего доклада для студентов в Иннополисе год назад👀
Пусть есть задача, для которой нет подходящих размеченных данных, и ML пока что не справится (по разным причинам: либо такую модель только предстоит создать, либо нужны знания из реального мира). Что делать? Как вариант, здесь приходит на помощь краудсорсинг.
Данный подход заключается в декомпозиции задачи (в данном случае задачи создания датасета) на много маленьких и делегировании её большому количеству людей. Для этого можно использовать как специальные сервисы (Яндекс.Толока на слуху, но ушла из России, теперь аналог — Яндекс.Задания), так и внутреннюю инфраструктуру в больших компаниях, или даже просто условную гугл-форму или табличку, это уже другой вопрос.
Краудсорсинг может помочь:
🌟 сэкономить бюджет, например, не занимая разметкой штатных сотрудников;
🌟 ускорить и масштабировать сбор данных;
🌟 собрать данные, которые нам просто так не доступны, такие как фотографии цен в магазинах различных городов страны;
🌟 получить больше свежих мнений и идей (провести массовые опросы)
Примеры краудсорсинга в реальной жизни:
1⃣ Wikipedia — интернет-энциклопедия, которую бесплатно и добровольно редактируют обычные пользователи;
2⃣ бета-версии приложений, тестирование которых по сути осуществляется реальными пользователями;
3⃣ open-source программное обеспечение — туда коммитит на добровольной основе ряд людей, не занятых в проекте как сотрудники
Примеры краудсорсинга для задач ML:
1⃣ сегментация изображений. Кстати, капча «найдите автобусы», судя по всему, тоже является примером краудсорсинга, только нам ещё и не платят😂;
2⃣ распознавание аудиозаписей и рукописных текстов;
3️⃣ разметка уместности контента, грамотности текстов, настроения фраз;
4️⃣ проверка фактов, поиск ошибок, тестирование приложений;
5️⃣ исследование человеческих предпочтений (например, какой интерфейс лучше), условно говоря вместо A/B-теста;
6️⃣ проверка уже существующих датасетов/других разметок (об этом подробнее в следующем посте)
Почему это не так просто, как может звучать?
Когда мы говорим о разметке для реального проекта, появляются требования по времени её сбора, качеству и бюджету. В общем, обычная ситуация choose 2 out of 3. И надо понимать, что исполнитель тоже преследует свои цели (например, получить свою копеечку как можно меньшими усилиями), и не всегда понимает смысл этих данных для вас. Естественным образом рождаются такие проблемы и вопросы:
🌟 Как объяснить людям, что и зачем мы от них хотим получить?
🌟 Как платить за хорошую работу и не платить за плохую? («здраствуйте делойте хорошее плохое не делойте до свидания»)
🌟 Что делать с сырыми результатами разметки, ведь их тоже много, как их превратить в красивый полезный датасет?
(ответы на эти вопросы будут во второй части завтра, stay tuned👂)
Сегодня хочу вам рассказать о концепции, с которой я познакомилась в ШАДе и в процессе работы в Яндексе. Попробую раскрыть, почему этим вообще занимаются целые группы аналитиков-разработчиков, и почему Яндекс готов платить за фотки вывесок зданий в вашем городе.
Секретиков из-под NDA не будет, пост подготовлен по мотивам моего доклада для студентов в Иннополисе год назад👀
Пусть есть задача, для которой нет подходящих размеченных данных, и ML пока что не справится (по разным причинам: либо такую модель только предстоит создать, либо нужны знания из реального мира). Что делать? Как вариант, здесь приходит на помощь краудсорсинг.
Данный подход заключается в декомпозиции задачи (в данном случае задачи создания датасета) на много маленьких и делегировании её большому количеству людей. Для этого можно использовать как специальные сервисы (Яндекс.Толока на слуху, но ушла из России, теперь аналог — Яндекс.Задания), так и внутреннюю инфраструктуру в больших компаниях, или даже просто условную гугл-форму или табличку, это уже другой вопрос.
Краудсорсинг может помочь:
🌟 сэкономить бюджет, например, не занимая разметкой штатных сотрудников;
🌟 ускорить и масштабировать сбор данных;
🌟 собрать данные, которые нам просто так не доступны, такие как фотографии цен в магазинах различных городов страны;
🌟 получить больше свежих мнений и идей (провести массовые опросы)
Примеры краудсорсинга в реальной жизни:
1⃣ Wikipedia — интернет-энциклопедия, которую бесплатно и добровольно редактируют обычные пользователи;
2⃣ бета-версии приложений, тестирование которых по сути осуществляется реальными пользователями;
3⃣ open-source программное обеспечение — туда коммитит на добровольной основе ряд людей, не занятых в проекте как сотрудники
Примеры краудсорсинга для задач ML:
1⃣ сегментация изображений. Кстати, капча «найдите автобусы», судя по всему, тоже является примером краудсорсинга, только нам ещё и не платят😂;
2⃣ распознавание аудиозаписей и рукописных текстов;
3️⃣ разметка уместности контента, грамотности текстов, настроения фраз;
4️⃣ проверка фактов, поиск ошибок, тестирование приложений;
5️⃣ исследование человеческих предпочтений (например, какой интерфейс лучше), условно говоря вместо A/B-теста;
6️⃣ проверка уже существующих датасетов/других разметок (об этом подробнее в следующем посте)
Почему это не так просто, как может звучать?
Когда мы говорим о разметке для реального проекта, появляются требования по времени её сбора, качеству и бюджету. В общем, обычная ситуация choose 2 out of 3. И надо понимать, что исполнитель тоже преследует свои цели (например, получить свою копеечку как можно меньшими усилиями), и не всегда понимает смысл этих данных для вас. Естественным образом рождаются такие проблемы и вопросы:
🌟 Как объяснить людям, что и зачем мы от них хотим получить?
🌟 Как платить за хорошую работу и не платить за плохую? («здраствуйте делойте хорошее плохое не делойте до свидания»)
🌟 Что делать с сырыми результатами разметки, ведь их тоже много, как их превратить в красивый полезный датасет?
(ответы на эти вопросы будут во второй части завтра, stay tuned👂)