Alexander C
Репост из: (sci)Berloga Всех Наук и Технологий
Мусор на входе — мусор на выходе: как выйти из порочного круга в ML?
Когда речь заходит о машинном обучении, все сразу начинают обсуждать алгоритмы, метрики и функции потерь. Между тем любые модели, даже самые навороченные нейросети, учатся на данных. От их качества напрямую зависит успех. Если подать шумные и «грязные» датасеты, то и результаты окажутся бессмысленными. Поэтому львиную долю времени специалисты ML и датасайентисты тратят на препроцессинг. Как облегчить себе жизнь и автоматизировать этот этап?
В понедельник, 13 июля, в 19:00 мск команда Бластим проводит мастер-класс с биоинформатиком и программистом Александром Ильиным. Спикер покажет эффективные рабочие приемы, как с помощью Python готовить данные для подачи на вход моделям.
Сосредоточимся на таблицах и разберем:
• объединение разных файлов, унификацию форматов
• обработку пропусков, выбросов, дубликатов и ошибок
• шкалирование, кодирование категориальных переменных
• конструирование признаков и обработку дат
• деление выборки на трейн и тест, валидацию
• рисование графиков и полезные библиотеки
🔗 Зарегистрироваться на сайте: https://agency.blastim.ru/moydodyr
Или в боте: https://s.salebot.pro/r/ml26_1
Когда речь заходит о машинном обучении, все сразу начинают обсуждать алгоритмы, метрики и функции потерь. Между тем любые модели, даже самые навороченные нейросети, учатся на данных. От их качества напрямую зависит успех. Если подать шумные и «грязные» датасеты, то и результаты окажутся бессмысленными. Поэтому львиную долю времени специалисты ML и датасайентисты тратят на препроцессинг. Как облегчить себе жизнь и автоматизировать этот этап?
В понедельник, 13 июля, в 19:00 мск команда Бластим проводит мастер-класс с биоинформатиком и программистом Александром Ильиным. Спикер покажет эффективные рабочие приемы, как с помощью Python готовить данные для подачи на вход моделям.
Сосредоточимся на таблицах и разберем:
• объединение разных файлов, унификацию форматов
• обработку пропусков, выбросов, дубликатов и ошибок
• шкалирование, кодирование категориальных переменных
• конструирование признаков и обработку дат
• деление выборки на трейн и тест, валидацию
• рисование графиков и полезные библиотеки
🔗 Зарегистрироваться на сайте: https://agency.blastim.ru/moydodyr
Или в боте: https://s.salebot.pro/r/ml26_1
Дополнительная возможность! До 18:00 мск 11 июля присылайте свои проблемные данные для разбора на вебинаре. Спикер выберет самые «грязные» датасеты и проведет их анализ в прямом эфире. Отправить 🖥