TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
rafanalytics

11 Mar, 10:07

Открыть в Telegram Поделиться Пожаловаться

Библиотеки для анализа данных: с чего начать? 🐍

Сегодня разберём один из самых частых вопросов у тех, кто задумался об изучении анализа данных:
Как мне изучать библиотеки Pandas, Matplotlib и Seaborn?
Там же дофига функций и методов 🥲

Как по мне, это правда достаточно неочевидный вопрос, т.к. сами по себе библиотеки довольно объёмные и содержат кучу методов и функций, из-за чего можно подумать, что надо запомнить их все.
Спойлер: это далеко не так, и чтобы быстро их изучить попробуем исходить из практики

Более длительный вариант (для тех, кто любит статьи и курсы):

• Pandas - самая важная библиотека, чтобы работать с табличными данными. Здесь нужно научиться их фильтровать, группировать и производить преобразования таблиц. В связке с ней можно изучить NumPy - разберётесь с массивами и векторными вычислениями, что иногда сильно ускоряет работу с числами. Хороший материал для старта - хендбук от Яндекса по NumPy и Pandas 📋

- Matplotlib - да, кода много и поначалу библиотека кажется громоздкой, но именно она даёт полный контроль над каждым элементом графика и закладывает понимание того, как устроена визуализация в Python в целом. Разобравшись в ней один раз, ты получишь понимание того, как работает визуализация у других библиотек 🎨

- Seaborn - это как раз надстройка над Matplotlib, которая позволяет строить красивые статистические графики буквально в одну строку. После базового Matplotlib обычно сразу ощущается, насколько это удобно. Один из способов изучить — просто листать галерею примеров на официальном сайте и разбирать код 😌

Быстрый вариант (для тех, кто любит практику):

Тут лучшая стратегия - взять реальный датасет и "покрутить" его, попытавшись найти в нём закономерности и инсайты 🔍
Заходим на Kaggle, находим интересный для себя датасет, пытаемся задавать себе вопросы по его структуре (тут можно попросить GPT составить по датасету вопросы) и пытаемся ответить при помощи вышеупомянутых библиотек и их документаций - сначала чистим/агрегируем/фильтруем данные в Pandas, потом визуализируем закономерности 📊
Уверяю, что такая практика на реальных данных в разы эффективнее чтения туториалов без применения навыков, и таким образом можно изучить эти библиотеки за неделю 🔥

Если наберём 100 ❤️, то сделаю авторский jupyter-ноутбук с датасетом и конкретными вопросами к нему. Решив его, ты сможешь поставить галочку в изучении этих библиотек

3.9k 0 105 6 173
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot