Pandas_cheat_sheet.pdf
Polars_cheat_sheet.pdf
Pandas / Polars
Когда речь заходит о работе с данными в аналитике, Pandas — один из первых инструментов, который стоит освоить.
Почему?
• делает работу с большими объемами данных быстрой и легкой на практике
• поддерживаются все необходимые операции с данными
• отличная совместимость с Matplotlib, Seaborn, Scikit-learn
Важно помнить: Pandas хранит данные в оперативной памяти, поэтому для больших наборов данных может потребоваться много ресурсо, либо Polars / PySpark.
Фан факт: Pandas был создан в фин. компании для работы с временными рядами, а теперь используется буквально везде.
Оптимальный размер: до 1-2 Гб
Polars
Когда Pandas уже не справляется с объемом данных, на помощь приходит Polars.
Почему?
• Polars написан на Rust и значительно быстрее Pandas. Он тоже хранит данные в памяти, но за счет высокой оптимизации он справляется с большими объемами эффективнее.
• Polars по синтаксису находится посередине между Pandas и PySpark
• Поддерживает многопоточную обработку, что ускоряет выполнение операций.
Фан факт: Polars активно набирает популярность и становится отличной альтернативой Pandas для работы с большими наборами данных. (отдельный лайк за подписанный тип данных)
Оптимальный размер: 7-15 Гб
P.S. Приложил полезные шпаргалки по библиотекам
Когда речь заходит о работе с данными в аналитике, Pandas — один из первых инструментов, который стоит освоить.
Почему?
• делает работу с большими объемами данных быстрой и легкой на практике
• поддерживаются все необходимые операции с данными
• отличная совместимость с Matplotlib, Seaborn, Scikit-learn
Важно помнить: Pandas хранит данные в оперативной памяти, поэтому для больших наборов данных может потребоваться много ресурсо, либо Polars / PySpark.
Фан факт: Pandas был создан в фин. компании для работы с временными рядами, а теперь используется буквально везде.
Оптимальный размер: до 1-2 Гб
Polars
Когда Pandas уже не справляется с объемом данных, на помощь приходит Polars.
Почему?
• Polars написан на Rust и значительно быстрее Pandas. Он тоже хранит данные в памяти, но за счет высокой оптимизации он справляется с большими объемами эффективнее.
• Polars по синтаксису находится посередине между Pandas и PySpark
• Поддерживает многопоточную обработку, что ускоряет выполнение операций.
Фан факт: Polars активно набирает популярность и становится отличной альтернативой Pandas для работы с большими наборами данных. (отдельный лайк за подписанный тип данных)
Оптимальный размер: 7-15 Гб
P.S. Приложил полезные шпаргалки по библиотекам