ТЕОРИЯ APACHE SPARK
Еще до начала работы с большими данными делал видео про Apache Spark (в качестве эксперимента). Это было небольшое обзорное видео, чтобы структурировать и запомнить основные моменты. Тогда еще монтировал всё сам🤗
Позже на работе плотно столкнулся со спарком и вот что понял: Power Query, CTE в SQL и PySpark - очень похожие штуки.
Да, разные движки, разные операции, но:
● везде есть цепочка преобразований (набор шагов последовательных изменений данных),
● вы пишете что нужно сделать, а движок определяет как именно это сделать внутри,
● можно попросить движок кэшировать этап если он нужен более одного раза,
● по возможности всё выполняется в параллель, чтобы завершить запрос быстрее (на pq это параллельные вычисления, в spark - разделение данных по воркерам).
Я конечно обобщаю, но сходства присутствуют.
Явное отличие Spark - он не просто предполагает написание запроса. При работе с кластером, вы еще и должны запланировать ресурсы под ваш запрос. Для меня это всегда было проблемой😭 Никак не мог понять сколько там этих ядер и оперативки надо выставлять.
Но однажды собрал всю инфу, нарисовал презентации и всё же разобрался. Теперь у вас есть почти 3 часа крутого контента, чтобы не только подготовиться к собесу, но и применить знания на текущей работе.
Ссылочка тут: https://directprobi.ru/platform/apache-spark-teoriya
Еще до начала работы с большими данными делал видео про Apache Spark (в качестве эксперимента). Это было небольшое обзорное видео, чтобы структурировать и запомнить основные моменты. Тогда еще монтировал всё сам🤗
Позже на работе плотно столкнулся со спарком и вот что понял: Power Query, CTE в SQL и PySpark - очень похожие штуки.
Да, разные движки, разные операции, но:
● везде есть цепочка преобразований (набор шагов последовательных изменений данных),
● вы пишете что нужно сделать, а движок определяет как именно это сделать внутри,
● можно попросить движок кэшировать этап если он нужен более одного раза,
● по возможности всё выполняется в параллель, чтобы завершить запрос быстрее (на pq это параллельные вычисления, в spark - разделение данных по воркерам).
Я конечно обобщаю, но сходства присутствуют.
Явное отличие Spark - он не просто предполагает написание запроса. При работе с кластером, вы еще и должны запланировать ресурсы под ваш запрос. Для меня это всегда было проблемой😭 Никак не мог понять сколько там этих ядер и оперативки надо выставлять.
Но однажды собрал всю инфу, нарисовал презентации и всё же разобрался. Теперь у вас есть почти 3 часа крутого контента, чтобы не только подготовиться к собесу, но и применить знания на текущей работе.
Ссылочка тут: https://directprobi.ru/platform/apache-spark-teoriya