Managed DevOps Pool - Pipelines de DevOps eficientes e seguros?
Uma Managed DevOps Pool permite gerir a infraestrutura necessária para executar uma pipeline DevOps sem ter de manter servidores ou máquinas – o…
Neste artigo, Tim (engenheiro de dados) explica de forma acessível como os engenheiros de dados e os cientistas de dados podem passar de pandas para PySpark. Embora as duas bibliotecas tenham semelhanças na sintaxe, existem diferenças conceptuais importantes, sobretudo no processamento de grandes volumes de dados através de computação distribuída.
Tim explica como funciona o Apache Spark, o motor por detrás do PySpark, e como utiliza um driver e executors para processar dados em paralelo. No PySpark, trabalha com DataFrames divididos em partitions, essenciais para a escalabilidade. Aborda também a diferença entre transformations e actions, a importância da lazy evaluation e por que motivo certas operações, como as wide transformations, exigem muito mais recursos do que outras. Por fim, apresenta um exemplo prático de uma tarefa frequente em pipelines de dados: fazer upsert de dados numa tabela bronze com PySpark no Databricks.
Principais conclusões:
👉 Leia o artigo completo no Medium: De pandas para PySpark - Tim Winter
Uma Managed DevOps Pool permite gerir a infraestrutura necessária para executar uma pipeline DevOps sem ter de manter servidores ou máquinas – o…
Ao longo de dois anos, acompanhámos dezenas de projetos de IA, desde a exploração inicial até um modelo que é executado todas as noites. Alguns…
Muitas organizações já realizaram um projeto-piloto de IA. O modelo funciona, a demonstração é aplaudida e depois não acontece mais nada. Pela nossa…
Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?
Obrigado pela sua inscrição!