Ir para o conteúdo
Ir para insights data engineering

Noções básicas de PySpark: upsert de dados no Databricks

Noções básicas de PySpark: upsert de dados no Databricks
Escrito por
Data Science Lab
Publicado em
10 de junho de 2025

Neste artigo, Tim (engenheiro de dados) explica de forma acessível como os engenheiros de dados e os cientistas de dados podem passar de pandas para PySpark. Embora as duas bibliotecas tenham semelhanças na sintaxe, existem diferenças conceptuais importantes, sobretudo no processamento de grandes volumes de dados através de computação distribuída.


Tim explica como funciona o Apache Spark, o motor por detrás do PySpark, e como utiliza um driver e executors para processar dados em paralelo. No PySpark, trabalha com DataFrames divididos em partitions, essenciais para a escalabilidade. Aborda também a diferença entre transformations e actions, a importância da lazy evaluation e por que motivo certas operações, como as wide transformations, exigem muito mais recursos do que outras. Por fim, apresenta um exemplo prático de uma tarefa frequente em pipelines de dados: fazer upsert de dados numa tabela bronze com PySpark no Databricks.


Principais conclusões:

  • O PySpark é a interface Python para o Apache Spark.
  • O Spark está otimizado para big data e utiliza computação distribuída.
  • A lazy evaluation permite ao Spark determinar a estratégia de execução mais eficiente.
  • O PySpark é ideal quando os seus dados já não cabem numa única máquina.


👉 Leia o artigo completo no Medium: De pandas para PySpark - Tim Winter

Blog

Também poderá ter interesse nisto,

Subscreva a nossa newsletter.

Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?

Introduza um endereço de e-mail válido.