Análise comparativa qualitativa de Ferramentas de Manipulação de Dados em Workflows de ETL

SANTANA, Sandro Victor Rosevel de

Please use this identifier to cite or link to this item: https://repositorio.ufpe.br/handle/123456789/65494

Share on

Title:	Análise comparativa qualitativa de Ferramentas de Manipulação de Dados em Workflows de ETL
Authors:	SANTANA, Sandro Victor Rosevel de
Keywords:	ETL; Star Schema; Pandas; PySpark; Desempenho de Pipelines; Polars
Issue Date:	8-Aug-2025
Citation:	SANTANA, Sandro Victor Rosevel de. Análise comparativa qualitativa de Ferramentas de Manipulação de Dados em Workflows de ETL. 2025. Trabalho de Conclusão de Curso (Ciências da computação) - Universidade Federal de Pernambuco,Recife, 2025.
Abstract:	Na era da informação, a capacidade de transformar grandes volumes de dados em insights acionáveis é um diferencial estratégico para organizações de todos os setores. Os processos de ETL (Extract, Transform, Load) ocupam papel central na Engenharia de Dados, permitindo integrar informações de múltiplas fontes, aplicar regras de negócio e disponibilizar resultados em ambientes analíticos como data warehouses ou data lakes. Este trabalho apresenta uma análise comparativa entre quatro ferramentas amplamente utilizadas na construção de pipelines ETL, Pandas, PySpark, Polars e SQL, avaliadas a partir de critérios como desempenho, consumo de recursos, tempo de execução, capacidade de paralelização e adequação a diferentes cenários de volume e infraestrutura. A base de dados utilizada é o Brazilian E-Commerce Public Dataset da Olist, modelada segundo o Star Schema, composto por uma tabela fato de transações e tabelas de dimensão associadas, padrão amplamente adotado em ambientes de Business Intelligence (KIMBALL; ROSS, 2008). A arquitetura do pipeline foi estruturada em três camadas, Bronze, Silver e Gold, que representam estágios progressivos de refinamento e enriquecimento dos dados (GONZALEZ; XIN; TEAM, 2020). Os experimentos revelaram diferenças significativas entre as ferramentas: o Polars apresentou o melhor desempenho em termos de tempo de execução, o SQL obteve bom equilíbrio entre performance e simplicidade, o Pandas se destacou em cenários com menor volume de dados, e o PySpark mostrou maior potencial em ambientes distribuídos de alta escala. Esses resultados oferecem subsídios práticos para que profissionais e organizações selecionem a tecnologia mais adequada às suas necessidades, considerando restrições de tempo, custo e recursos computacionais disponíveis.
URI:	https://repositorio.ufpe.br/handle/123456789/65494
Appears in Collections:	(TCC) - Ciência da Computação

Files in This Item:

File	Description	Size	Format
TCC Sandro Victor Rosevel de Santana.pdf		362.92 kB	Adobe PDF	View/Open

This item is protected by original copyright

View License

Show full item record Recommend this item

This item is licensed under a Creative Commons License