Please use this identifier to cite or link to this item: https://ric.cps.sp.gov.br/handle/123456789/47790
Full metadata record
DC FieldValueLanguage
dc.contributor.advisorSANTOS, Leandro Colevati dos-
dc.contributor.authorOLIVEIRA, Gustavo Guimarães de-
dc.contributor.authorCOSTA, João Vitor Lima-
dc.date.accessioned2026-08-17T23:00:32Z-
dc.date.available2026-08-17T23:00:32Z-
dc.date.issued2026-06-
dc.identifier.citationCOSTA, João Vitor Lima; OLIVEIRA, Gustavo Guimarães de. Sistema de construção de código Pyspark para engenharia de dados e processamento de arquivos CSV e JSON, 2026. Trabalho de Conclusão de Curso ( Curso Superior de Tecnologia em Análise e Desenvolvimento de Sistemas) Fatec Zona Leste, São Paulo, 2026.pt_BR
dc.identifier.urihttps://ric.cps.sp.gov.br/handle/123456789/47790-
dc.description.abstractA escrita manual de código PySpark para pipelines de ingestão de dados constitui uma atividade repetitiva, suscetível a erros estruturais e geradora de dívida técnica em equipes de engenharia de dados. Organizações que consomem dados de múltiplos sistemas enfrentam desafios decorrentes da heterogeneidade dos formatos e da evolução imprevisível dos schemas , o que torna frequente a intervenção manual no gerenciamento de pipelines . Nesse contexto, o presente trabalho propõe o desenvolvimento e a avaliação exploratória de um framework em Python, denominado Ingestion App, voltado à geração automatizada de código PySpark a partir de contratos de dados estruturados no formato JavaScript Object Notation (JSON), com execução no ambiente Databricks. A solução atua na etapa de carregamento de um processo de ingestão, validando schema , tipos e mapeamento de campos de forma programática antes que os dados avancem no pipeline . A pesquisa adota abordagem exploratória com delineamento experimental, organizando-se em cinco condições que variam quanto à disponibilidade de um contrato de dados pré-construído e ao uso da solução automatizada para geração de código, totalizando dez execuções conduzidas com arquivos nos formatos de valores separados por vírgulas (CSV) e JSON. Os tempos de produção são decompostos em três fases cronometradas: leitura e planejamento, produção do código e correção de erros até a primeira execução bem-sucedida. As métricas de qualidade avaliadas compreenderam completude de mapeamento, validade dos tipos de dados, aderência ao schema e qualidade estrutural do código produzido. Os resultados demonstraram que a solução reduz o tempo de produção de código PySpark em 12,1 vezes para arquivos CSV e em 14,7 vezes para arquivos JSON em relação ao cenário de linha de base, com zero falhas na primeira execução da condição automatizada, em contraste com ao menos uma correção necessária em todas as demais condições. A análise qualitativa revelou que o código gerado incorpora sistematicamente cinco características estruturais ausentes nas implementações manuais: modularização em funções, registro de log por etapa, tratamento de exceções, movimentação automática de arquivos processados e validação da estrutura dos dados contra o contrato. Projeções analíticas indicam que a vantagem da solução cresce com a complexidade dos schemas : em contratos de 100 campos, o ganho estimado sobre o cenário de linha de base é de 30,3 vezes. Reconhece-se que a qualidade do código gerado depende diretamente da completude e precisão do contrato fornecido como entrada, deslocando o risco de erro da etapa de codificação para a etapa de especificação.pt_BR
dc.description.abstractThe manual writing of PySpark code for data ingestion pipelines constitutes a repetitive activity, susceptible to structural errors and a source of technical debt in data engineering teams. Organizations that consume data from multiple systems face challenges arising from format heterogeneity and the unpredictable evolution of schemas, which makes manual intervention in pipeline management frequent. In this context, this paper proposes the development and exploratory evaluation of a Python framework, named Ingestion App, aimed at the automated generation of PySpark code from data contracts structured in JavaScript Object Notation (JSON) format, with execution in the Databricks environment. The solution operates at the loading stage of an ingestion process, programmatically validating schema, data types, and field mapping before data progresses through the pipeline. The research adopts an exploratory approach with an experimental design, organized into five conditions that vary regarding the availability of a pre-built data contract and the use of the automated code generation solution, totaling ten executions conducted with files in Comma-Separated Values (CSV) and JSON formats. Production times are decomposed into three timed phases: reading and planning, code production, and error correction until the first successful execution. The quality metrics evaluated comprised mapping completeness, data type validity, schema adherence, and structural quality of the produced code. Results demonstrated that the solution reduces PySpark code production time by 12.1 times for CSV files and 14.7 times for JSON files relative to the baseline scenario, with zero failures in the first execution of the automated condition, in contrast with at least one correction required in all other conditions. Qualitative analysis revealed that the generated code systematically incorporates five structural characteristics absent in manual implementations: function modularization, per-stage log recording, exception handling, automatic movement of processed files, and validation of data structure against the contract. Analytical projections indicate that the solution's advantage grows with schema complexity: for contracts with 100 fields, the estimated gain over the baseline scenario is 30.3 times. It is acknowledged that the quality of the generated code depends directly on the completeness and accuracy of the contract provided as input, shifting the risk of error from the coding stage to the specification stage. Keywords: data engineering; PySpark; code generation; data contract; data ingestion.pt_BR
dc.description.sponsorshipCurso Superior de Tecnologia em Análise e Desenvolvimento de Sistemaspt_BR
dc.language.isopt_BRpt_BR
dc.publisher111pt_BR
dc.subjectEngenharia de sistemas de computaçãopt_BR
dc.subjectBanco de dadospt_BR
dc.subject.otherInformação e Comunicaçãopt_BR
dc.titleSistema de construção de código Pyspark para engenharia de dados e processamento de arquivos CSV e JSON.pt_BR
dc.typeMonografiapt_BR
dcterms.typeOutros...pt_BR
Appears in Collections:Trabalhos de Conclusão de Curso



Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.