Please use this identifier to cite or link to this item: https://ric.cps.sp.gov.br/handle/123456789/47717
Full metadata record
DC FieldValueLanguage
dc.contributor.advisorD’ARCE, Álvaro Ferraz-
dc.contributor.authorROCHA FILHO, Arivaldo Antônio Giglio-
dc.contributor.authorISAWA, Vitor Yudy-
dc.date.accessioned2026-08-17T13:01:30Z-
dc.date.available2026-08-17T13:01:30Z-
dc.date.issued2026-06-17-
dc.identifier.citationROCHA FILHO, Arivaldo Antônio Giglio; ISAWA, Vitor Yudy. Sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores utilizando inteligência artificial local. Orientador: Álvaro Ferraz D'Arce. 2026. 8 f. Artigo de Conclusão de Curso (Tecnologia em Análise e Desenvolvimento de Sistemas) - Faculdade de Tecnologia de Presidente Prudente, Presidente Prudente, SP, 2026.pt_BR
dc.identifier.urihttps://ric.cps.sp.gov.br/handle/123456789/47717-
dc.description.abstractEste artigo apresenta o desenvolvimento de um sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores, operando de forma local sem dependência de serviços em nuvem. A identificação de locutores é realizada na camada de transporte, por meio de fluxos de áudio individuais transmitidos via WebRTC, eliminando a necessidade de algoritmos de diarização. O sistema é composto por um módulo de captura em Rust com WebRTC, um serviço de reconhecimento de fala em Python com o modelo Whisper medium da OpenAI, e uma interface web em Next.js e TypeScript. Em testes no hardware de desenvolvimento (Intel Core i9-12900K, inferência em CPU), o sistema apresentou latência de inferência de 5,2 a 5,8 segundos por segmento, consumo de memória de pico de 4,06 GB e Real-Time Factor médio de 0,65, operando mais rápido que o tempo real. A qualidade da transcrição é respaldada por benchmarks publicados que reportam Word Error Rate de aproximadamente 11,46% em áudio de reuniões. Os resultados confirmam a viabilidade técnica da solução para uso prático.pt_BR
dc.description.abstractThis paper presents the development of an open source system for real-time voice call transcription with speaker identification, operating locally without dependency on cloud services. Speaker identification is performed at the transport layer through individual audio streams transmitted via WebRTC, eliminating the need for diarization algorithms. The system comprises a capture module in Rust with WebRTC, a speech recognition service in Python using OpenAI's Whisper medium model, and a web interface in Next.js and TypeScript. In tests on the development hardware (Intel Core i9-12900K, CPU inference), the system showed inference latency of 5.2 to 5.8 seconds per segment, peak memory consumption of 4.06 GB, and an average Real-Time Factor of 0.65, operating faster than real-time. Transcription quality is supported by published benchmarks reporting a Word Error Rate of approximately 11.46% on meeting audio. The results confirm the technical feasibility of the solution for practical use.pt_BR
dc.description.sponsorshipCurso Superior de Tecnologia em Análise e Desenvolvimento de Sistemaspt_BR
dc.language.isopt_BRpt_BR
dc.publisher157pt_BR
dc.subjectReconhecimento de vozpt_BR
dc.subjectInteligência artificialpt_BR
dc.subject.otherInformação e Comunicaçãopt_BR
dc.titleSistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores utilizando inteligência artificial localpt_BR
dc.title.alternativeOpen source system for real-time voice call transcription with speaker identification using local artificial intelligencept_BR
dc.typeArtigo Científicopt_BR
dcterms.type-pt_BR
Appears in Collections:Trabalhos de Conclusão de Curso

Files in This Item:
File Description SizeFormat 
ads_2026_01_arivaldoagrochafilho_sistemaopensourceparatranscricao.pdf168.78 kBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.