Please use this identifier to cite or link to this item: https://ric.cps.sp.gov.br/handle/123456789/47717
Title: Sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores utilizando inteligência artificial local
Other Titles: Open source system for real-time voice call transcription with speaker identification using local artificial intelligence
Authors: ROCHA FILHO, Arivaldo Antônio Giglio
ISAWA, Vitor Yudy
Advisor: D’ARCE, Álvaro Ferraz
type of document: Artigo Científico
Keywords: Reconhecimento de voz;Inteligência artificial
Issue Date: 17-Jun-2026
Publisher: 157
Citation: ROCHA FILHO, Arivaldo Antônio Giglio; ISAWA, Vitor Yudy. Sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores utilizando inteligência artificial local. Orientador: Álvaro Ferraz D'Arce. 2026. 8 f. Artigo de Conclusão de Curso (Tecnologia em Análise e Desenvolvimento de Sistemas) - Faculdade de Tecnologia de Presidente Prudente, Presidente Prudente, SP, 2026.
Abstract: Este artigo apresenta o desenvolvimento de um sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores, operando de forma local sem dependência de serviços em nuvem. A identificação de locutores é realizada na camada de transporte, por meio de fluxos de áudio individuais transmitidos via WebRTC, eliminando a necessidade de algoritmos de diarização. O sistema é composto por um módulo de captura em Rust com WebRTC, um serviço de reconhecimento de fala em Python com o modelo Whisper medium da OpenAI, e uma interface web em Next.js e TypeScript. Em testes no hardware de desenvolvimento (Intel Core i9-12900K, inferência em CPU), o sistema apresentou latência de inferência de 5,2 a 5,8 segundos por segmento, consumo de memória de pico de 4,06 GB e Real-Time Factor médio de 0,65, operando mais rápido que o tempo real. A qualidade da transcrição é respaldada por benchmarks publicados que reportam Word Error Rate de aproximadamente 11,46% em áudio de reuniões. Os resultados confirmam a viabilidade técnica da solução para uso prático.
This paper presents the development of an open source system for real-time voice call transcription with speaker identification, operating locally without dependency on cloud services. Speaker identification is performed at the transport layer through individual audio streams transmitted via WebRTC, eliminating the need for diarization algorithms. The system comprises a capture module in Rust with WebRTC, a speech recognition service in Python using OpenAI's Whisper medium model, and a web interface in Next.js and TypeScript. In tests on the development hardware (Intel Core i9-12900K, CPU inference), the system showed inference latency of 5.2 to 5.8 seconds per segment, peak memory consumption of 4.06 GB, and an average Real-Time Factor of 0.65, operating faster than real-time. Transcription quality is supported by published benchmarks reporting a Word Error Rate of approximately 11.46% on meeting audio. The results confirm the technical feasibility of the solution for practical use.
URI: https://ric.cps.sp.gov.br/handle/123456789/47717
Appears in Collections:Trabalhos de Conclusão de Curso

Files in This Item:
File Description SizeFormat 
ads_2026_01_arivaldoagrochafilho_sistemaopensourceparatranscricao.pdf168.78 kBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.