Use este identificador para citar ou linkar para este item:
https://ric.cps.sp.gov.br/handle/123456789/47717| Título: | Sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores utilizando inteligência artificial local |
| Título(s) alternativo(s): | Open source system for real-time voice call transcription with speaker identification using local artificial intelligence |
| Autor(es): | ROCHA FILHO, Arivaldo Antônio Giglio ISAWA, Vitor Yudy |
| Orientador(es): | D’ARCE, Álvaro Ferraz |
| Tipo documental: | Artigo Científico |
| Palavras-chave: | Reconhecimento de voz;Inteligência artificial |
| Data do documento: | 17-Jun-2026 |
| Editor: | 157 |
| Referência Bibliográfica: | ROCHA FILHO, Arivaldo Antônio Giglio; ISAWA, Vitor Yudy. Sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores utilizando inteligência artificial local. Orientador: Álvaro Ferraz D'Arce. 2026. 8 f. Artigo de Conclusão de Curso (Tecnologia em Análise e Desenvolvimento de Sistemas) - Faculdade de Tecnologia de Presidente Prudente, Presidente Prudente, SP, 2026. |
| Resumo: | Este artigo apresenta o desenvolvimento de um sistema open source para transcrição em tempo real de chamadas de voz com identificação de locutores, operando de forma local sem dependência de serviços em nuvem. A identificação de locutores é realizada na camada de transporte, por meio de fluxos de áudio individuais transmitidos via WebRTC, eliminando a necessidade de algoritmos de diarização. O sistema é composto por um módulo de captura em Rust com WebRTC, um serviço de reconhecimento de fala em Python com o modelo Whisper medium da OpenAI, e uma interface web em Next.js e TypeScript. Em testes no hardware de desenvolvimento (Intel Core i9-12900K, inferência em CPU), o sistema apresentou latência de inferência de 5,2 a 5,8 segundos por segmento, consumo de memória de pico de 4,06 GB e Real-Time Factor médio de 0,65, operando mais rápido que o tempo real. A qualidade da transcrição é respaldada por benchmarks publicados que reportam Word Error Rate de aproximadamente 11,46% em áudio de reuniões. Os resultados confirmam a viabilidade técnica da solução para uso prático. This paper presents the development of an open source system for real-time voice call transcription with speaker identification, operating locally without dependency on cloud services. Speaker identification is performed at the transport layer through individual audio streams transmitted via WebRTC, eliminating the need for diarization algorithms. The system comprises a capture module in Rust with WebRTC, a speech recognition service in Python using OpenAI's Whisper medium model, and a web interface in Next.js and TypeScript. In tests on the development hardware (Intel Core i9-12900K, CPU inference), the system showed inference latency of 5.2 to 5.8 seconds per segment, peak memory consumption of 4.06 GB, and an average Real-Time Factor of 0.65, operating faster than real-time. Transcription quality is supported by published benchmarks reporting a Word Error Rate of approximately 11.46% on meeting audio. The results confirm the technical feasibility of the solution for practical use. |
| URI: | https://ric.cps.sp.gov.br/handle/123456789/47717 |
| Aparece nas coleções: | Trabalhos de Conclusão de Curso |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| ads_2026_01_arivaldoagrochafilho_sistemaopensourceparatranscricao.pdf | 168.78 kB | Adobe PDF | Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.