Aprimoramento de fala baseado em modelos híbridos de filtragem inversa e aprendizado profundo
O aprimoramento de fala tem como objetivo melhorar a qualidade perceptiva e a inteligibilidade de sinais de fala degradados por diferentes tipos de distorções, com aplicações em sistemas de comunicação, reconhecimento de fala e aparelhos auditivos. Este trabalho apresenta o estudo e o desenvolvimento de métodos de aprimoramento de fala baseados em modelos híbridos que combinam a filtragem inversa clássica e redes neurais profundas. Seu principal objetivo foi o treinamento conjunto de blocos inspirados em filtros de resposta finita ao impulso (FIR), com uma rede do tipo UNet, diferentemente de abordagens anteriores em que os filtros são estimados de forma independente. A arquitetura proposta encadeia um filtro de pré-processamento, o bloco UNet e um filtro de pós-processamento, permitindo ativar ou treinar cada bloco de maneira modular ou conjunta. Os modelos foram treinados e avaliados sobre a base do Helsinki Speech Challenge 2024, considerando dois níveis de degradação da tarefa de filtragem, com funções de custo definidas no domínio do tempo e da frequência. O desempenho foi mensurado por métricas objetivas de qualidade e de inteligibilidade. Os resultados preliminares indicam uma relação direta entre as métricas baseadas em energia e a função de custo empregada, enquanto que métricas perceptivas e de inteligibilidade mostraram divergências com a função de custo. Como perspectivas, o trabalho aponta para um caminho de exploração de funções de custo mais eficientes, implementação de métricas de desempenho comparáveis com outros trabalhos, além de buscar maior eficiência computacional sem perda de qualidade nos resultados.