Saltar para o conteúdo principal

Consulte informações sobre apoios e financiamentos científicos em Portugal

Atividade Financiada

Deteção de fala sintética para a administração pública portuguesa

Portuguese synthetic speech detection for public administration

Referência
2024.07291.IACDC
Data de Início do Projeto
2025-04-01
Data de Fim do Projeto
2026-01-31
Investigador Principal
Área Científica
Ciências exatas
Programa de Financiamento
Inteligência Artificial, Ciência dos Dados e Cibersegurança de relevância na Administração Pública

Resumo

Na sua versão atual, o Artigo 50 do AI ACT da União Europeia [1] estabelece as obrigações de transparência onde, entre outras, refere explicitamente que os produtores de conteúdos gerados por IA, incluindo áudio, devem divulgar que o conteúdo foi gerado ou manipulado artificialmente. A administração pública portuguesa já começou a utilizar a fala como forma privilegiada de interação com o público. Um exemplo é o assistente virtual para informação sobre a chave móvel digital [2]. À medida que a fala sintética, também conhecida como deepfake áudio quando utilizada para fins perniciosos, se torna cada vez mais predominante, vai apresentando desafios significativos na distinção entre a fala humana e a sintética. Um estudo de 2023 revelou que “os humanos não conseguem detetar de forma fiável deepfakes de fala” [3]. Os serviços da administração pública que dependem da fala, como o número de serviço de emergência 112, devem garantir a autenticidade das suas comunicações para evitar a falsificação de identidade, a propagação de desinformação, a utilização racional de recursos e cumprir os requisitos regulamentares. Para verificar a autenticidade das comunicações, este projeto propõe, como prova de conceito, o desenvolvimento de uma API (Application Program Interface) e o correspondente detetor de fala sintética para a língua portuguesa como necessário aos serviços da administração pública. Atualmente existem vários detetores de fala sintética disponíveis, a maioria para a língua inglesa. Devido às especificidades de várias línguas, como as nuances das características prosódicas e fonéticas, estes estudos apresentam ainda uma generalização limitada para línguas diferentes para as quais foram treinados. A principal inovação deste projeto reside no seu foco no Português. Segundo a Wikipédia [4], o Português tem aproximadamente 300 milhões de falantes, é uma das línguas mais faladas no mundo e está espalhado por todos os continentes. Apesar disso, a língua portuguesa está fortemente sub-representada nas atuais tecnologias de deteção de fala sintética. Até ao momento, uma extensa pesquisa bibliográfica  encontrou um único trabalho sobre deteção de deepfake adaptado para a língua portuguesa, mas focado principalmente em características extraídas de vídeo [5]. Assim, este projecto pretende colmatar uma lacuna crítica nas soluções existentes. Dado que a sociedade portuguesa é actualmente composta por falantes de Português de diferentes origens, o objectivo é desenvolver um detector sintético de fala portuguesa capaz de lidar não só com PT-PT (português europeu) mas também com todas os seus sotaques, variantes e dialectos, do Norte ao Sul, dos Açores à Madeira, mas também a falantes de Português de países como Angola, Brasil, Cabo Verde, Guiné, Macau, Moçambique, São Tomé e Príncipe e Timor-Leste. A nossa abordagem baseia-se em modelos de aprendizagem profunda recentes, incluindo aqueles usados para aprendizagem por transferência e adaptação de domínio [29, 30], para criar um detector inovador, robusto e preciso, capaz de identificar a fala sintética em Português. Em particular, o projeto começa por examinar qual o desempenho para Português de modelos como o Res-TSSDNet [6] ou TE-ResNet [7]. Estes são os detetores vencedores, para Inglês, na competição ASVspoof, um evento bi-anual destinado a incentivar este tipo de investigação [8]. O projeto incluirá uma pesquisa e revisão contínua da literatura sobre métodos de deteção de fala sintética, a aquisição e anotação do conjunto de dados necessário com áudio Português real e sintético, o emprego de técnicas generativas de aumento de dados e o desenvolvimento do modelo de detetor de fala sintética. O impacto previsto deste projeto é multifacetado. Do ponto de vista prático, irá dotar os serviços da administração pública portuguesa das ferramentas necessárias para autenticar as comunicações áudio, aumentando assim a credibilidade e fiabilidade do serviço. Do ponto de vista académico, contribuirá para o campo da detecção de fala sintética, colmatando a praticamente inexistência de resultados para a língua portuguesa na literatura. Além disso, o projeto promoverá a utilização responsável da IA ??na administração pública, alinhando com princípios mais amplos de ética e governação da IA.

Instituições

Instituições Principais

  • Universidade do Algarve (UALg)

Outras Instituições

  • NOS Inovação (NOSi)

Financiamento 73.428,50 €

Fundação para a Ciência e a Tecnologia (FCT) - Portugal

0,00 €

União Europeia - Estrutura de Missão Recuperar Portugal (UE - EMRP)

73.428,50 €
  • 2025-04-01 a 2026-01-31
  • 2024.07291.IACDC