Atividade Financiada
Portal multilingue para línguas de especialidade: extração de recursos bilingues a partir de dados em acesso aberto
Multilingual Portal for Specialized Languages: mining open data for cross-language information retrieval
Detalhes
Referência
PTDC/LLT-LIG/31113/2017
PTDC/LLT-LIG/31113/2017
Data de Início do Projeto
2019-11-11
2019-11-11
Data de Fim do Projeto
2023-06-30
2023-06-30
Área Científica
Humanidades
Humanidades
Programa de Financiamento
Concurso para Financiamento de Projetos de Investigação Científica e Desenvolvimento Tecnológico em Todos os Domínios Científicos - 2017
Concurso para Financiamento de Projetos de Investigação Científica e Desenvolvimento Tecnológico em Todos os Domínios Científicos - 2017
Resumo
A revolução tecnológica das últimas décadas contribuiu para a consolidação de um novo paradigma social, conhecido como sociedade do conhecimento ou sociedade da informação. Este paradigma reflete-se num mundo globalizado, multilingue e pleno de relações económicas, comerciais, políticas, sociais e culturais, onde a especialização profissional é uma necessidade. Neste contexto, as línguas de especialidade, com vocabulário, estruturas e funções gramaticais específicas, assumem um papel crucial. Fruto deste novo paradigma, temos um manancial de texto em vários domínios de especialização, como seja o domínio académico devido à promoção da Ciência Aberta, alvo de forte investimento nacional e comunitário. Contudo, o formato e a estruturação destes dados têm limitações em termos de processamento textual.
Pretendemos reaproveitar o material disponibilizado nos repositórios académicos e noutros de cariz não académico para criar um portal para línguas de especialidade que possibilite análises textuais mais robustas. Primeiramente, serão extraídos textos em português e inglês sobre as áreas disciplinares mais representativas dos repositórios. Note-se que esses textos não são traduções, mas textos comparáveis, ou seja, textos originalmente escritos em línguas diferentes sobre a mesma temática. Estes textos serão etiquetados com anotação estrutural e morfossintática e com metadados. Finalmente, será construída uma interface intuitiva, através da qual o utilizador poderá inserir um termo/expressão, obtendo as ocorrências desse termo em contexto. Numa pesquisa em português, o utilizador poderá visualizar os resultados nessa língua, mas poderá também ter acesso aos equivalentes de tradução do termo/expressão pesquisados. Este segundo modo de pesquisa prevê a construção de um motor de pesquisa bilingue capaz de identificar equivalentes de tradução a partir de textos comparáveis. No futuro, recorrendo a redes nacionais de repositórios de outros países, procuraremos replicar a arquitetura do portal a mais idiomas e também às outras variantes do português.
Este projeto, que reúne uma equipa multidisciplinar (especialistas em terminologia, linguística de corpus, processamento de linguagem natural e inteligência artificial), visa servir um leque alargado de utilizadores (professores, alunos, linguistas, investigadores, lexicográfos, tradutores, etc.) com diferentes necessidades, tais como a apreensão de convenções linguísticas, o reconhecimento de fraseologia discursiva (monolingue e bilingue), o apoio à redação especializada em língua materna e estrangeira, o ensino/aprendizagem de línguas para fins específicos, a análise do discurso de especialidade em situações comunicativas heterogéneas e a criação de recursos lexicográficos e terminológicos.
Instituições
Instituições Principais
- Universidade do Minho (UMinho)
Outras Instituições
- Universidade do Minho (UMinho)
Financiamento 188.766,72 €
Fundação para a Ciência e a Tecnologia (FCT) - Portugal
32.251,22 €
União Europeia - Portugal2020 (UE - PT2020)
156.515,50 €