Saltar para o conteúdo principal

Consulte informações sobre apoios e financiamentos científicos em Portugal

Atividade Financiada

Anotação automatica e integração de dados de BioBanco usando LLMs e ontologias

Automated Annotation and Integration of Biobank Data Using LLMs and Ontologies

Referência
2024.07694.IACDC
Data de Início do Projeto
2025-05-01
Data de Fim do Projeto
2026-01-31
Investigador Principal
Área Científica
Ciências médicas e da saúde
Programa de Financiamento
Inteligência Artificial, Ciência dos Dados e Cibersegurança de relevância na Administração Pública

Resumo

Nos últimos anos, a proliferação de dados não estruturados em biobancos apresentou desafios significativos na gestão, integração e utilização de dados. Este projeto visa desenvolver uma infraestrutura de Processamento de Linguagem Natural (NLP) apoiada por Large Language Models (LLMs) para automatizar a extração e estruturação de dados de texto não estruturados dentro de um contexto de biobanco, alinhando-os com ontologias biomédicas estabelecidas, como o NCI Thesaurus. A iniciativa aborda a questão crítica dos registos médicos incompletos e não normalizados que dificultam a interoperabilidade, a reutilização e o desenvolvimento de modelos preditivos. Ao aproveitar as capacidades semânticas dos LLMs de última geração, procuramos transformar as anotações não estruturadas em formatos consistentes e estruturados que aderem a padrões ontológicos específicos. A informação disponível nos biobancos oferece uma base de conhecimento significativa e diversificada para apoiar a criação de ontologias essenciais para a interoperabilidade a nível nacional e internacional entre os sistemas de saúde e a forma como a informação é trocada e compreendida. Prevê-se que a implementação desta estrutura de NPL ofereça inúmeros benefícios. Primeiro, a automatização dos processos de gestão e curadoria de dados é concebida para reduzir significativamente o esforço manual necessário, libertando recursos para tarefas mais estratégicas. Secundariamente, um dos principais benefícios será a interoperabilidade, permitindo que os conjuntos de dados sejam estruturados e alinhados com a mesma referência semântica. Por último, apoiará a análise preditiva, fornecendo aos investigadores dados estruturados de alta qualidade que podem ser utilizados para desenvolver modelos de aprendizagem automática para prever os resultados de saúde e a progressão da doença. O projeto abrange várias fases principais: uma fase de recolha de dados, uma fase de tradução que converterá o texto médico português para inglês, garantindo a compatibilidade com ontologias de língua inglesa amplamente utilizadas e maximizando a utilidade dos recursos de NLP existentes, e uma fase de desenvolvimento que consiste numa abordagem zero-shot para estabelecer uma referência de desempenho base, a criação de conjuntos de dados de alta qualidade por meio de anotação especializada e o refinamento iterativo do modelo para aumentar a sua precisão e fiabilidade. Paralelamente, iremos desenvolver um alinhador de ontologias aproveitando as capacidades semânticas dos LLMs, utilizando os embeddings como medidas de similaridade entre estruturas hierárquicas semânticas. Para demonstrar a utilidade prática da estrutura desenvolvida, iremos aplicá-la ao nosso conjunto de dados de cancro de biobanco e produzir uma versão estruturada do conjunto de dados em duas ontologias diferentes, mostrando a capacidade do modelo para melhorar a interoperabilidade dos dados e acrescentar valor a conjuntos de dados díspares. Espera-se que os resultados deste projeto reduzam significativamente o esforço manual na curadoria de dados e apoiem a análise preditiva fornecendo uma solução robusta e escalável para a extração e anotação de dados estruturados. Esta iniciativa contribui para o objectivo mais vasto de melhorar a investigação biomédica através de uma maior consistência e acessibilidade dos dados.  Um dos principais benefícios deste quadro será a interoperabilidade entre fontes de dados que não utilizam necessariamente os mesmos vocabulários controlados. A estrutura incluirá um mecanismo inovador que aproveita as capacidades semânticas dos LLMs para mapear conceitos entre ontologias. Ao utilizar incorporações LLM para capturar relações semânticas, a estrutura pode traduzir e alinhar eficazmente dados de diferentes fontes numa estrutura unificada. Esta capacidade garante uma integração e comparação perfeitas de diversos conjuntos de dados, promovendo a partilha e colaboração de dados mais robusta entre diversas instituições de investigação e ambientes clínicos. Consequentemente, isto aumentará a capacidade de conduzir investigação biomédica abrangente e melhorará a precisão e a eficácia dos modelos preditivos. Em síntese, a estrutura proposta da PNL representa um avanço significativo na gestão e utilização de dados de biobancos. Ao aproveitar as capacidades dos LLMs, visa transformar texto não estruturado em informações valiosas e acionáveis, abrindo caminho para melhores resultados de investigação e envolvimento dos participantes. O foco do projeto na automatização, normalização e colaboração está alinhado com os objetivos mais amplos de modernizar as operações dos biobancos e garantir o seu alinhamento com as normas internacionais de gestão de dados. Através destes esforços, o projeto procura estabelecer um novo paradigma na gestão de dados medicos existentes em biobanco que maximize o potencial dos dados disponíveis, mantendo ao mesmo tempo os mais elevados padrões de conformidade ética e legal.

Instituições

Instituições Principais

  • Fundação GIMM - Gulbenkian Institute for Molecular Medicine (GIMM)
  • Universidade de Lisboa Instituto de Medicina Molecular João Lobo Antunes (IMM)

Outras Instituições

  • Instituto Gulbenkian de Ciência (IGC)

Financiamento 124.135,25 €

Fundação para a Ciência e a Tecnologia (FCT) - Portugal

0,00 €

União Europeia - Estrutura de Missão Recuperar Portugal (UE - EMRP)

124.135,25 €
  • 2025-05-01 a 2026-01-31
  • 2024.07694.IACDC