Logo
Tese

Petro KGrapha methodology for extracting knowledge graph from technical documents - an application in the oil and gas industry.

Cordeiro, Fábio Corrêa

O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.

Resumo

Inúmeras organizações estão interessadas em coletar informações estratégicas de seus repositórios de documentos. Essa preocupação e especialmente relevante para a indústria de óleo e gás, que possui grandes repositórios de relatórios geocinéticos de várias décadas de produção. Disponibilizar esta informação em um formato estruturado pode desbloquear informações valiosas dessa montanhas de dados, o que ´e crucial para apoiar uma vasta gama de aplicações industriais e acadêmicas. Contudo, a maioria dos recursos para processamento de linguagem natural foi construída com textos de domínio geral extraídos da Internet e escritos principalmente em inglês. Esta tese apresenta uma metodologia para extrair entidades e relações geocinéticas de documentos t´técnicos e povoar um grafo de conhecimento - o Petro KGraph. Também desenvolvemos um conjunto abrangente de recursos de processamento de linguagem natural e extração de informações para a indústria de ´óleo e gás em português. Ao longo do texto, descrevemos os recursos de processamento de linguagem natural e extração de informações, o processo utilizado para treinar os modelos de aprendizado de m´máquina e revisamos a literatura relevante. Por fim, avaliamos cada modelo e a metodologia como um todo. Desenvolvemos uma abordagem inovadora para o Entity Linking que permite encontrar novas entidades além das já conhecidas. Outra contribuição crucial ´e que os recursos e procedimentos de avaliação constituem uma nova referência para a língua portuguesa e o domínio das geociências. Avaliamos um sistema de recuperação de informação utilizando o Petro KGraph para expandir suas consultas, que apresentou um resultado um pouco melhor que o sistema sem expansão de consultas. Os planos para trabalhos futuros incluem o aprimoramento de um conjunto de teste de recuperação de informações, a comparação dos resultados usando diferentes algoritmos de vetorização de grafos e o teste de modelos de linguagem lançados após os modelos BERT.

Ficha do documento

Tipo
Tese
Ano
2024
Instituição
Fundação Getulio Vargas
Idioma
Inglês
Acesso
Acesso aberto
Identificador
oai:repositorio.fgv.br:10438/35868

Conteúdos relacionados

Voltar à Biblioteca
Logo