Petro KGrapha methodology for extracting knowledge graph from technical documents - an application in the oil and gas industry.
Cordeiro, Fábio Corrêa
O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.
Resumo
Inúmeras organizações estão interessadas em coletar informações estratégicas de seus repositórios de documentos. Essa preocupação e especialmente relevante para a indústria de óleo e gás, que possui grandes repositórios de relatórios geocinéticos de várias décadas de produção. Disponibilizar esta informação em um formato estruturado pode desbloquear informações valiosas dessa montanhas de dados, o que ´e crucial para apoiar uma vasta gama de aplicações industriais e acadêmicas. Contudo, a maioria dos recursos para processamento de linguagem natural foi construída com textos de domínio geral extraídos da Internet e escritos principalmente em inglês. Esta tese apresenta uma metodologia para extrair entidades e relações geocinéticas de documentos t´técnicos e povoar um grafo de conhecimento - o Petro KGraph. Também desenvolvemos um conjunto abrangente de recursos de processamento de linguagem natural e extração de informações para a indústria de ´óleo e gás em português. Ao longo do texto, descrevemos os recursos de processamento de linguagem natural e extração de informações, o processo utilizado para treinar os modelos de aprendizado de m´máquina e revisamos a literatura relevante. Por fim, avaliamos cada modelo e a metodologia como um todo. Desenvolvemos uma abordagem inovadora para o Entity Linking que permite encontrar novas entidades além das já conhecidas. Outra contribuição crucial ´e que os recursos e procedimentos de avaliação constituem uma nova referência para a língua portuguesa e o domínio das geociências. Avaliamos um sistema de recuperação de informação utilizando o Petro KGraph para expandir suas consultas, que apresentou um resultado um pouco melhor que o sistema sem expansão de consultas. Os planos para trabalhos futuros incluem o aprimoramento de um conjunto de teste de recuperação de informações, a comparação dos resultados usando diferentes algoritmos de vetorização de grafos e o teste de modelos de linguagem lançados após os modelos BERT.
Ficha do documento
- Tipo
- Tese
- Ano
- 2024
- Instituição
- Fundação Getulio Vargas
- Fonte
- Repositório da FGV
- Idioma
- Inglês
- Acesso
- Acesso aberto
- Identificador
- oai:repositorio.fgv.br:10438/35868
Conteúdos relacionados
- DissertaçãoLevantamento de indicadores através de data mining, Latent Dirichlet Allocation e TF-IDFFundação Getulio Vargas · 2020
- OutroContribuições e desafios guiados por um pipeline de processamento de linguagem naturalFundação Getulio Vargas · 2019
- DissertaçãoComparando a saúde no Brasil com os países da OCDEFundação Getulio Vargas · 2016
- TeseWords as dataFundação Getulio Vargas · 2023