Logo
Dissertação

NLP in Brazilian banking resultscomparison between traditional topic modeling techniques and LLMS

Barros, Arthur Barretto Leite de

O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.

Resumo

Este estudo avalia a aplicação de técnicas de Natural Language Processing (NLP) na análise de transcrições de chamadas de resultados trimestrais de bancos brasileiros, com foco na comparação entre métodos tradicionais de modelagem de tópicos—Latent Dirichlet Allocation (LDA) e BERTopic—e Large Language Models (LLMs), incluindo GPT-4-turbo, Llama3 e Qwen2. A pesquisa é estruturada em três tarefas de referência: (1) comparação entre métodos tradicionais de NLP e GPT-4-turbo para modelagem de tópicos não estruturados; (2) avaliação de GPT-4- turbo, Llama3 e Qwen2 em modelagem de tópicos não estruturados usando a inovadora técnica "LLM-as-a-Judge"; e (3) avaliação de LLMs em modelagem de tópicos estruturados e análise de sentimento com uso de conjuntos de dados rotulados. Os resultados revelam as limitações dos modelos tradicionais em capturar conteúdos específicos e contextualmente ricos devido à dependência de técnicas baseadas em bag-of-words e agrupamento, especialmente em conjuntos de dados pequenos e homogêneos. Em contraste, os LLMs demonstraram desempenho superior, aproveitando arquiteturas pré-treinadas para gerar saídas contextualmente ricas e coerentes sem a necessidade de treinamento específico para o conjunto de dados. Entre os LLMs, o GPT-4-turbo destacou-se consistentemente em todas as tarefas, alcançando pontuações mais altas em coerência, precisão e relevância contextual. Modelos de código aberto, como o Qwen2, mostraram potencial como alternativas eficientes em recursos, embora com consistência reduzida em comparação com o GPT-4-turbo. O estudo destaca as metodologias em evolução para avaliar modelos modernos de NLP, enfatizando a inadequação de métricas tradicionais como coerência e UMass para analisar saídas de LLMs. Ao incorporar uma abordagem híbrida de avaliação—combinando benchmarks estruturados, avaliações qualitativas e a técnica "LLM-as-a-Judge"—esta pesquisa apresenta um método abrangente para comparação de modelos. Os resultados ressaltam o potencial transformador dos LLMs em aplicações específicas de domínio e sugerem caminhos para avanços futuros em técnicas de avaliação de NLP e escalabilidade de modelos.

Ficha do documento

Tipo
Dissertação
Ano
2025
Instituição
Fundação Getulio Vargas
Idioma
Inglês
Acesso
Acesso aberto
Identificador
oai:repositorio.fgv.br:10438/36695

Conteúdos relacionados

Voltar à Biblioteca
Logo