NLP in Brazilian banking resultscomparison between traditional topic modeling techniques and LLMS
Barros, Arthur Barretto Leite de
O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.
Resumo
Este estudo avalia a aplicação de técnicas de Natural Language Processing (NLP) na análise de transcrições de chamadas de resultados trimestrais de bancos brasileiros, com foco na comparação entre métodos tradicionais de modelagem de tópicos—Latent Dirichlet Allocation (LDA) e BERTopic—e Large Language Models (LLMs), incluindo GPT-4-turbo, Llama3 e Qwen2. A pesquisa é estruturada em três tarefas de referência: (1) comparação entre métodos tradicionais de NLP e GPT-4-turbo para modelagem de tópicos não estruturados; (2) avaliação de GPT-4- turbo, Llama3 e Qwen2 em modelagem de tópicos não estruturados usando a inovadora técnica "LLM-as-a-Judge"; e (3) avaliação de LLMs em modelagem de tópicos estruturados e análise de sentimento com uso de conjuntos de dados rotulados. Os resultados revelam as limitações dos modelos tradicionais em capturar conteúdos específicos e contextualmente ricos devido à dependência de técnicas baseadas em bag-of-words e agrupamento, especialmente em conjuntos de dados pequenos e homogêneos. Em contraste, os LLMs demonstraram desempenho superior, aproveitando arquiteturas pré-treinadas para gerar saídas contextualmente ricas e coerentes sem a necessidade de treinamento específico para o conjunto de dados. Entre os LLMs, o GPT-4-turbo destacou-se consistentemente em todas as tarefas, alcançando pontuações mais altas em coerência, precisão e relevância contextual. Modelos de código aberto, como o Qwen2, mostraram potencial como alternativas eficientes em recursos, embora com consistência reduzida em comparação com o GPT-4-turbo. O estudo destaca as metodologias em evolução para avaliar modelos modernos de NLP, enfatizando a inadequação de métricas tradicionais como coerência e UMass para analisar saídas de LLMs. Ao incorporar uma abordagem híbrida de avaliação—combinando benchmarks estruturados, avaliações qualitativas e a técnica "LLM-as-a-Judge"—esta pesquisa apresenta um método abrangente para comparação de modelos. Os resultados ressaltam o potencial transformador dos LLMs em aplicações específicas de domínio e sugerem caminhos para avanços futuros em técnicas de avaliação de NLP e escalabilidade de modelos.
Ficha do documento
- Tipo
- Dissertação
- Ano
- 2025
- Instituição
- Fundação Getulio Vargas
- Fonte
- Repositório da FGV
- Idioma
- Inglês
- Acesso
- Acesso aberto
- Identificador
- oai:repositorio.fgv.br:10438/36695
Conteúdos relacionados
- DissertaçãoModelo preditivo para precificação de ativos com integração de notícias do mercado financeiro e técnicas de machine learningFundação Getulio Vargas · 2025
- DissertaçãoModelagem da PD forward lookingFundação Getulio Vargas · 2022
- DissertaçãoBusca por valor em notícias e fatos relevantes utilizando-se de redes neurais e aprendizado profundoFundação Getulio Vargas · 2019
- DissertaçãoO poder da palavraFundação Getulio Vargas · 2019