Model risk in credit scoring models with big data applications
Yoshida Junior, Valter Takuo
O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.
Resumo
Grandes bancos de dados e Aprendizado de Máquina (Machine Learning) têm aumentado nossa capacidade de produzir modelos de pontuação de crédito (credit scoring) com diferentes números de observações e variáveis explicativas. Embora gerentes e reguladores tenham preocupações com os potenciais riscos associados à discricionaridade dada aos algoritmos para seleção de variáveis, à construção do modelo e à ausência de causalidade, pouca atenção tem sido dada à utilização inadequada de modelos com alto desempenho, ou ao risco de modelo. Este estudo preenche esta lacuna, propondo uma nova medida de risco de modelo, 𝐶𝑆𝑀𝑅 (Credit Scoring Model Risk), baseada na correlação entre a variável dependente e as previsões geradas. Testa-se empiricamente o 𝐶𝑆𝑀𝑅 em modelos de pontuação de crédito plugin LASSO. Constata-se que a adição de empréstimos de diferentes bancos (aumentando o número de observações) não é uma opção ótima em avaliações dentro-da-amostra (in-sample), desafiando a suposição de que mais dados levam a melhores previsões. No entanto, a avaliação utilizando dados dentro-da-amostra (in-sample) pode apresentar instabilidade em estimativas fora-do-período (out-of-time) de amostragem. A tomada de decisão (a escolha de um modelo entre uma variedade de possibilidades) com base em medidas dentro-da-amostra pode ser problemática, pois as carteiras de empréstimos mudam ao longo do tempo, os modelos podem nascer descalibrados (ou não bem ajustados à carteira atual) e podem ser comportar de maneira diferente sob novas condições macroeconômicas ou diante de eventos exógenos e estocásticos. Este trabalho também propõe um procedimento para prever o modelo de melhor desempenho fora-do-período de amostragem. As três abordagens (complementares) ajudam a escolher entre os modelos de dados segmentados ou completos, prevendo em qual modelo a correlação tende a ser maior (ou qual modelo tende a ter o menor risco de modelo. A primeira abordagem baseia-se no conceito de encolhimento (shrinkage); a segunda utilizada uma simulação de Monte Carlo; e terceira é uma estimativa bayesiana da covariância entre a variável dependente e as previsões.
Ficha do documento
- Tipo
- Tese
- Ano
- 2023
- Instituição
- Fundação Getulio Vargas
- Fonte
- Repositório da FGV
- Idioma
- Inglês
- Acesso
- Acesso aberto
- Identificador
- oai:repositorio.fgv.br:10438/33946
- Temas
- Dados
- Palavras-chave
- Model riskModel selectionCredit riskCredit scoringBig dataMachine learningRisco de modeloSeleção de modelosRisco de créditoEscoragem de créditoAprendizado de máquinaAdministração de empresasCréditos - Avaliação de riscosAdministração de riscoCrédito direto ao consumidorAprendizado do computador
Conteúdos relacionados
- DissertaçãoPrevisão da taxa de ativos problemáticos do crédito imobiliário pessoa físicaFundação Getulio Vargas · 2025
- TeseAplicação de inteligência artificial e geoanalytics no desenvolvimento de plataforma territorial sobre longevidade populacional brasileiraFundação Getulio Vargas · 2025
- DissertaçãoModelagem e previsão da taxa de inadimplênciaFundação Getulio Vargas · 2025
- DissertaçãoA dinâmica da inadimplência no microcrédito brasileiroFundação Getulio Vargas · 2025