Logo
Tese

Model risk in credit scoring models with big data applications

Yoshida Junior, Valter Takuo

O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.

Resumo

Grandes bancos de dados e Aprendizado de Máquina (Machine Learning) têm aumentado nossa capacidade de produzir modelos de pontuação de crédito (credit scoring) com diferentes números de observações e variáveis explicativas. Embora gerentes e reguladores tenham preocupações com os potenciais riscos associados à discricionaridade dada aos algoritmos para seleção de variáveis, à construção do modelo e à ausência de causalidade, pouca atenção tem sido dada à utilização inadequada de modelos com alto desempenho, ou ao risco de modelo. Este estudo preenche esta lacuna, propondo uma nova medida de risco de modelo, 𝐶𝑆𝑀𝑅 (Credit Scoring Model Risk), baseada na correlação entre a variável dependente e as previsões geradas. Testa-se empiricamente o 𝐶𝑆𝑀𝑅 em modelos de pontuação de crédito plugin LASSO. Constata-se que a adição de empréstimos de diferentes bancos (aumentando o número de observações) não é uma opção ótima em avaliações dentro-da-amostra (in-sample), desafiando a suposição de que mais dados levam a melhores previsões. No entanto, a avaliação utilizando dados dentro-da-amostra (in-sample) pode apresentar instabilidade em estimativas fora-do-período (out-of-time) de amostragem. A tomada de decisão (a escolha de um modelo entre uma variedade de possibilidades) com base em medidas dentro-da-amostra pode ser problemática, pois as carteiras de empréstimos mudam ao longo do tempo, os modelos podem nascer descalibrados (ou não bem ajustados à carteira atual) e podem ser comportar de maneira diferente sob novas condições macroeconômicas ou diante de eventos exógenos e estocásticos. Este trabalho também propõe um procedimento para prever o modelo de melhor desempenho fora-do-período de amostragem. As três abordagens (complementares) ajudam a escolher entre os modelos de dados segmentados ou completos, prevendo em qual modelo a correlação tende a ser maior (ou qual modelo tende a ter o menor risco de modelo. A primeira abordagem baseia-se no conceito de encolhimento (shrinkage); a segunda utilizada uma simulação de Monte Carlo; e terceira é uma estimativa bayesiana da covariância entre a variável dependente e as previsões.

Ficha do documento

Tipo
Tese
Ano
2023
Instituição
Fundação Getulio Vargas
Idioma
Inglês
Acesso
Acesso aberto
Identificador
oai:repositorio.fgv.br:10438/33946
Temas
Dados

Conteúdos relacionados

Voltar à Biblioteca
Logo