Development, validation, and application of cyber-bertusing deep learning for large-scale identification and classification of cybersecurity disclosures in SEC filings
Pinheiro, José Ricardo Monteiro
O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.
Resumo
Uma vez que cibersegurança se tornou um dos principais riscos globais, a necessidade das empresas em fornecer tais informações de forma transparente e oportuna se tornou obrigatória. Isso proporcionou uma vasta linha de pesquisa sobre divulgação de cibersegurança. No entanto, algumas lacunas permanecem na literatura: (a) uso de pequenas amostras ou de curto prazo; (b) classificação binária (relacionada versus não relacionada à cibersegurança), em vez de múltiplas categorias; (c) usos de dicionários em vez de aprendizado de máquina ou mesmo grandes modelos de aprendizado; (d) escassez de estudos que incluam relatórios 8-K tempestivos, além dos relatórios anuais 10-K; (e) ausência de estudos de cibersegurança que tenham mensurado boilerplate em diferentes categorias. Este artigo descreve o desenvolvimento e validação de um modelo de aprendizado profunda chamado CYBER-BERT e, para endereçar essas lacunas, ilustra sua aplicação identificando e categorizando 2,5 milhões de frases relacionadas à cibersegurança contidas nos relatórios SEC 10-K e 8-K ao longo de 18 anos (2006-2023). Como contribuições do estudo, além do conjunto de ferramentas, os resultados de 4 ilustrações de uso mostraram que (a) as empresas não apresentaram divulgações de cibersegurança tão oportunamente quanto pretendido pela SEC: 95,5% das divulgações foram submetidas nos 10- Ks em vez dos 8-Ks mais oportunos; (b) divulgações de cibersegurança aumentaram significativamente: o total de divulgações cresceu 343% e as divulgações de incidentes cresceram 510%; (c) em termos de conteúdo, duas categorias de cibersegurança exibiram uso de padronização alto (vulnerabilidade) e médio (ação), e todas as categorias tiveram baixa legibilidade; e (d) após a divulgação de uma violação, as atividades de divulgação de vulnerabilidade e ação aumentaram 97,4% e 77,4%, respectivamente, em comparação com o ano anterior. Além disso, são discutidas implicações para a pesquisa e a prática.
Ficha do documento
- Tipo
- Tese
- Ano
- 2024
- Instituição
- Fundação Getulio Vargas
- Fonte
- Repositório da FGV
- Idioma
- Inglês
- Acesso
- Acesso restrito
- Identificador
- oai:repositorio.fgv.br:10438/35562
- Temas
- TecnologiaDados
- Palavras-chave
- CybersecurityDisclosureMachine learningNatural language processingNLPDeep learningBERTLarge language modelLLMCybersecurity breachText analysisCibersegurançaDivulgação de informaçõesAprendizado de máquinaProcessamento de linguagem naturalIncidente de segurança da informaçãoAdministração de empresasTecnologia da informação - Medidas de segurançaProteção de dadosAprendizado do computadorProcessamento da linguagem natural (Computação)
Conteúdos relacionados
- DissertaçãoArtificial intelligence for demand prediction in the construction businessFundação Getulio Vargas · 2023
- TeseInstitutions, ideas, and cultural changeFundação Getulio Vargas · 2026
- TeseAplicação de inteligência artificial e geoanalytics no desenvolvimento de plataforma territorial sobre longevidade populacional brasileiraFundação Getulio Vargas · 2025
- DissertaçãoEmerging AI governance practices, challenges, and opportunities in industryFundação Getulio Vargas · 2024