Robust unlearning via randomly initialized distillationa theoretical investigation
Duim, João Lucas
O documento é disponibilizado pela fonte de origem, que mantém a versão integral e as condições de uso.
Resumo
A implementação de grandes modelos de linguagem (LLMs) treinados com dados em escala web tornou necessária a criação de mecanismos robustos para o desaprendizado de máquina — a remoção posterior de capacidades perigosas, material protegido por direitos autorais ou dados pessoais sensíveis. Os paradigmas de desaprendizado existentes, baseados principalmente em otimização ou engenharia de representação, frequentemente falham em alcançar a eliminação completa e podem resultar em mascaramento comportamental, onde o modelo suprime saídas perigosas enquanto retém a capacidade subjacente em seus parâmetros, tornando-o suscetível a ataques de reaprendizagem rápida. Esta dissertação apresenta uma estrutura teórica que estabelece as condições sob as quais a destilação inicializada aleatoriamente permite um desaprendizado robusto. Formalizamos o processo de desaprendizado através da lente da teoria da informação e da geometria de alta dimensão. A principal contribuição é uma prova baseada na desigualdade de processamento de dados, mostrando que inicializar um modelo aluno a partir de uma distribuição aleatória — em vez de ajustar os pesos pré-treinados — rompe a linhagem de parâmetros necessária para manter alta informação mútua com uma variável latente perigosa. Enquanto o ajuste fino permanece preso na perigosa bacia de atração devido à dinâmica de treinamento preguiçoso, a destilação inicializada aleatoriamente não apresenta essa tendência, eliminando assim a persistência da capacidade perigosa sob nossas suposições.
Ficha do documento
- Tipo
- Dissertação
- Ano
- 2026
- Instituição
- Fundação Getulio Vargas
- Fonte
- Repositório da FGV
- Idioma
- Inglês
- Acesso
- Acesso aberto
- Identificador
- oai:repositorio.fgv.br:10438/38509
- Temas
- TecnologiaDados
- Palavras-chave
- RobustMachineUnlearningRandomInitializedDistillationArtificialIntelligenceInformationBottleneckRobustoMáquinaDesaprendizagemAleatórioInicializadoDestilaçãoInteligênciaInformaçãoGargaloMatemáticaInteligência artificialMineração de dados (Computação)Comunicações digitaisSistemas eletrônicosBanco de dados
Conteúdos relacionados
- OutroArtificial Intelligence Value Alignment via Inverse Reinforcement LearningFundação Getulio Vargas · 2023
- DissertaçãoInteligência artificial em museusFundação Getulio Vargas · 2026
- DissertaçãoBalancing performance and explanation plausibilityFundação Getulio Vargas · 2024
- DissertaçãoFast Object Localization via Neural NetworksFundação Getulio Vargas · 2024