Introspective Coupling: Treinamento de Autoexplicação em Modelos de Linguagem
Pesquisa sobre como treinar modelos de linguagem para gerar explicações fiéis sobre suas próprias previsões, usando comportamento contrafactual como supervisão. Demonstra que LMs podem rastrear mudanças comportamentais mesmo com supervisão fixa de checkpoints anteriores, abrindo caminho para modelos mais interpretáveis e confiáveis em produção.
Ler artigo completo