Estudo rastreia dados de treino ligados a circuitos em LLMs
Publicado em 7 de julho de 2026, o trabalho apresenta um método para relacionar amostras de treino a attention heads interpretáveis e relata efeitos de intervenções sobre esses circuitos.
Publicado em 7 de julho de 2026, o trabalho descreve o Mechanistic Data Attribution, um framework que usa influence functions para relacionar unidades interpretáveis de LLMs a amostras de treino. O foco é conectar dados de treinamento à emergência e ao comportamento de attention heads.
Segundo os autores, alterar algumas amostras de alta influência afeta quais heads emergem, e intervenções em induction heads mudam o in-context learning. Para conferir método, evidências e limites, consulte o trabalho original e compare as alegações com seus resultados; os detalhes disponíveis neste registro não especificam o tamanho dos testes nem suas métricas.