Pular para o conteúdo
Rota Nacional

Radar ·

Estudo rastreia dados de treino ligados a circuitos em LLMs

Publicado em 7 de julho de 2026, o trabalho apresenta um método para relacionar amostras de treino a attention heads interpretáveis e relata efeitos de intervenções sobre esses circuitos.

Publicado em 7 de julho de 2026, o trabalho descreve o Mechanistic Data Attribution, um framework que usa influence functions para relacionar unidades interpretáveis de LLMs a amostras de treino. O foco é conectar dados de treinamento à emergência e ao comportamento de attention heads.

Segundo os autores, alterar algumas amostras de alta influência afeta quais heads emergem, e intervenções em induction heads mudam o in-context learning. Para conferir método, evidências e limites, consulte o trabalho original e compare as alegações com seus resultados; os detalhes disponíveis neste registro não especificam o tamanho dos testes nem suas métricas.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis