Publicado em 28 de setembro de 2026, o relato descreve uma técnica que ordena representações neurais ou mudanças de pesos de fine-tuning pela influência sobre o comportamento preservado sob intervenções suaves.
Publicado em 28 de setembro de 2026, o texto apresenta Matryoshka Attribution, técnica que aprende uma classificação aninhada de representações neurais ou de mudanças nos pesos de fine-tuning. O critério relatado é o comportamento que permanece preservado quando os componentes sofrem intervenções suaves.
Como resultado ilustrativo, o post afirma que reverter 1% dos pesos no Llama 3.1 8B remove a maior parte do comportamento de recusa. A técnica é apresentada como possível auxílio para localizar circuitos comportamentais e mudanças de pesos influentes no fine-tuning. Para avaliar o achado, consulte o post original e confira método, definição da intervenção e evidências experimentais; o resumo disponível não detalha esses elementos.