Pular para o conteúdo
Rota Nacional

Radar ·

Matryoshka Attribution classifica componentes

Publicado em 28 de setembro de 2026, o relato descreve uma técnica que ordena representações neurais ou mudanças de pesos de fine-tuning pela influência sobre o comportamento preservado sob intervenções suaves.

Publicado em 28 de setembro de 2026, o texto apresenta Matryoshka Attribution, técnica que aprende uma classificação aninhada de representações neurais ou de mudanças nos pesos de fine-tuning. O critério relatado é o comportamento que permanece preservado quando os componentes sofrem intervenções suaves.

Como resultado ilustrativo, o post afirma que reverter 1% dos pesos no Llama 3.1 8B remove a maior parte do comportamento de recusa. A técnica é apresentada como possível auxílio para localizar circuitos comportamentais e mudanças de pesos influentes no fine-tuning. Para avaliar o achado, consulte o post original e confira método, definição da intervenção e evidências experimentais; o resumo disponível não detalha esses elementos.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis