Artigo propõe aproximar attention heads de Transformers com programas executáveis, calculando matrizes de atenção em exemplos de treino selecionados aleatoriamente e usando um modelo de linguagem pré-treinado.
O artigo propõe estudar componentes de redes profundas aproximando-os com programas executáveis. O foco são os attention heads de modelos de linguagem Transformer.
A abordagem calcula matrizes de atenção em exemplos de treino selecionados aleatoriamente e usa um modelo de linguagem pré-treinado. O texto apresenta essa estratégia como uma forma de ajudar engenheiros a estudar o comportamento dos componentes; não afirma que ela resolve todos os desafios de interpretabilidade.
Para explorar a ideia, identifique primeiro qual componente deseja investigar e quais exemplos de treino são adequados. Depois, examine as matrizes de atenção nesses exemplos e compare a aproximação programática com o comportamento observado, registrando limites e casos em que ela não representa bem o componente.
Se usar IA para estudar ou aplicar o método com dados da organização, evite incluir dados pessoais ou informações confidenciais sem autorização. Defina uma política para detectá-los e mascará-los, removê-los ou bloquear o envio, conforme o risco e as regras internas.