Artigo publicado em 8 de dezembro de 2025 relata que modelos de até 7 bilhões de parâmetros mantiveram a perda de pré-treinamento com cerca de 0,4% das conexões de atenção.
Publicado em 8 de dezembro de 2025, o artigo apresenta uma técnica de pós-treinamento que usa regularização de esparsidade com perda restringida para tornar esparsa a atenção em transformers. Segundo o texto, em modelos de até 7 bilhões de parâmetros, a abordagem manteve a perda de pré-treinamento original usando cerca de 0,4% das conexões de atenção.
O resultado pode interessar a engenheiros que estudam circuitos de atenção: a esparsidade é proposta como prior estrutural para interpretabilidade. O resumo disponível não detalha protocolo, métricas adicionais nem limites da avaliação. Para verificar o achado, consulte o artigo original pelo título e pela data de publicação e confira os métodos e resultados completos; se usar IA para estudá-lo, não envie dados pessoais ou informações internas sem avaliar a política da organização.