Estudo relaciona attention sinks e vales de compressão em LLMs
Experimentos com modelos de 410 milhões a 120 bilhões de parâmetros associam normas extremas de ativação do token de início de sequência, em camadas intermediárias, a compression valleys e attention sinks.
Publicado em 9 de outubro de 2025, o registro descreve experimentos em modelos de 410 milhões a 120 bilhões de parâmetros. Os autores relatam que normas extremas de ativação do token beginning-of-sequence em camadas intermediárias coincidem com compression valleys e attention sinks. Também propõem três fases de computação em Transformers; o resumo disponível nomeia mistura ampla e mistura limitada, mas não informa a terceira fase.
A proposta pode ajudar engenheiros a interpretar como a mistura de informações muda entre camadas, mas o registro não detalha métodos ou resultados quantitativos. Para conferir o alcance das conclusões, consulte o material original identificado pelo título e pela data de publicação e verifique nele os experimentos e a descrição completa das fases.