OPAL treina linear attention com as próprias saídas
A abordagem destila modelos de linear attention em contextos longos e, segundo o relato, recupera o retrieval de full attention e alcança 83–93% do desempenho em raciocínio matemático com 3 bilhões de tokens.
A OPAL, ou On-Policy Attention Linearization, treina modelos destilados de linear attention com as próprias saídas, em contextos longos e sob supervisão de um modelo teacher. A proposta é reduzir o custo de memória da attention sem perder desempenho em tarefas relevantes.
O relato afirma recuperação total da capacidade de retrieval de full attention e 83–93% do desempenho em raciocínio matemático, usando 3 bilhões de tokens. Esses resultados descrevem a abordagem apresentada; não demonstram que ela resolva, por si só, os desafios de implementação de cada organização. Se usar IA para estudar ou aplicar o método, evite inserir dados pessoais ou informações internas sem necessidade e siga a política de dados da sua organização.