Publicado em 25 de agosto de 2026, o texto descreve um módulo que usa hashes dos últimos N tokens para consultar embeddings multi-head e somá-los ao estado oculto de uma camada.
Publicado em 25 de agosto de 2026, o texto apresenta o Engram, um módulo que gera hashes dos últimos N tokens de entrada para recuperar embeddings multi-head. Um gate sensível ao contexto controla a contribuição, que é somada ao estado oculto de uma camada.
Segundo a publicação, a tabela de consulta pode ser transferida para a CPU com pouca lentidão na inferência. Engenheiros que estudam arquiteturas podem consultar o texto original para verificar esses detalhes e avaliar a proposta de acrescentar informações de n-gramas durante o pré-treinamento; o relato, por si só, não demonstra resultados comparativos.