Artigo analisa a evolução da memória de agentes de modelos de linguagem e aponta limites comuns nas avaliações atuais, que tendem a usar métricas de tarefas completas e tratar a memória como uma caixa-preta.
Publicado em 26 de junho de 2026, o survey examina a evolução da memória de agentes de modelos de linguagem para sistemas com armazenamento persistente, recuperação, atualização, consolidação e governança do ciclo de vida. O artigo observa que avaliações existentes costumam medir tarefas de ponta a ponta e tratar a memória como uma caixa-preta.
A análise pode ajudar engenheiros a identificar o que os benchmarks atuais medem — e o que deixam de medir. Para conferir os achados, consulte o artigo original e compare suas afirmações com os métodos e métricas dos benchmarks que ele discute; o resumo disponível não informa nomes de benchmarks nem resultados quantitativos.