Publicado em 21 de agosto de 2026, o paper apresenta um benchmark com 10 aplicações agentic e relata que a inferência do modelo muitas vezes não é o principal gargalo de serving.
O paper apresenta o AgentSysBench, um benchmark que abrange 10 aplicações agentic. Segundo o resumo, a inferência do modelo muitas vezes não é o principal gargalo de serving nesses workloads. O trabalho avalia quatro frentes: serving sensível à tarefa, posicionamento de componentes atento à comunicação, descarregamento de estado e caching.
Os resultados sugerem que sistemas de serving para agentes talvez precisem otimizar modelos, ferramentas, memória e comunicação em conjunto, em vez de focar apenas na inferência. Para verificar o alcance dessas conclusões, consulte o paper original, incluindo sua metodologia, os workloads avaliados e os resultados por técnica; o resumo disponível não detalha métricas nem condições experimentais.