ARGUS investiga lentidão em treinamentos de grande escala
Paper publicado no arXiv em 19 de junho de 2026 descreve o ARGUS, que combina dados de CPU, do framework e de kernels de GPU para diagnosticar lentidão, com overhead contínuo abaixo de 2%.
Um paper publicado no arXiv em 19 de junho de 2026 descreve o ARGUS, sistema para diagnosticar lentidão em treinamentos de grande escala. A abordagem combina informações das stacks de CPU, a semântica do framework e dados de kernels da GPU. Segundo o texto, o overhead contínuo fica abaixo de 2%, e os eventos de kernel são comprimidos em cerca de 3.700 vezes.
O trabalho destaca a possível utilidade para engenheiros que executam treinamento distribuído e buscam identificar stragglers sem manter profiling detalhado sempre ativo. Para conferir escopo, método e resultados, consulte o paper original no arXiv e compare as métricas com as condições e definições apresentadas pelos autores.