Pesquisa descreve isolamento de falhas em um serviço de GPU multi-processo e recuperação active-standby baseada em VMM; os autores relatam overhead de runtime zero para o mecanismo de isolamento.
Publicado em 27 de maio de 2026, o relato descreve um serviço de GPU multi-processo que combina isolamento no nível do driver com recuperação active-standby baseada em VMM. A proposta busca confinar falhas de MMU alcançáveis ao cliente afetado e permitir a recuperação do serviço. Seu escopo é o isolamento de falhas e a recuperação em workloads de GPU multi-processo.
Os pesquisadores relatam overhead de runtime zero para o mecanismo de isolamento. O relato não detalha, no material disponível, a metodologia de avaliação nem os limites desse resultado. Para verificar a afirmação, consulte a publicação original e examine as condições de teste, a definição de overhead e os cenários de falha avaliados.