PARE-Bench avalia agentes proativos em apps com estado
Benchmark com 143 tarefas em simulações de comunicação, produtividade, agenda e estilo de vida testa objetivos, momento de intervenção e orquestração entre aplicativos.
O PARE-Bench avalia agentes proativos em simulações de aplicativos com estado. O PARE representa aplicativos como máquinas de estados finitos para simular usuários ativos.
O benchmark reúne 143 tarefas em apps de comunicação, produtividade, agenda e estilo de vida. Elas testam se um agente infere objetivos, escolhe quando intervir e coordena ações entre aplicativos.
Para usar o benchmark, comece identificando quais dessas capacidades são relevantes para o seu caso. Separe tarefas representativas e defina critérios observáveis para avaliar inferência de objetivos, momento da intervenção e coordenação entre apps.
Compare os resultados em interações sequenciais, não apenas em respostas isoladas: o estado anterior do aplicativo pode mudar o que uma ação significa. Se usar IA para estudar ou aplicar o material, evite inserir dados pessoais ou informações internas; use exemplos sintéticos e aplique as regras de proteção de dados da organização.