Publicado em 29 de junho de 2026, o DiscoBench é apresentado como um benchmark para testar agentes de busca com LLMs diante de pedidos vagos, pouco especificados ou factualmente incorretos. A descrição não informa resultados de desempenho.
Publicado em 29 de junho de 2026, o DiscoBench é um benchmark para agentes de busca com modelos de linguagem. Ele avalia se esses agentes conseguem lidar com solicitações vagas, pouco especificadas ou factualmente incorretas durante tarefas de recuperação de informação e raciocínio em várias etapas. A proposta, segundo a descrição, é ajudar engenheiros a examinar o comportamento dos agentes em tarefas de busca do mundo real.
A descrição não apresenta pontuações, resultados comparativos nem detalhes do protocolo. Para verificar o escopo e eventuais resultados, consulte a publicação original e confira a definição das tarefas, os critérios de avaliação e os dados reportados; não é possível inferir conclusões de desempenho apenas a partir deste resumo. Se usar IA para estudar ou aplicar o benchmark, evite inserir dados organizacionais sensíveis sem autorização.