Publicado em 1º de setembro de 2026, o Radar resume um paper do arXiv: checar afirmações de manuscritos contra logs de execução reduziu para 4% a taxa relatada de alucinações graves.
Um post descreve um paper do arXiv sobre trabalhos produzidos pelos sistemas Agent Laboratory e Co-Scientist. Segundo o relato, quando módulos de confiabilidade foram removidos, os papers apresentaram alucinações graves de resultados. A data deste item do Radar é 1º de setembro de 2026.
No experimento descrito, verificar as afirmações do manuscrito contra logs de execução reduziu a taxa relatada para 4%. O caso destaca a importância de confrontar resultados gerados por agentes com evidências de execução. Para conferir o contexto, consulte o paper original no arXiv e verifique nele a metodologia, a definição de erro e como a taxa foi calculada.