O SimpleQA, apresentado em 30 de outubro de 2024, é um benchmark para avaliar factualidade e alucinações em modelos. Seu conjunto contém 4.000 perguntas factuais escritas por pessoas, cada qual com uma única resposta indiscutível.
Um autograder classifica as respostas dos modelos em três categorias: corretas, incorretas ou não tentadas. Dois anotadores verificaram as respostas de referência. Segundo a descrição publicada, engenheiros podem usar o benchmark para avaliar a factualidade com perguntas humanas e respostas verificadas.
Para experimentar a abordagem pela API da Rota Nacional, escolha um conjunto de perguntas do benchmark e mantenha suas respostas de referência em um arquivo controlado pela organização. Envie as perguntas ao modelo pela API, sem incluir dados pessoais desnecessários.
Compare cada resposta recebida com a referência e registre uma classificação: correta, incorreta ou não tentada. Não presuma que a Rota Nacional forneça o benchmark ou um autograder integrado; essa comparação é uma etapa da sua avaliação.
Confira o resultado verificando a contagem de cada categoria e revisando manualmente uma amostra das classificações. Consulte o material original do SimpleQA para confirmar o escopo, o método e as respostas de referência antes de tirar conclusões.