Pular para o conteúdo
Rota Nacional

Guias ·

SimpleQA avalia factualidade de modelos

Publicado em 30 de outubro de 2024, o SimpleQA reúne 4.000 perguntas factuais escritas por pessoas, cada uma com uma única resposta indiscutível. Um autograder classifica respostas como corretas, incorretas ou não tentadas; dois anotadores verificaram as respostas de referência.

O SimpleQA, apresentado em 30 de outubro de 2024, é um benchmark para avaliar factualidade e alucinações em modelos. Seu conjunto contém 4.000 perguntas factuais escritas por pessoas, cada qual com uma única resposta indiscutível.

Um autograder classifica as respostas dos modelos em três categorias: corretas, incorretas ou não tentadas. Dois anotadores verificaram as respostas de referência. Segundo a descrição publicada, engenheiros podem usar o benchmark para avaliar a factualidade com perguntas humanas e respostas verificadas.

Para experimentar a abordagem pela API da Rota Nacional, escolha um conjunto de perguntas do benchmark e mantenha suas respostas de referência em um arquivo controlado pela organização. Envie as perguntas ao modelo pela API, sem incluir dados pessoais desnecessários.

Compare cada resposta recebida com a referência e registre uma classificação: correta, incorreta ou não tentada. Não presuma que a Rota Nacional forneça o benchmark ou um autograder integrado; essa comparação é uma etapa da sua avaliação.

Confira o resultado verificando a contagem de cada categoria e revisando manualmente uma amostra das classificações. Consulte o material original do SimpleQA para confirmar o escopo, o método e as respostas de referência antes de tirar conclusões.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis