Um framework descrito em 2024 usa um modelo de linguagem para avaliar documentos recuperados, selecionar trechos como evidência e analisar etapas de raciocínio antes de responder. Segundo a publicação, obteve desempenho comparável ao GPT-4 com 2 mil exemplos de treinamento gerados por esse modelo.
Um framework de autoavaliação para geração aumentada por recuperação (RAG) usa um modelo de linguagem para julgar a relevância dos documentos recuperados. Em seguida, seleciona trechos para citar como evidências e analisa essas etapas antes de produzir uma resposta.
Segundo a publicação de 30 de julho de 2024, o método alcançou desempenho comparável ao GPT-4 com 2 mil exemplos de treinamento gerados por ele. Esse resultado é o relatado pela publicação, não uma garantia para outros conjuntos de dados ou aplicações.
Para testar a abordagem, monte uma amostra representativa de perguntas e documentos e defina critérios claros de relevância e qualidade das evidências. Verifique se as citações sustentam cada afirmação e registre casos em que a recuperação ou a seleção falha.
Esse framework não elimina erros nem resolve por si só desafios de engenharia do RAG. Se usar IA para estudar ou aplicar o método, evite enviar dados pessoais ou documentos confidenciais, ou use um ambiente aprovado e as proteções de dados da sua organização.