Um artigo formaliza painéis de avaliadores de modelos de linguagem sob um modelo de contaminação e propõe agregar as pontuações pela mediana geométrica. Os experimentos relatam 13 juízes e corrupção de até 50%.
O artigo formaliza a avaliação por painéis de juízes LLM sob um modelo de contaminação e apresenta o RoPoLL, método que agrega as pontuações usando a mediana geométrica. O trabalho relata experimentos com 13 juízes e taxas de corrupção de até 50%.
Para estudar a proposta, identifique primeiro como o artigo define contaminação e corrupção. Esses detalhes são importantes para interpretar o que os experimentos avaliam e para não generalizar os resultados além das condições testadas.
Em uma avaliação própria, compare a agregação pela mediana geométrica com a média usando o mesmo conjunto de respostas e critérios. Registre a composição do painel, as pontuações individuais e as condições de teste; isso ajuda a tornar a comparação verificável.
Se usar IA para resumir o artigo ou preparar essa análise, evite enviar dados pessoais, conteúdo confidencial de avaliação ou informações internas sem autorização. Prefira material público ou anonimizado e confira as conclusões com o texto original.