Uma família de reward models de 7B a 72B, baseada no EditReward-Bench, é apresentada como apoio ao treinamento por RL e supera o GPT-5 nesse benchmark, segundo o post.
Publicado em 25 de outubro de 2025, o post apresenta o EditScore, uma família de reward models com modelos de 7B a 72B parâmetros, baseada no EditReward-Bench. A proposta é avaliar e orientar edições complexas de imagens e viabilizar treinamento por aprendizado por reforço (RL). Segundo o post, o EditScore supera o GPT-5 no benchmark citado.
O resultado interessa a engenheiros que treinam sistemas de edição de imagens, mas a afirmação de desempenho se refere ao benchmark, não necessariamente a outros usos. Consulte o post original e o EditReward-Bench para verificar a metodologia, as métricas e as condições da comparação; não há mais detalhes no material fornecido. Se usar IA para estudar ou aplicar o método, evite enviar imagens ou documentos com dados pessoais sem autorização.