Publicado em 25 de junho de 2026, o relato aponta 34,29% para GLM 5.2 (Max reasoning), ante 34,08% para Opus 4.8 Max, e zero falhas em 84 tentativas do GLM 5.2.
O relato publicado em 25 de junho de 2026 diz que GLM 5.2 (Max reasoning) obteve 34,29% no PostTrainBench, pouco acima dos 34,08% de Opus 4.8 Max. Também informa que não houve falhas nas 84 tentativas do GLM 5.2.
Segundo a publicação, o ranking permite comparar pontuações e confiabilidade das execuções dos modelos. Para conferir o resultado, consulte a publicação original e verifique nela os números e o contexto do ranking; o relato não detalha outros resultados ou critérios.