A publicação relata 92% de acerto no Big Bench Audio para um modelo de áudio com raciocínio, além de comparar o tempo até o primeiro token com e sem essa etapa.
A Artificial Analysis relata que o Gemini 2.5 Native Audio Thinking obteve 92% no Big Bench Audio, benchmark com 1.000 perguntas de áudio adaptadas do Big Bench Hard. Segundo a publicação, o modelo com thinking levou em média 3,87 segundos até o primeiro token; sem thinking, foram 0,63 segundo. Os números oferecem uma comparação de raciocínio e latência para modelos speech-to-speech, mas não determinam por si só qual modelo é mais adequado a cada tarefa.
Se você usar IA para estudar ou aplicar esses resultados, evite enviar gravações ou documentos com dados pessoais sem necessidade. Na Rota Nacional, a barreira detecta dados pessoais antes da execução e aplica a política da organização, como substituição por marcadores, remoção ou bloqueio. A transcrição de áudio já passa por essa barreira; recursos de voz estão em prévia. A plataforma não afirma que esses controles resolvem o problema de desempenho medido pelo benchmark.