Paper compara modelos byte e token destilados em escalas de até 1 trilhão de bytes de treinamento e relata um teto de desempenho maior para modelos byte conforme cresce o compute.
Publicado em 14 de setembro de 2026, o paper estuda modelos byte e token destilados em escalas de até 1 trilhão de bytes de treinamento. Apresenta métodos aproximado e exato para converter logits de tokens em logits de bytes e relata que modelos byte alcançam um teto mais alto à medida que aumenta o compute.
Os resultados podem orientar engenheiros que avaliam tokenização e destilação ao escalar modelos de linguagem, mas não determinam uma escolha universal. Consulte o paper original e confira nele os métodos, as condições experimentais e os resultados antes de aplicar a conclusão. Se usar IA para estudá-lo, evite inserir dados organizacionais confidenciais e verifique as respostas contra o texto original.