Publicado em 26 de setembro de 2026, o resumo relata que o Transformer-Within-Transformer substitui grupos contíguos de camadas semelhantes por camadas substitutas com attention. Em DINOv2, a abordagem teria usado cerca de metade do compute, com pequena queda de acurácia.
O bookmark descreve o Transformer-Within-Transformer (TWT), uma abordagem que identifica grupos contíguos de camadas semelhantes em Vision Transformers e os substitui por camadas substitutas com attention. O objetivo é reduzir a profundidade e o custo computacional do modelo, preservando a maior parte da acurácia relatada.
Para DINOv2, o resumo informa cerca de metade do compute e uma pequena queda de acurácia; não detalha métricas, configuração experimental ou método de avaliação. Para verificar o resultado, consulte a publicação original indicada no arquivo e confira como foram medidos compute e acurácia, quais tarefas foram avaliadas e em que condições. Se usar IA para estudar ou aplicar a técnica, evite enviar dados organizacionais sensíveis sem necessidade e aplique a política de privacidade da sua organização.