Estudo avalia retrieval in-context em escala de um milhão de tokens
Um estudo examina modelos de linguagem como retrievers in-context em corpora de um milhão de tokens e relata que o BlockSearch generaliza até dez vezes além do comprimento usado no treinamento.
Publicado em 6 de julho de 2026, o estudo analisa modelos de linguagem como retrievers in-context em corpora de um milhão de tokens e investiga a generalização para comprimentos maiores. O post apresenta o BlockSearch, um retriever de 0,6 bilhão de parâmetros, e afirma que ele generaliza até dez vezes além do comprimento de treinamento.
A fonte sugere comparar retrieval in-context com retrieval baseado em vetores em escalas relevantes para sistemas práticos. Para avaliar o resultado, consulte o paper original e confira como foram definidos os dados, as medidas e os comprimentos de teste antes de aplicar a conclusão. Se usar IA para estudar ou testar o método, proteja dados internos e pessoais conforme a política da organização.