Quantização de 10M de vetores EmbeddingGemma para 1 bit com MRL reduz RAM
Radar: relato de que 10 milhões de vetores EmbeddingGemma 2, quantizados para 1 bit e reduzidos a 256 dimensões com MRL, caíram de cerca de 30 GB para 0,4 GB de RAM, com perda de qualidade declarada de cerca de 5%.
Este item do Radar, publicado em 6 de outubro de 2026, relata que o autor armazenou 10 milhões de vetores EmbeddingGemma 2 usando quantização TurboQuant de 1 bit e redução MRL para 256 dimensões. Segundo o relato, o uso de RAM caiu de cerca de 30 GB para 0,4 GB. A perda de qualidade declarada é de cerca de 5%, o que corresponde a 94,5% de resultados mantidos quando se aplica rescoring.
O relevante é o trade-off concreto entre memória e qualidade na quantização de embeddings em sistemas de retrieval. Os números são do autor e não foram verificados pela Rota Nacional. Para conferir, consulte o post original pela referência do Radar e observe o método de medição, o conjunto de avaliação usado e a configuração de rescoring. Esse material não descreve um recurso da Rota Nacional.