Método atribuído à Intel armazena pesos exatos de LLMs ternários a 1,485 bits por peso. O relato aponta até 18% mais throughput de decodificação em CPU e 27% em GPU.
O BITCOS é um método de compressão para LLMs ternários. Segundo o relato, ele usa os pesos zero para armazenar os pesos exatos a 1,485 bits por peso.
O texto também relata até 18% mais throughput de decodificação em CPU e até 27% em GPU. Esses números são resultados reportados, não uma garantia para qualquer modelo ou equipamento.
Para avaliar o método, confira as condições dos testes, incluindo modelo, hardware, qualidade da saída e consumo de memória. Compare-o com uma referência equivalente antes de decidir se serve para sua carga de trabalho.
Se usar IA para estudar ou aplicar o material, não envie dados pessoais, segredos ou informações internas sem autorização. Revise as saídas e valide os resultados no seu próprio ambiente: a técnica descrita não é uma solução de privacidade nem uma implementação fornecida pela Rota Nacional.