Pular para o conteúdo
Rota Nacional

Guias ·

BITCOS reduz pesos de LLMs ternários a 1,485 bits

Método atribuído à Intel armazena pesos exatos de LLMs ternários a 1,485 bits por peso. O relato aponta até 18% mais throughput de decodificação em CPU e 27% em GPU.

O BITCOS é um método de compressão para LLMs ternários. Segundo o relato, ele usa os pesos zero para armazenar os pesos exatos a 1,485 bits por peso.

O texto também relata até 18% mais throughput de decodificação em CPU e até 27% em GPU. Esses números são resultados reportados, não uma garantia para qualquer modelo ou equipamento.

Para avaliar o método, confira as condições dos testes, incluindo modelo, hardware, qualidade da saída e consumo de memória. Compare-o com uma referência equivalente antes de decidir se serve para sua carga de trabalho.

Se usar IA para estudar ou aplicar o material, não envie dados pessoais, segredos ou informações internas sem autorização. Revise as saídas e valide os resultados no seu próprio ambiente: a técnica descrita não é uma solução de privacidade nem uma implementação fornecida pela Rota Nacional.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis