Um post relata a redução do preview do Hy4 de 1,5 TB para 200 GB, com precisão ajustada por camada, e compara resultados em dois benchmarks.
Segundo o post, a Tencent reduziu o preview do Hy4 de 1,5 TB para 200 GB usando dados de calibração para definir a precisão de cada camada; algumas ficaram em 1,31 bit. A publicação relata pontuações de 83,2 no MCP Atlas e 81,3 no SWE-Bench Multi, ante 82,9 como referência de comparação.
O resultado ilustra uma troca relevante para engenheiros: quantização por camada pode reduzir o tamanho do modelo, mas deve ser avaliada junto ao desempenho em benchmarks e às necessidades da aplicação. Os números são os relatados no post e não demonstram, por si só, que a técnica terá o mesmo efeito em outros modelos ou tarefas. Ao estudar ou aplicar o material com IA, evite enviar dados internos ou pessoais sem autorização e aplique a política de proteção de dados da organização.