Publicado em 13 de julho de 2026, o resumo apresenta StreamDQ, uma arquitetura que desquantiza pesos de LLM em tempo real no die base da HBM, preservando a semântica convencional de load da GPU.
Publicado em 13 de julho de 2026, o resumo descreve StreamDQ, uma arquitetura de desquantização próxima à memória para inferência de LLMs em alto throughput. A proposta realiza a desquantização em tempo real no die base da HBM e, segundo o texto, preserva a semântica convencional de load da GPU.
O material sugere que engenheiros avaliando arquiteturas de inferência examinem essa abordagem. Para conferir escopo e resultados, consulte o paper original e compare suas afirmações com os métodos e avaliações nele descritos; o resumo não fornece métricas ou resultados experimentais. Se usar IA para estudar ou aplicar o trabalho, evite inserir pesos, dados internos ou outros materiais confidenciais e siga a política de dados da organização.