Publicado em 23 de dezembro de 2025, o relato atribui ao algoritmo Squinch o uso de um quarto da largura de banda do IB, mantendo a MFU SOTA no pretraining em GCP H100-TCPX.
Um post da Character.AI afirma que a empresa usou Squinch, um algoritmo de compressão de gradientes, durante o pretraining em GCP H100-TCPX. Segundo o relato, o método manteve a MFU SOTA usando um quarto da largura de banda do IB.
O caso ilustra como a compressão de gradientes pode contribuir para a eficiência do treinamento quando a largura de banda da rede é limitada. Para conferir o método, as condições e o alcance das afirmações, consulte o post original da Character.AI e verifique os resultados no contexto descrito; o resumo disponível não traz detalhes adicionais de avaliação.