Publicado em 31 de janeiro de 2026, o post apresenta o VoxCPM, sistema de text-to-speech baseado no MiniCPM-4, com arquitetura de difusão autorregressiva end-to-end.
O post de 31 de janeiro de 2026 descreve o VoxCPM como um sistema de text-to-speech sem tokenizer, baseado no backbone MiniCPM-4 e em uma arquitetura end-to-end de difusão autorregressiva. Segundo a publicação, o sistema oferece clonagem de voz zero-shot e geração de fala expressiva. A abordagem gera representações contínuas de fala, em vez de tokens discretos; engenheiros podem considerá-la ao explorar alternativas para TTS.
Para avaliar o resultado, consulte a publicação original e confira nela como as capacidades e a arquitetura são descritas; não há, no material apresentado, métricas de desempenho. Se usar IA para estudar ou aplicar essas ideias, evite enviar gravações, vozes ou textos com dados pessoais sem autorização e verifique as políticas da organização. A síntese de voz da Rota Nacional está em prévia.