Pular para o conteúdo
Rota Nacional

Radar ·

VoxCPM propõe síntese de fala sem tokenizer

Publicado em 31 de janeiro de 2026, o post apresenta o VoxCPM, sistema de text-to-speech baseado no MiniCPM-4, com arquitetura de difusão autorregressiva end-to-end.

O post de 31 de janeiro de 2026 descreve o VoxCPM como um sistema de text-to-speech sem tokenizer, baseado no backbone MiniCPM-4 e em uma arquitetura end-to-end de difusão autorregressiva. Segundo a publicação, o sistema oferece clonagem de voz zero-shot e geração de fala expressiva. A abordagem gera representações contínuas de fala, em vez de tokens discretos; engenheiros podem considerá-la ao explorar alternativas para TTS.

Para avaliar o resultado, consulte a publicação original e confira nela como as capacidades e a arquitetura são descritas; não há, no material apresentado, métricas de desempenho. Se usar IA para estudar ou aplicar essas ideias, evite enviar gravações, vozes ou textos com dados pessoais sem autorização e verifique as políticas da organização. A síntese de voz da Rota Nacional está em prévia.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis