Pular para o conteúdo
Rota Nacional

Radar ·

MaskGCT: TTS zero-shot com codec mascarado

Artigo publicado em 24 de outubro de 2024 apresenta o MaskGCT, modelo de conversão de texto em fala zero-shot. A publicação afirma que ele pode clonar uma voz com cinco segundos de fala.

Publicado em 24 de outubro de 2024, o artigo apresenta o MaskGCT, um modelo de conversão de texto em fala (TTS) zero-shot baseado em Transformer de codec mascarado. Segundo a publicação, o modelo pode clonar uma voz usando cinco segundos de fala. O projeto foi disponibilizado pelo Amphion; esse resultado é uma afirmação da publicação, não uma verificação independente neste resumo.

Engenheiros interessados em síntese de fala podem consultar o artigo e os materiais do projeto para examinar a abordagem e os requisitos de clonagem. Verifique as condições, métodos de avaliação e limitações nos materiais originais antes de tirar conclusões ou testar o sistema. Se usar IA para estudar ou aplicar a técnica, não envie gravações identificáveis sem autorização e avalie as políticas da organização para dados de voz.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis