Artigo publicado em 24 de outubro de 2024 apresenta o MaskGCT, modelo de conversão de texto em fala zero-shot. A publicação afirma que ele pode clonar uma voz com cinco segundos de fala.
Publicado em 24 de outubro de 2024, o artigo apresenta o MaskGCT, um modelo de conversão de texto em fala (TTS) zero-shot baseado em Transformer de codec mascarado. Segundo a publicação, o modelo pode clonar uma voz usando cinco segundos de fala. O projeto foi disponibilizado pelo Amphion; esse resultado é uma afirmação da publicação, não uma verificação independente neste resumo.
Engenheiros interessados em síntese de fala podem consultar o artigo e os materiais do projeto para examinar a abordagem e os requisitos de clonagem. Verifique as condições, métodos de avaliação e limitações nos materiais originais antes de tirar conclusões ou testar o sistema. Se usar IA para estudar ou aplicar a técnica, não envie gravações identificáveis sem autorização e avalie as políticas da organização para dados de voz.