Publicado em 8 de novembro de 2025, o anúncio descreve um modelo de 3 bilhões de parâmetros para edição de áudio, síntese de fala multilíngue zero-shot e controle vocal por prompts.
Em 8 de novembro de 2025, a StepFun anunciou o Step-Audio-EditX, descrito como um modelo de 3 bilhões de parâmetros para edição de áudio. Segundo a publicação, ele também oferece síntese de fala multilíngue zero-shot e controle por prompts de emoção, estilo de fala e elementos vocais, como respirações e risadas. O anúncio informa execução em uma única GPU e licença Apache 2.0.
A proposta é avaliar um único modelo para geração de fala e edição iterativa de áudio. Esses recursos e condições são afirmações do anúncio; para verificá-los, consulte a publicação original e os materiais do projeto, confira a licença e teste os resultados com exemplos próprios. Se usar IA para estudar ou aplicar a abordagem, evite enviar gravações identificáveis sem autorização e avalie as regras de tratamento de dados da sua organização.