Publicado em 4 de setembro de 2026, o artigo apresenta um modelo baseado em LLM para detectar semanticamente o fim da fala em interações de voz full-duplex, com treinamento por janela deslizante.
O artigo apresenta o Phoenix-VAD, um modelo baseado em LLM para detectar semanticamente quando uma pessoa terminou de falar durante interações full-duplex em streaming. A abordagem descrita usa uma estratégia de treinamento com janela deslizante. O material se dirige a engenheiros que desenvolvem sistemas de diálogo por voz; não informa resultados quantitativos nem detalhes adicionais de avaliação no resumo disponível.
Para consultar e verificar o trabalho, procure o artigo original pelo título e confira nele a descrição do método, os experimentos e os resultados. Se usar IA para estudar ou aplicar o material, evite enviar transcrições identificáveis ou dados internos sem autorização; confira também a política de privacidade da organização.