A equipe WeChat Vision da Tencent anunciou modelos de embeddings multimodais voltados à compreensão e recuperação de texto, imagens e vídeos. A publicação também informa que engenheiros podem avaliá-los em tarefas de recuperação multimodal.
Em 26 de agosto de 2026, a equipe WeChat Vision da Tencent anunciou o WeMM-Embedding, uma família de modelos de embeddings multimodais. Segundo a publicação, os modelos dão suporte a buscas e recomendações envolvendo texto, imagens e vídeos.
O anúncio informa que engenheiros podem avaliar os modelos, descritos como open source, em tarefas de recuperação multimodal. Para conferir o escopo e os resultados, consulte a publicação original e verifique nela quais modelos, métodos e avaliações são apresentados; o material fornecido não detalha métricas ou resultados comparativos.