WeMM-Embedding-9B mapeia modalidades em espaço comum
Publicado em 25 de agosto de 2026, o texto descreve um modelo que representa texto, imagens, vídeos e documentos visuais em um espaço compartilhado e afirma resultados de ponta no MMEB-v2 e no MMEB-v3.
Um post publicado em 25 de agosto de 2026 descreve o WeMM-Embedding-9B, da Tencent, como um modelo que mapeia texto, imagens, vídeos e documentos visuais em um espaço de embeddings compartilhado. Segundo o texto, o modelo alcança resultados de ponta nos benchmarks MMEB-v2 e MMEB-v3.
Esse tipo de representação pode ser útil em sistemas de recuperação que pesquisam conjuntamente conteúdo textual e visual. Para conferir o alcance das afirmações, consulte o post original e verifique os resultados e as condições de avaliação nos materiais dos benchmarks MMEB-v2 e MMEB-v3; o resumo não informa métricas nem detalhes dos testes.