A Perplexity lançou pplx-embed-v2-late-0.6b e pplx-embed-v2-late-9b, dois modelos multimodais de recuperação que mantêm um vetor de 128 dimensões por token em vez de reduzir cada documento a um único vetor. A comparação usa MaxSim, permitindo que partes diferentes da consulta correspondam a partes diferentes do documento.

Os modelos podem pesquisar diretamente páginas renderizadas de PDFs, slides, capturas de ecrã, gráficos e tabelas, reduzindo a dependência de OCR. Um elemento particularmente útil é o espaço de embeddings partilhado: documentos podem ser indexados com o modelo 9B e as consultas em tempo real codificadas com o 0,6B.

A Perplexity reporta 63,5% nDCG@10 no ViDoRe V3 para essa configuração assimétrica, contra 62,3% usando apenas o modelo 0,6B. Estes números são avaliações da própria empresa e ainda precisam de validação independente. Ambos os checkpoints estão disponíveis no Hugging Face.

Referências