Perplexity a publié pplx-embed-v2-late-0.6b et pplx-embed-v2-late-9b, deux modèles de recherche multimodale qui conservent un vecteur de 128 dimensions par token au lieu de réduire chaque entrée à un seul vecteur. Le score MaxSim permet ainsi à différentes parties d'une requête de correspondre à différentes parties d'un document.

Les modèles peuvent rechercher directement dans des pages rendues de PDF, diapositives, captures d'écran, graphiques et tableaux, ce qui réduit la dépendance à l'OCR. Leur espace d'embeddings commun permet d'indexer les documents avec le modèle 9B puis d'encoder les requêtes en direct avec le modèle 0,6B.

Perplexity annonce 63,5% de nDCG@10 sur ViDoRe V3 dans cette configuration asymétrique, contre 62,3% avec le seul modèle 0,6B. Ces résultats proviennent de Perplexity et nécessitent encore une validation indépendante. Les deux checkpoints sont disponibles sur Hugging Face.

Références