L'idée centrale de NeoMME est la retenue architecturale au service de la récupération. Un seul transformateur bidirectionnel ingère des tokens textuels multilingues ainsi que des patchs d'image bruts 32×32, supprimant la tour de vision séparée et le décodeur causal courants dans les architectures de type VLM. Entraîné de zéro avec un objectif de débruitage masqué, la variante 260M retourne des embeddings denses et d'interaction tardive en une seule passe. En pratique, cela signifie moins de composants en inférence, des budgets de latence plus serrés et une mise à l'échelle simplifiée. Sur des entrées appariées 2048×2048, le modèle encode environ 51 pages par seconde sur un L40S — environ deux fois le débit des récupérateurs de documents visuels largement utilisés — tout en maintenant une qualité de récupération compétitive pour les recherches réelles et les pipelines RAG.
Pourquoi est-ce important pour la recherche en entreprise ? La plupart des pipelines documentaires dépendent encore de l'OCR pour extraire des fragments de texte, puis tentent de reconstruire la sémantique de la mise en page en aval. NeoMME inverse cela : il récupère directement sur les images de pages, préservant les tableaux, graphiques et indices typographiques que l'OCR tend à aplatir. La conception à double tête offre une flexibilité de workflow : utilisez des vecteurs denses pour un rappel rapide via ANN, puis appliquez l'interaction tardive pour capturer les correspondances token-à-région sans charger un second modèle. Avec une fenêtre contextuelle de 16k tokens, une résolution d'image dynamique et des fonctionnalités modernes d'encodeur, NeoMME concentre le budget de paramètres là où la récupération en bénéficie le plus : contexte long, documents haute résolution et requêtes multilingues.
L'interaction tardive était historiquement coûteuse en stockage. Les pages haute résolution peuvent générer des milliers de vecteurs par document et des mégaoctets d'empreinte d'index par page. NeoMME atténue cela en combinant un regroupement hiérarchique des tokens (pour réduire le nombre de vecteurs) et une quantification asymétrique (pour compresser les vecteurs de documents plus agressivement que ceux des requêtes). Avec des configurations mesurées, l'empreinte passe d'environ des mégaoctets par page à des dizaines de kilo-octets — jusqu'à environ 6 kB par page dans un réglage plus agressif — tout en conservant la grande majorité de la qualité de récupération de base. La conclusion : vous pouvez vous permettre l'interaction tardive là où elle compte, même à grande échelle, sans exploser les budgets de stockage.
Pour les développeurs, le calcul du déploiement change. Des vitesses d'indexation proches de 51 pages par seconde par GPU réduisent radicalement le temps avant recherche pour de grandes archives et diminuent les coûts de rafraîchissement continu du corpus. Une seule passe produit à la fois des embeddings denses et d'interaction tardive, vous permettant de standardiser votre pipeline et de différer les compromis au niveau de l'index. Affinez avec Sentence Transformers pour des têtes denses ou d'interaction tardive spécifiques au domaine, ou conservez le point de contrôle généraliste et comptez sur la compression pour équilibrer coût et pertinence. En RAG visuel, récupérez d'abord les images de pages, puis transmettez les pages top-k à un VLM uniquement pour la génération de réponses — déléguant la majeure partie du travail lourd à un encodeur natif de récupération, léger.


